什么项目符合基准测试与研究分类?
收录数据集、评估框架、对比研究、研究原型、测量工具和涉及 Jev 的可复现实验。
浏览 bestjev 精选的 99 个 awesome 基准测试与研究 Jev 开源项目,对比 GitHub 仓库、Star、开发语言和实现方式。
开放的 0.6B 参数 Jev 复刻,支持并行决策、完整概率分布,并提供训练管道、权重、数据集和在线演示。
训练小模型,从动态文本选项列表中单次前向输出每个选项的概率;包含 Doom、国际象棋和 Wikispeedia 演示。
Apple Silicon 上用于教学的 Jev 风格视觉推理实验,采用共享上下文、直接候选评分和本地视觉演示。
从 Qwen3.5-2B 微调的 System One 风格模型,单次完成类型化决策并返回校准概率。
基于 Vercel eve 的个人助理 Agent,配置 100 个模拟工具,对比由 Jev 和 LLM 选工具时所需步骤。
小型开源决策模型:输入状态与类型化问题,输出校准概率;基于 Qwen3.5 复刻 Jev/System One。
用于比较浏览器 Agent 接口的 WebMCP 基准,将 Jev 作为被评测配置之一。
JevBench v1 - Jev 级类型化决策模型的基准:智能、便宜、快速、可靠、开放。
受 jevlike 启发,在 Apple Silicon 上通过 MLX 使用本地 Gemma 3 4B 单次评分选项,并附 Doom 演示。
让任意 MLX 模型在 Apple Silicon 上执行 Jev 风格并行约束决策,单次前向输出类型化、符合 Schema 的 JSON。
模拟 TypeSafe AI 结构化输出的 LLM Gateway,相当于一个“仿冒 Jev”。
基于 ModernBERT(151M)的非自回归决策引擎,提供校准不确定性、TypeSafe Jev 基准审计和浏览器 WebGPU 游乐场。
展示冻结 Qwen3-4B 上 Jev 风格类型化决策接口的 Mini-Jev:读取选项字母 Logits 而非生成 JSON,提供预注册实验、结果和教学基准。
Jev 复现方案,无需训练即可将任意 Qwen 模型变为快速决策模型,提供相同 /v1/systemone Schema 且不生成答案文本。
非官方研究:在 Apple Silicon 笔记本的原生 1.5B–8B 模型上执行 Jev 风格并行类型化决策,附基准、研究笔记和 Hugging Face Space 演示。
Jev 与 Gemini 3.8 Flash 对比:标注 1,000 条应用评论,报告速度快 4.1 倍、成本低 7 倍。
基准与研究项目评估 Jev 的行为、决策质量、校准程度、性能和实际取舍。
收录数据集、评估框架、对比研究、研究原型、测量工具和涉及 Jev 的可复现实验。
收录数据集、评估框架、对比研究、研究原型、测量工具和涉及 Jev 的可复现实验。
先查看项目用例、仓库活跃度、主要语言、许可证和可以确认的 Jev 实现。GitHub Star 只是特定日期的发现信号,不代表质量排名。
bestjev 会检查公开仓库、项目方文档、代码、演示和其他可见依据。实际使用前仍应到上游项目确认最新行为与兼容性。
bestjev 使用以下具名的一手来源作为分类依据: Jev 官方文档 · 公开 GitHub 仓库.
“Typed outputs that software can act on.”— TypeSafe AI