判断能力
正确完成决策任务的程度。
基准评测 · JevBench v1.3.0
查看 System One 决策模型的公开测试结果,比较综合分数、判断能力、概率校准、速度与成本。数据来自独立评测,帮助你为自己的任务选模型。
精选排名
以下为公开榜单中的代表性系统。综合分数对判断能力、校准、速度与成本各赋 25% 权重;榜单完整排名与可交互比较请查看来源。
| 排名 | 模型 / 系统 | 综合分 | 判断 | 校准 | 速度 | 每 1,000 次成本 |
|---|---|---|---|---|---|---|
| #1 | Jev 1.13.0TypeSafe AI | 74.4 | 85.7 | 82.7 | 83.3 | $0.040Published price |
| #2 | SemIfQwen3.5-4B · open rebuild | 73.1 | 79.0 | 72.6 | 83.7 | ~$0.022Estimated |
| #3 | djevMaisa · DiffusionGemma | 73.0 | 82.7 | 65.4 | 91.4 | ~$0.026Announced price |
| #11 | OpenJevDiffusionGemma 26B-A4B | 66.4 | 79.2 | 64.8 | 83.2 | ~$0.066Estimated |
| #33 | LayaModernBERT-large | 54.4 | 45.8 | 62.5 | 71.1 | ~$0.003Estimated |
成本单位为美元 / 1,000 次完整判断。估算成本和已公布但尚未收费的价格均单独标出;这是第三方基准测试,不代表 Jev AI Model 的 API 售价或你实际工作负载的成本。
来源:Benchmark Heaven · JevBench v1.3.0 · 榜单快照日期:September 21, 2026
如何阅读这些数字
综合分数用于快速了解同一套任务下的相对表现。上线前,仍应使用自己的样本验证准确率、置信度阈值、延迟与计费。
正确完成决策任务的程度。
置信概率与实际表现是否匹配。
吞吐和单次判断的代价。
Jev 是 TypeSafe AI 发布的模型。Jev AI Model 是独立的在线体验与 API 服务;本页引用第三方评测,仅作参考,不代表模型提供方或评测方背书。