基准评测 · JevBench v1.3.0

Jev models,放在同一套评测里比较。

查看 System One 决策模型的公开测试结果,比较综合分数、判断能力、概率校准、速度与成本。数据来自独立评测,帮助你为自己的任务选模型。

精选排名

Jev model 基准分数

以下为公开榜单中的代表性系统。综合分数对判断能力、校准、速度与成本各赋 25% 权重;榜单完整排名与可交互比较请查看来源。

查看完整榜单
排名模型 / 系统综合分判断校准速度每 1,000 次成本
#1Jev 1.13.0TypeSafe AI74.485.782.783.3$0.040Published price
#2SemIfQwen3.5-4B · open rebuild73.179.072.683.7~$0.022Estimated
#3djevMaisa · DiffusionGemma73.082.765.491.4~$0.026Announced price
#11OpenJevDiffusionGemma 26B-A4B66.479.264.883.2~$0.066Estimated
#33LayaModernBERT-large54.445.862.571.1~$0.003Estimated

成本单位为美元 / 1,000 次完整判断。估算成本和已公布但尚未收费的价格均单独标出;这是第三方基准测试,不代表 Jev AI Model 的 API 售价或你实际工作负载的成本。

来源:Benchmark Heaven · JevBench v1.3.0 · 榜单快照日期:September 21, 2026

如何阅读这些数字

适合哪种工作负载?

综合分数用于快速了解同一套任务下的相对表现。上线前,仍应使用自己的样本验证准确率、置信度阈值、延迟与计费。

判断能力

正确完成决策任务的程度。

概率校准

置信概率与实际表现是否匹配。

速度与成本

吞吐和单次判断的代价。

现在试试 Jev AI Model

用自己的样本验证一次。

登录后免费使用在线 Playground。API 调用可在价格页面购买积分。

Jev 是 TypeSafe AI 发布的模型。Jev AI Model 是独立的在线体验与 API 服务;本页引用第三方评测,仅作参考,不代表模型提供方或评测方背书。