跳到主要内容
ORIEL
方法

方法

Oriel 不做评测,只做记录与呈现。所有数据来自 Artificial Analysis,下面说明这些数字是什么、以及哪些地方需要谨慎解读。

数据来源

全部数据来自 Artificial Analysis 的公开 API,每天北京时间凌晨 5 点抓取一次,直接提交进本站仓库。Oriel 自己不跑任何评测,也不对分数做加权、修正或重新标定——你在这里看到的数字和上游发布的一致。

智能指数

智能指数是 Artificial Analysis 把多项基准测试合成的单一分数,当前为 v4.3。关键的一点:不同版本的分数不可比较。上游换版时会重新标定全部模型,所以本站的趋势线在版本边界会断开,而不是连成一条看起来平滑但没有意义的曲线;同理,跨版本的分数变动也不会计入变化流。

性价比怎么算

性价比 = 可用评测分的平均值 ÷ 每百万输出 token 价格

这是 Oriel 自己的推导,不是上游数据。只有当模型至少有两项评测分、且有输出价时才计算——只有一项分数时这个比值噪音太大,一个只测过智能指数的便宜小模型会凭空登顶。它衡量的是「每块钱买到多少分」,不代表这个模型适合你的场景。

覆盖率

673 款语言模型里,只有一部分被测过每一项。智能指数 664、编程 259、智能体 156、价格 444、性能 333。破折号的意思是「没测」,不是「测得差」——这两件事完全不同,所以本站在选定某个维度时会把没有该项数据的模型移出榜单,而不是让你对着几百行破折号猜。

历史

每日快照从 2026年7月23日 开始积累,目前 62 天。更早的数据是从本仓库的 git 历史里回填的——在此之前每天的抓取都直接覆盖了前一天。历史还很短,趋势图和变化流需要几周才会真正有料;数据点不足时它们会明说,而不是画一条误导性的线。

竞技场排名

媒体榜单是人类两两对比投票算出的 Elo,附带 95% 置信区间。误差条重叠的模型之间,名次先后没有统计意义——第 3 名和第 7 名可能根本分不出高下。本站把误差条画出来就是为了让这件事看得见,而不是只给一列干净的名次。

已知局限

语音转文本榜的词错误率指数只发布到 1 位小数,大量模型并列在同一个值上,那份榜单实际排不出先后,本站会在页面上标出并列数量。性能数据(吞吐、延迟)是特定时间从特定线路测得的中位数,会随服务商的负载和你的地理位置变化。价格只算基础 token 计费,不含批量折扣、承诺用量或缓存策略带来的实际差异。