排行榜上谁称王

两大公开榜单口径不同:LMArena 靠人类盲投,Artificial Analysis 靠综合跑分,冠军会打架。

前三

  1. LMArena 人类盲投: 百万网友两两匿名比稿投票算 Elo,Gemini 3 Pro 成为首个突破 1500 分的模型,拿下文本榜第一。
  2. 综合智能指数: Artificial Analysis 把十余项基准打包成一个 Intelligence Index,Gemini 3 Pro 登顶,GPT-5.1、Claude Opus 4.5 紧随其后。
  3. 榜单会骗人吗: "风格控制"、投票偏好长答案、针对性刷榜等争议,让 Elo 第一未必等于真实第一——这正是吵架的燃料。

来源

打开完整版