硬核跑分对决
换成博士级考题和抽象推理,分数立刻缩水:再强的模型也没人敢说满分。
前三
人类最后考试 HLE
: 约 2500 道跨学科博士级难题,号称最难基准,顶尖模型也只能答对三四成,离"碾压人类"还很远。
研究生级推理 GPQA
: GPQA Diamond 是化学物理生物的"防搜索"难题,如今第一梯队已逼近 90%,分差被压到毫厘之间。
抽象推理 ARC-AGI
: 被当作 AGI 试金石:人类轻松过六成,多数模型长期卡在个位到两三成,谁真会推理一目了然。
来源
Humanity's Last Exam
ARC Prize
打开完整版