模型的真实偏好排名。
这套机制的优势,恰恰戳中了传统评测的痛点。
它完全规避了针对榜单的专项优化,没有晦
、代码等不同场景分为多个榜单,我们以文本为例,看看各大模型的最新得分:
2026年3月|LM Arena
全球盲测Top20
(实时快照·Elo评分·含置信区间)
1. Claude Opus 4.6 Thin
king(Anthropic):1507±8
2. Gemini 3.1 Pro Preview(Goo
本文作者:科技浮世绘
本文转载自:网易新闻客户端
原文链接:https://c.m.163.com/news/a/KOAS0Q3F0531AFC0.html
本文由 XZ导师app 自动发布 | 发布时间:2026/7/26 14:33:48