困惑的趋势。基准测试已经饱和,存在针对测试优化甚至作弊的问题,而顶级模型之间的差距越来越小。根据 ArtificialAnalysis
和 LMArena 等第三方评测平台的数据,到二零二五年十月,Anthropic 的 Claude、谷歌的 Gemini、OpenAI
的 GPT 系列以及一些中国和西方的其他模型,在通用基准测试上的得分已经非常接近,差距往往在百分之几以内。(来源:Benedict Ev
本文转载自:今日头条
原文链接:http://m.toutiao.com/group/7575526217106768447/?upstream_biz=VolcEngine
本文由 XZ导师app 自动发布 | 发布时间:2026/7/26 14:33:29