。
在此测评集中,对来自16家公司的52个不同版本的模型进行了测试。模型得分的分布情况如下:
01
ScienceQA榜单分析
截至20
25年9月初,与7月发布的Leaderboard相比,有6家模型发布的版本更新进入前10:
GPT-5-high:
OpenAI的最新模
型GPT-5,相较于此前最强的o3-high,平均分从60.8提升到64.4,BoN(N=5)基本无变化。
Qwen3-235B-A22
本文由 XZ导师app 自动发布 | 发布时间:2026/7/26 14:28:50