中文大模型基准测评2025年上半年报告

评说明及示例5.测评模型列表 SuperCLUE全球大模型中文综合能力排行榜(2025年7月) 本次测评
包括六大任务:数学推理、科学推理、代码生成(含we b开发)、智能体A g e n t(多轮工具调用)、
幻觉控制、精确指令遵循。题目量为1288道新题,最终得分取各任务平均分。 •o3以73.78的总分取得总
榜第一,领跑全球。 海外头部模型o3、o4-mini(high)和Gemini-2.5-Pro在本次七月


本文转载自:发现报告
原文链接:https://www.fxbaogao.com/detail/4985586

本文由 XZ导师app 自动发布 | 发布时间:2026/7/26 14:33:07