榜单更新,大模型密集发布周,究竟孰强孰弱?|xbench月报

榜单更新,大模型密集发布周,究竟孰强孰弱?|xbench月报
红杉汇
2026-04-28 08:06

行业技术迭代方向 – 提升模型的原生多模态能力已成为大厂主流叙事,视觉理解正被接入复杂任务执行链条 [1
施能力 [3] xbench-ScienceQA榜单评测结果 (2026年4月) – GPT-5.5
以平均分73.0并列第一,较GPT-5.4 Pro的72.2分提升0.8分,其BoN(N=5)从77.0


本文转载自:Reportify
原文链接:https://reportify.cn/social-media/799506448573474

本文由 XZ导师app 自动发布 | 发布时间:2026/7/26 14:33:59