AI如何吞噬世界:泡沫、瓶颈和变革

困惑的趋势。基准测试已经饱和,存在针对测试优化甚至作弊的问题,而顶级模型之间的差距越来越小。根据 ArtificialAnalysis
和 LMArena 等第三方评测平台的数据,到二零二五年十月,Anthropic 的 Claude、谷歌的 Gemini、OpenAI
的 GPT 系列以及一些中国和西方的其他模型,在通用基准测试上的得分已经非常接近,差距往往在百分之几以内。(来源:Benedict Ev


本文转载自:今日头条
原文链接:http://m.toutiao.com/group/7575526217106768447/?upstream_biz=VolcEngine

本文由 XZ导师app 自动发布 | 发布时间:2026/7/26 14:33:29

GPT-5卫冕榜首!工具调用能力成AI新战场丨大语言模型10月最新榜单揭晓

于 2025-11-11 13:56:16 修改 · 982 阅读
大模型技术在全球范围内持续演进,各大科技公司纷纷推出新一代模型,重点
强化智能体方向的核心能力,包括编程、工具使用和深度信息检索等,无一不在提升实际问题解决能力。伴随着技术升级,越来越多能够解决实际问题的智
南持续关注大模型的发展动态,近期针对国内外主流大语言模型 进行了全面评测,现公布司南最新(即10月)大语言模型评测榜单!本次榜单囊括了国


本文转载自:CSDN博客
原文链接:https://blog.csdn.net/OpenCompass/article/details/154684488

本文由 XZ导师app 自动发布 | 发布时间:2026/7/26 14:33:29

文心5.0 Preview大模型登榜LMArena:全球第二国内第一

开资料显示,文心大模型最早于2019年对外发布,而文心5.0是百度于2025年11月正式推出的原生全模态大模型。其参数量高达2.4万亿,
采用原生全模态统一建模架构,具备对文本、图像、音频、视频等多种模态信息的深度融合理解与生成能力,支持跨模态输入输出,为复杂场景下的智能交
互提供技术基础。在实际应用层面,ERNIE-5.0-Preview-1203展现出对用户意图的精准把握能力。无论是在结构化长文生成、多轮
本文作者:CNMO科技


本文转载自:今日头条
原文链接:http://m.toutiao.com/group/7586912381213655587/?upstream_biz=VolcEngine

本文由 XZ导师app 自动发布 | 发布时间:2026/7/26 14:33:27

LMArena中文榜大洗牌:国产大模型包揽前列,GPT-4 Turbo跌出百名开外

-14
就在百度世界大会前夕,全球最具影响力的大模型评测平台LMArena发布的最新排名,让海外开发者社
了”Baidu is back?”的惊叹。这份发布于2025年11月初的榜单显示,国产大模型在中文竞技场
上实现了对国际顶尖模型的全面反超,这一突破性进展恰如其时地展现了中国AI技术的迅猛发展。
在LMAren
a最新发布的排名当中,文心全新模型ERNIE-5.0-Preview-1022首次上榜,就登上了文本排行


本文转载自:稀土掘金
原文链接:https://juejin.cn/post/7572389069706526730

本文由 XZ导师app 自动发布 | 发布时间:2026/7/26 14:33:26

11月中文大模型测评结果:GPT-5.1称霸,DeepSeek引领开源潮流

在科技飞速发展的今天,人工智能领域的竞争愈发激烈。2025年11月28日,SuperCLUE正式发布了
2025年中文大模型基准测评的结果,吸引了业界的广泛关注。本次测评涵盖了数学推理、科学推理、代码生成(包
括Web开发)、幻觉控制及精确指令遵循等五大核心任务,共设置了822道全新题目,旨在全面评估各大模型的能
力和表现。
这场测评不仅是对模型技术的较量,更是对人工智能发展趋势的深刻反映。参与此次测评的有27个国内
本文作者:洞见繁华


本文转载自:手机搜狐网
原文链接:https://m.sohu.com/a/959577323_121956424/

本文由 XZ导师app 自动发布 | 发布时间:2026/7/26 14:33:26

大模型专题:2025大语言模型推理能力榜:中文语境下“最强大脑”测评揭晓

大模型专题:2025大语言模型推理能力榜:中文语境下“最强大脑”测评揭晓
猫丽猫
2025-11-24 15:46
今天分享的是:大模型
专题:2025大语言模型推理能力榜:中文语境下“最强大脑”测评揭晓
报告共计:15页
《2025大语言模型推理能力榜:中文语境下“最强大
脑”测评揭晓》由香港大学商学院人工智能评估实验室发布,通过系统化评估框架对中美36款大语言模型的推理能力与效率进行全面测评,涵盖14款推
本文作者:猫丽猫


本文转载自:手机搜狐网
原文链接:https://m.sohu.com/a/957870310_122028282/

本文由 XZ导师app 自动发布 | 发布时间:2026/7/26 14:33:25

[流言板]11月中文大模型基准测评出炉:GPT 5.1夺冠

:10
虎扑11月28日讯 SuperCLUE公布了2025年11月中文大模型基准测评结果。
本次测评围
绕数学推理、科学推理、代码生成(含web开发)、幻觉控制、精确指令遵循五大核心任务展开,题目总量为822
道新题,最终得分取各任务平均分。
本次共测评27个国内外大模型同台竞技,OpenAI的GPT 5.1与国
产模型DeepSeek分别斩获综合冠军与开源领域第一。
OpenAI的GPT-5.1 (high) 以6


本文转载自:虎扑
原文链接:https://m.hupu.com/bbs/636006496.html

本文由 XZ导师app 自动发布 | 发布时间:2026/7/26 14:33:25

11月中文大模型基准测评出炉:GPT 5.1夺冠、DeepSeek开源第一

快科技11月28日消息, SuperCLUE公布了2025年11月中文大模型基准测评结果。
本次测评围
绕数学推理、科学推理、代码生成(含web开发)、幻觉控制、精确指令遵循五大核心任务展开,题目总量为822
道新题,最终得分取各任务平均分。
本次共测评27个国内外大模型同台竞技,OpenAI的GPT 5.1与国
产模型DeepSeek分别斩获综合冠军与开源领域第一。
OpenAI的GPT-5.1 (high) 以6


本文转载自:太平洋科技
原文链接:https://g.pconline.com.cn/x/2026/20265812.html

本文由 XZ导师app 自动发布 | 发布时间:2026/7/26 14:33:24

SuperCLUE智能指数

耗时代表着更快的响应效率与更好的交互体验。
中文通用大模型评测中,生成耗时指模型完成一次问答的平均用时(
CPM4.1-8B
数字排行榜
开源/闭源 2 ▼
测评使用方式 2 ▼
SuperCLUE通用榜-总排
行榜-2025年9月
为减少波动影响,榜单将分差1分值内的模型视为并列排名。国外模型与部分国内模型不参与
排名,只做参考。
排名
模型名称
机构
开/闭源
总分
数学推理
幻觉控制
科学推理
精确指令遵循
代码


本文转载自:SuperCLUE
原文链接:https://superclueai.com/homepage

本文由 XZ导师app 自动发布 | 发布时间:2026/7/26 14:33:20

中文大模型基准测评2025年9月报告

中文大模型基准测评2025年9月报告
最新推荐文章于 2026-06-18 14:37:31 发布
转载
于 2025-11-02 15:00:11 发布 · 900 阅读
2025年9月,独立第三方AGI测
评机构SuperCLUE发布中文大模型基准测评报告,基于数学推理、科学推理、代码生成、智能体Agent、
精确指令遵循、幻觉控制六大任务,对33个国内外大模型展开评估。
关注公众号:【互联互通社区】,回复【AI


本文转载自:CSDN博客
原文链接:https://blog.csdn.net/kymdidicom/article/details/154324300

本文由 XZ导师app 自动发布 | 发布时间:2026/7/26 14:33:19