百度AI大重组:97年博士执掌大模型一号位,李彦宏收回指挥权

百度AI体系再度迎来重大组织调整。今年7月,29岁的复旦大学博士孙天祥出任基础模型研发部(BMU)负责人,并进入百度大模型决策机构模型委员会(BMC),让一名95后执掌大模型一号位在头部大厂中并不多见。

李彦宏持续收权

从王海峰一人身兼数职,到吴甜、贾磊双线并行,再到增设模型委员会统筹层,李彦宏不断收回大模型的指挥权。2025年11月新设的BMU和AMU均直接向李彦宏汇报,2026年5月增设的模型委员会也向其汇报。

文心一言面临的挑战

在QuestMobile 2026上半年AI原生APP用户规模榜单中,豆包月活3.82亿、千问1.67亿、DeepSeek 1.30亿、元宝4984万。前十名中文心已难觅踪迹。字节大模型业务ARR已达40亿美元,超过国内其他主要大模型公司ARR总和。

产品矩阵

百度近期发布了多款产品:百度搭子DuMate、代码智能体百度秒哒3.0、自我演化决策智能体百度伐谋2.0、全场景数字人平台百度一镜、AI办公产品库库AI。其中GenFlow月活用户已突破1亿,AI办公MAU超2500万,位居通用AI办公赛道行业第一。

市值压力

对比2021年市值高点,百度市值已蒸发超过5000亿元人民币。过去十年百度研发费用投入累计超过1000亿元,但过度注重技术、商业落地仍需提速的尴尬局面仍在持续。

原文链接:https://36kr.com/p/3943497841114504

智谱发布GLM-5.3:编程能力全面超越DeepSeek V4 Pro,网络安全能力登顶全球

智谱AI正式发布新一代基座模型GLM-5.3,总参数规模7530亿,在代码生成、复杂工程执行和网络安全能力方面实现重大突破。

性能全面领先

GLM-5.3采用混合专家(MoE)架构,每次运行仅激活440亿参数,实现更低推理成本和更快响应速度。核心成绩:DeepSWE编程基准66.9分超过DeepSeek V4 Pro的62.7分;Terminal Bench 3.0从上代4.6分暴涨到28.3分拿下开源第一;在国际漏洞推理评测CyberGym中以84.5%超过Mythos 5(83.8%)和GPT-5.6 Sol(83.6%)登顶全球。

网络安全重大发现

智谱联合清华大学、南开大学等团队,利用GLM模型累计发现漏洞2436个,其中1097个为中高危。重大发现包括:DNS协议潜伏40年的关键协议级漏洞、某国民级通讯APP的零点击漏洞(可让攻击者控制用户设备)、微软邮件与办公系统三大漏洞等。相关漏洞已提交CNNVD、CNVD等国家漏洞库。

与DeepSeek的路线之争

GLM-5.3和DeepSeek V4 Pro使用的是同一个方法论(后训练提升),但自进化路线截然不同:智谱追求模型自己变聪明(训练阶段进化),DeepSeek追求模型身体可以无限重组(推理阶段进化)。两者形成了国产大模型AGI赛道的初步交锋。

开源安全计划

智谱同步启动开源的盾计划,对重点开源项目开展持续安全审计,向社区免费提供模型额度及安全防御入口。

原文链接:http://m.toutiao.com/group/7673823798621258240/

月之暗面发布Kimi K2.7 Code高速版:输出速度达260Token/s,6倍速狂飙

月之暗面公司在发布Kimi 2.7 Code大模型之后,又迅速推出该模型的高速版,速度是常规版的6倍,为开发者带来更极致的编程体验。

性能数据

Kimi K2.7 Code高速版和常规版是同一个模型,但输出速度约为5-6倍。常规编程场景下输出速度约180 Token/s,短上下文场景可达260 Token/s。API定价为普通版的2倍,模型ID:kimi-k2.7-code-highspeed。

使用注意事项

使用Kimi K2.7 Code系列模型须打开思考模式(Thinking)以发挥最佳性能。API和Code均默认开启思考,如果手动关闭思考模式,API会报错,Code会回退到K2.6模型。预计7月起会陆续开放给Allegretto及以上会员。

Kimi融资与市场地位

月之暗面F轮融资超35亿美元,投后估值350亿美元,超额认购超3倍。G轮Pre-IPO以500亿美元投前估值提前启动。公司将加速算力投资、推进多模态能力和商业化。

月活数据

根据QuestMobile 2026上半年数据,Kimi月活729万,在国内AI原生APP中排名第九。虽然用户规模不及豆包、千问等,但在编程领域和专业用户群体中具有较强的口碑。

开放理念

Kimi表示:前沿智能应该更开放、响应更快、全球通用,而非成为一种特权。这一表态针对美国限制Anthropic Fable 5及Mythos 5模型对外开放一事。

原文链接:https://soft.china.com/article/2826289.html

阿里通义千问开源Qwen3.8-27B:27B参数干翻自家旗舰,Apache 2.0免费商用

阿里正式开源Qwen3.8系列模型,其中最引人注目的是Qwen3.8-27B——一个只有270亿参数的模型,基准测试全面超越了自家上一代旗舰Qwen3.7-Plus。

小参数大能量

27B参数在大模型军备竞赛动辄万亿参数的今天显得很克制,但性能一点都不弱:原生多模态、稠密模型、262K上下文窗口,还能通过YaRN扩展到100万tokens。能看图、能读超长文档、能处理复杂推理,参数小、跑得快、部署成本低。Apache 2.0许可,商用免费。

开源策略的深层逻辑

阿里把开源策略玩得明明白白:27B打旗舰,用中小参数模型证明参数不等于能力,让闭源API的定价逻辑更尴尬;Apache 2.0让开发者随便改随便商用,生态快速滚雪球;稠密架构在推理稳定性和延迟上仍有优势。

苹果合作

路透社消息称,苹果已专门针对中国市场训练出一款大语言模型,不是直接调用千问,而是在阿里巴巴的技术支持下自研。这一合作最早追溯到2025年2月蔡崇信在迪拜的首次确认,终于在2026年7月落下实锤。

千问办公开源MyContext

千问办公近日还开源了全新上下文基础设施MyContext,专为Agent打造。可在本地化方式下运行,将IM沟通、文档、会议记录自动沉淀为持续更新的专属工作档案。

原文链接:http://m.toutiao.com/group/7674786486243377699/

豆包内测社交功能:打通飞书账号,AI助手迈入熟人社交时代

字节跳动旗下AI助手豆包近日灰度测试社交功能,新增独立的对话页面,支持用户添加豆包好友或飞书好友,标志着AI助手正式切入社交领域。

核心变化

豆包新增了独立的对话页面,用户可添加豆包好友或飞书好友。当收到好友申请时,系统弹出新联系人申请提示,AI自动发送打招呼消息。已添加的人类好友会在对话列表中获得专属的人类标识。豆包端修改的头像、昵称等信息可同步至飞书。

打通飞书账号体系

豆包账号目前已支持登录飞书网页版,多数核心办公功能暂未开放。此次打通意在切入职场/办公社交的垂直场景,补齐工作场景短板。豆包坐拥超3亿月活的庞大用户基数,若未来进一步打通抖音账号体系,字节在AI时代的社交生态将更具想象力。

行业分析

业内人士认为,AI助手做熟人社交是一次大胆尝试。传统AI助手主要是人机交互,豆包此举将社交关系链引入AI场景,可能开创全新的产品形态。不过也有观点认为,AI社交能否真正满足用户需求仍需市场检验。

豆包市场地位

根据QuestMobile数据,2026年6月豆包月活高达3.82亿,位居国内AI原生APP用户规模榜首。千问月活1.67亿,DeepSeek 1.30亿,元宝4984万。

原文链接:http://blog.baiwanlian.cn/news/704d424195054.html

xAI发布Grok 4.6:综合智能暴涨23分跻身全球第三,性价比碾压同级

SpaceX旗下xAI发布Grok 4.6,综合实力大幅跃升。在评测机构Artificial Analysis的综合评价中,Grok 4.6 AA综合智能指数达61分,与GPT-5.6 Sol并列全球第三,较前代暴涨23分。

核心性能突破

Grok 4.6在智能体工作能力方面表现顶尖。GDPval-AA v2真实业务测评得分62%,仅次于Claude Opus 5。τ3-Banking金融工具测评51%,与阿里巴巴求文Max 3.8并列第一。完成同类任务平均仅需53轮交互、5亿输入token,消耗远低于Claude Opus 5,具备显著的综合成本优势。

定价不变

尽管性能大幅提升,Grok 4.6定价未上调:输入2美元/百万token、输出6美元。这一价格远低于同分的GPT-5.6 Sol,被认为具有超越单价的结构性成本优势。

四大天王争霸格局

2026年全球AI第一梯队形成清晰的生态位分化。OpenAI GPT-5.6通用能力领先但价格最高;Anthropic Claude代码能力全球第一但多模态较弱;谷歌Gemini多模态全能且深度整合生态;xAI Grok 4.6实时数据之王且性价比最高。Grok系列全球唯一实时接入X平台数据,月活用户突破8000万,API调用量同比增长1200%。

原文链接:http://m.toutiao.com/group/7674834519409328649/

Google发布Gemini 3.7 Flash:编码能力大幅跃升,价格砍半

Google于8月中旬发布最新AI模型Gemini 3.7 Flash,在编码和智能体工作流方面取得重大突破,同时价格较前代降低50%。

核心性能指标

Gemini 3.7 Flash在DeepSWE编码基准上得分65.3%,远超前代3.6 Flash的49.0%。输出速度达每秒340个token,处于兼顾智能与推理速度的帕累托最优曲线。AA智能指数56分。

定价策略

引入期定价至2026年末:输入0.75美元/百万token、输出3.75美元/百万token,仅为3.6 Flash原价的一半。但需注意这是introductory pricing,2027年1月1日起将翻倍至1.50/7.50美元。

已接入主流开发工具

Gemini 3.7 Flash已上线GitHub Copilot,支持更复杂的多代理工作流。同时在Google Search AI Mode中可用,面向Pro和Ultra订阅用户。Google表示该模型在指令遵循和意图理解方面显著改进。

Google I/O 2026回顾

此前Google I/O 2026发布了13项重大更新,包括Gemini 3.5 Flash免费开放(月活突破9亿)、Gemini Omni多模态创作模型、Google搜索25年来最大改版(全面AI化)、Android XR智能眼镜等。Gemini 3.5 Pro(代号Cappuccino)编程能力已达GPT-5.5的92%,成本仅为其1/8。

原文链接:https://news.google.com/stories/CAAqNggKIjBDQklTSGpvSmMzUnZjbmt0TXpZd1NoRUtEd2k2NzRqZ0VSSG8tVHpMUUZ1UmFDZ0FQAQ

DeepSeek V4 Pro正式版发布后涨价引争议:API费用涨幅50%至1100%

DeepSeek在发布V4 Pro正式版后,于8月17日0点起实施新一轮API调价,全面引入峰谷分时定价机制,整体价格较此前出现大幅上调,引发行业广泛讨论。

涨价幅度惊人

全计费项涨幅区间为50%至1100%,其中高峰时段缓存命中输入费用将激增近12倍。业界指出此举可能动摇其低成本实用型AI的市场定位。此前DeepSeek一直以极具竞争力的低价策略著称,此次大幅涨价令不少开发者和企业用户措手不及。

V4 Pro正式版技术实力

DeepSeek V4 Pro的AA智能指数达53分,排名第七。单任务成本仅6美分,在104个模型中位居第二。同步发布的DeepSeek Harness框架采用一切皆插件设计理念,核心微内核只负责插件的加载、卸载和依赖管理,支持运行时热插拔。

与智谱GLM-5.3的正面对决

在编程能力上,GLM-5.3的DeepSWE得分66.9分超过V4 Pro的62.7分;Terminal Bench 3.0从5.2的4.6分暴涨到28.3分拿下开源第一。两者使用同一个后训练方法论但路线不同:DeepSeek走插件化自进化,智谱走模型内部自进化。

市场反应

DeepSeek涨价当日,智谱股价反而被市场解读为利好。投资者认为DeepSeek涨价给开源模型留出了价格空间,智谱的商业化压力有所缓解。

原文链接:http://m.toutiao.com/group/7674912746688840198/

Anthropic为Claude生成内容全面添加水印引发争议:用户大量退订

Anthropic近日宣布为其聊天机器人Claude生成的文本添加水印,引发用户强烈反弹,数十名用户在社交平台表示取消订阅。

水印技术如何工作

该技术通过微妙调整用词实现,变化虽难以被人眼察觉,但能形成可通过工具检测的模式。Anthropic表示此举旨在响应欧盟《人工智能法案》要求AI公司对生成内容进行标记。谷歌、Meta、微软、OpenAI等也已承诺遵守相关规范。

用户反弹与争议焦点

部分用户担心AI辅助写作将被打上永久性标签。自消息公布以来,已有数十名用户在X平台表示取消Claude订阅。捷克开发者因担心交付给客户的代码带有AI标签引发版权归属质疑而退订。乔治亚州AI顾问即使仅用Claude进行编辑的内容也被加水印,称这让人无法接受。

水印过度标记问题

Anthropic澄清水印仅表明Claude处理过文本。但资深技术顾问发现Claude有时会抢功,将仅由其边缘参与的内容标记为100%创建或共同创作。扫描过去一年项目发现约十几个此类错误标记案例,多集中在最近几周。

CEO首次公开回应监管质疑

正值Anthropic冲刺IPO(预估2026年10月以约2万亿美元估值上市),CEO达里奥·阿莫迪首次公开回应外界对其监管立场的质疑。此外,Anthropic 7月推出教师专用版Claude for Teachers,专业版免费开放给美国教师。

原文链接:http://m.toutiao.com/group/7674849347766354458/

OpenAI推出GPT-5.6 UltraFast极速模式:每秒750个token,提速14倍

全球大模型竞争白热化,OpenAI近日为GPT-5.6 Sol模型新增UltraFast极速模式预览版,实现每秒输出750个token,最高提速14倍,且宣称无损原生智能。

UltraFast极速模式详解

OpenAI通过与Cerebras合作实现超高速推理输出。这一模式专门针对对响应速度要求极高的应用场景,如实时客服、代码补全、流式生成等。关键优势在于速度提升的同时保持与标准模式相同的智能水平,不牺牲推理质量。

全球大模型竞争格局

当前全球大模型第一梯队呈现差异化竞争态势:

Grok 4.6(xAI):综合智能指数61分,并列全球第三。智能体工作能力顶尖,GDPval-AA v2得分62%位列第二。定价未上调:输入2美元/百万token、输出6美元。

Gemini 3.7 Flash(Google):AA智能指数56分,输出速度每秒340token。定价优惠期至2026年末:输入0.75美元/百万token、输出3.75美元。

DeepSeek V4 Pro 0813:AA智能指数53分,单任务成本仅6美分位居第二。但宣布上调API费用,高峰时段缓存命中输入费用将激增近12倍。

Anthropic保持沉默

Anthropic暂无新品发布。据传Fable 5.1已完成开发,按4-8周的发布节奏,8月下旬至9月初可能有新品面世。

原文链接:https://finance.sina.com.cn/stock/t/2026-08-17/doc-ininqxur7013943.shtml