GPT-6 Astra正式发布:OpenAI总裁宣告AGI时代到来,ARC-AGI-3从7.8%飙升至99.9%

9月3日凌晨,GPT-6 Astra正式亮相。OpenAI总裁Greg Brockman在发布会上宣告:”欢迎来到AGI时代。”9月5日,OpenAI全量推送了GPT-6 Astra,让付费用户们及时体验上了新模型。

和前几代大模型相比,GPT-6 Astra在多个关键基准上跑出了”饱和”的成绩。在研究级数学基准FrontierMath Tier 4跑到98分达到”饱和”;在强调陌生环境中学习与抽象推理的ARC-AGI-3上,从上一代GPT-5.6 Sol的7.8%直接跳到99.9%,实现了”从0到100″的突破;漏洞利用测试ExploitBench则直接满分100%。

但”会刷题”算不得什么,能干活才真有用。实际干活时GPT-6 Astra能做到”又快又省”——交付质量更高的同时,单次任务的Token消耗和任务耗时都明显低于上一代。Perplexity在自家AI研究智能体评估框架中测出,Astra的单次任务花销低于Anthropic的Fable 5.1。

在编程场景上,GPT-6 Astra在Terminal-Bench 4.0为57.9%,超过了Fable 5.1的55.8%,而GPT-5.6 Sol只有37.3%。网友们已经能拿它做出媲美真实游戏的作品,包括射击游戏、开放世界冒险游戏等,从建模和实际体验来看已可以算成品级别。

智能体维度上,GPT-6 Astra在OSWorld 2.0(真实桌面环境里看屏幕、点鼠标、敲键盘完成操作)达到72.6%;在跨系统业务流程的AutomationBench上从上一代的18.1%大幅提升至41.4%。完成一个计算机使用任务的平均耗时约40分钟,比上一代Sol的75分钟少了47%。

支撑这一跃迁的是又一次”大力出奇迹”:据外媒报道,GPT-6 Astra的训练动用了10万GPU的集群,是OpenAI迄今最大规模的一次训练。据报道,OpenAI采用了”循环深度”(recurrent depth)的架构技术,通过复用同一组网络层进行多次内部循环计算,中间推理在隐藏状态中完成,不会全部转化为输出文本,让模型”想得多但说得少”,实现又快又省。

不过GPT-6 Astra也有”偏科”表现。在人类终极测试(Humanity’s Last Exam)上成绩为57.2%,反而低于GPT-5.6 Sol与Fable 5.1。按照Artificial Analysis的通用智能指数,Astra为61.2,与Sol的60.9基本持平,被网友戏称”更贵版本的Sol”。

原文来源:《AGI来没来不好说但GPT-6真把Token省下来了》

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注