正在阅读:

AGI,真的来了?

扫一扫下载界面新闻APP

AGI,真的来了?

GPT-6 Astra来了,OpenAI还要追Anthropic。

文|AIX财经 雷晶

编辑|金玙璠

9月3日凌晨,预热已久的GPT-6 Astra正式发布。

发布前半个月,OpenAI一直在为这款模型的发布释放信号。8月18日,在判断Astra可能达到“Critical”网络安全能力阈值后,公司放慢部分前沿模型训练,并暂停两周面向部署模型的强化学习训练,用来加强监控、对齐和研究环境安全。9月1日,OpenAI进一步披露Astra的安全评估情况。几轮信息提前放出之后,GPT-6 Astra在正式发布前已经积累了不少关注。

但发布之后,大部分用户暂时还用不了。目前,GPT-6 Astra只向少量机构开放,Plus、Pro、Business等付费用户将在未来几天陆续获得访问权限,API也会逐步开放。面对用户的等待,OpenAI很快给出了一套补偿方案。Codex负责人Tibo表示,付费用户每有一天无法使用Astra,就会获得一次可以留到之后使用的额度重置。这也缓解了部分用户对延迟开放的不满。

回到模型本身,这次更新最值得关注的变化主要有两个:模型更能直接操作电脑,也更擅长完成复杂任务。OpenAI称GPT-6 Astra是目前最智能的模型,相比GPT-5.6 Sol,它在软件工程、科研、网络安全和专业工作等方向都有提升,计算机操作进步尤其明显。

API的价格也提高了。GPT-6 Astra的API价格为每百万Token输入10美元、输出50美元,是GPT-5.6 Sol的2.5倍,与Anthropic最新旗舰Claude Fable 5.1处在同一价格水平。OpenAI还提供Fast Mode,生成速度可以提高至约2倍,但价格也会翻倍。

OpenAI对这次升级的定调也比以往更高。在发布前的媒体沟通会上,公司总裁Greg Brockman表示,“欢迎来到AGI时代”,并认为几年后回头看,人们可能会把GPT-6 Astra视为AGI时代开始的一个节点。

关注度有了,能力也确实更强了。此外,OpenAI与Anthropic也都进入了上市筹备阶段。GPT-6 Astra足以支撑OpenAI口中的AGI时代了吗?又能不能帮OpenAI在新一轮竞争中占据主动?

01 跑分接近上限,长任务进步更明显

先来看最直观的跑分成绩。我们主要关注两类,一类是成绩已经接近测试上限的,另一类是相比上一代提升明显的。

先看第一类。在OpenAI公布的基准测试中,GPT-6 Astra在ARC-AGI-3上的得分达到99.9%,ExploitBench达到100%;FrontierMath Tier 4 v2的正确率也达到97.6%。

这三项测试考察的能力各不相同。ARC-AGI-3考察模型能不能在陌生环境摸索出规则并迁移到更难的关卡,测的是对新环境的理解和适应;FrontierMath Tier 4 v2考察高难度数学推理;ExploitBench则要求模型针对已知漏洞,构造出可以运行的漏洞利用程序。

这说明,GPT-6 Astra在研究级推理、陌生环境适应和复杂网络安全任务上已经表现出很强的能力。尤其是ARC-AGI-3,今年3月刚推出时,前沿模型得分还不到1%。GPT-6 Astra如今接近满分,说明这类过去能够明显拉开前沿模型差距的陌生环境推理任务,已经很难再成为它的瓶颈。

图源 / Artificial Analysis官网

不过,第三方综合测试给出的成绩没有这么突出。在Artificial Analysis最新智能指数中,GPT-6 Astra最高推理档拿到61分,与GPT-5.6 Sol持平,排名第5,低于Claude Fable 5.1最高档的66分。从综合成绩来看,GPT-6 Astra并没有和上一代拉开明显差距,它的进步更多集中在部分能力上。

接下来,我们再看相比上一代提升明显的部分。

这主要集中在操作电脑、调用工具、连续执行步骤以及处理更长任务这些Agent能力上。其中,科研工作流测试Terminal-Bench Science 0.1的变化最大,GPT-6 Astra从GPT-5.6 Sol的22.4%提高到64.6%,接近上一代的三倍。其他长程Agent和自动化任务测试也普遍提高了20个百分点左右。

电脑操作的成绩也有明显的进步。ScreenSpot-Pro从76.9%提高到92.7%,意味着GPT-6 Astra在看懂界面、找准操作位置这件事上更加实用了。OSWorld 2.0则达到72.6%,分数只增加了6.9个百分点,但完成一项任务的模拟平均时间从约75分钟缩短到40分钟,耗时减少了接近一半。

这些变化,也能从第一批拿到GPT-6 Astra的用户实测中看到。

一位网友让GPT-6 Astra在Unreal Engine(虚幻引擎,3D创作工具)里搭建曼哈顿的虚拟场景,整个任务持续了一周。他提到,GPT-6 Astra可以沿着街道逐步补充建筑和环境细节,持续运行多天后,仍能继续此前的进度完善场景。不过效率仍然有限,他提到,按照目前的速度,如果要把整个纽约做完仍需要数月。

曼哈顿的虚拟场景

另一位网友做了包括生成3D模型和动画、制作游戏等六组测试。他认为,这一代模型的能力提升比此前更明显,尤其是在长时间运行中表现稳定。实测期间,他同时运行了数百个Agent,也没有遇到明显问题。

摩托艇游戏

Codex团队的Thomas Ricouard则重点测试了GPT-6 Astra的3D建模能力。他让模型根据一栋房屋的平面图完成3D场景的搭建,GPT-6 Astra先在Blender中完成建模,再把场景转到Unreal Engine,最终生成一个可以实时“行走”的3D空间。除了最开始几次提示词,后续的天空盒、电影化灯光、镜头角度等都由GPT-6 Astra完成。Ricouard认为,GPT-6 Astra非常擅长3D建模,它对材质、纹理和视觉效果的处理比较到位。

房屋3D场景

这些实测还只是早期样本,但它们和官方跑分呈现出的方向基本一致。GPT-6 Astra明显的增量,集中在长时间执行、专业软件操作,以及把多种能力连续串进一项复杂任务。

02 模型开始吃掉Agent?

GPT-6 Astra有两个变化值得单独展开。一个是Computer Use(电脑操作能力),模型可以直接读取电脑界面,在软件里完成操作;另一个是Judgment(判断力),模型会自己处理一些不影响方向的小问题,只在真正需要用户拍板时停下来询问。一个解决怎么动手,一个解决什么时候该自己做主。

先来看Computer Use。简单来说,就是让模型像人一样看着屏幕干活。它通过截图理解当前界面,根据用户目标判断下一步该做什么,再把计划转成点击、输入等实际操作。执行完成后重新读取页面,继续下一步,形成一个循环。

图源/OpenAI官网展示的寻找儿童医生的演示

它提供的是一条更通用的软件操作路径。很多Agent要接入外部系统,通常需要开发者提前接好API、MCP或者专用工具。Computer Use则让模型直接操作原本为人设计的图形界面,在没有现成接口的情况下,也可以继续完成任务。

这项能力此前已有过尝试。2024年,Anthropic就已经在Claude上开放了Computer Use,微软、OpenAI也陆续跟进。2025年,OpenAI推出Operator,背后的Computer-Using Agent同样可以通过截图理解网页,再用鼠标和键盘完成操作。之后,这类能力又被整合进ChatGPT Agent产品。

早期的Computer Use并不算好用。大模型研究员姚宇航告诉「AIX财经」,OpenAI此前推出的AI浏览器Atlas也是让模型直接控制网页,但延迟很长,效果并不理想。在他看来,这类能力未来一两年仍有很大提升空间。不过从这次官方展示的几组专业软件操作Demo来看,GPT-6 Astra对图形化界面的理解和软件操作已经出现明显进步。

Computer Use的价值,在于补上API、CLI和MCP覆盖不到的部分。有现成接口时,Agent仍然可以选择更快、更稳定的方式;没有接口时,模型仍能通过GUI直接操作这些软件。

模型能够自己读网页并完成操作,也表明一部分原本由Agent承担的执行能力正在被底层模型接过去。姚宇航认为,未来Agent层会越来越薄。看屏幕、调用常见工具这些通用能力,会不断沉进基础模型。但Agent仍然有价值。进入金融、法律、医疗等专业场景后,还需要领域知识、业务流程、权限管理以及责任边界。垂直Agent可以依靠这些专业能力保留更高的附加价值。

GPT-6 Astra另一个值得关注的变化,是OpenAI专门强调的Judgment。

Judgment解决的是协作问题。Agent面对信息缺失时,经常需要在两个选择之间取舍。如果频繁停下来确认,自动化流程又会变成反复的人机沟通;如果完全自行决定,也可能直到任务后期才发现方向出了偏差。

GPT-6 Astra的做法是先判断缺失信息的重要程度。不影响最终方向的小问题,依据上下文自己判断;可能改变结果的决策,再交给用户拍板。Judgment降低的其实是使用Agent时的监督成本。用户需要确认的节点减少,Agent才能真正接下更长、更复杂的任务。

03 OpenAI不想掉队

GPT-6 Astra发布的时间点,正赶上前沿模型最密集的一轮更新。

9月1日,Anthropic发布Claude Fable 5.1;9月2日,Google推出Gemini 3.8 Flash,Meta也在同一天更新Muse Spark 1.3。几家公司挤在同一周更新模型,前沿能力的领先窗口期还在继续缩短。

但对OpenAI来说,这次发布的压力不只来自竞争对手。GPT-6 Astra发布前,OpenAI创始人Sam Altman在接受《时代》采访时复盘了OpenAI过去一年的表现。他承认,公司在产品方向和模型预训练上都没有达到预期。过去一年,OpenAI同时铺开Sora、Atlas浏览器等多条产品线。今年以来,公司开始重新收缩,把更多资源拉回底层模型和Codex等核心项目。

OpenAI需要重新证明,它不仅能做出“最强”模型,也能把模型能力转化为收入。

消费端依然是OpenAI最明显的优势。截至8月底,ChatGPT周活用户已经超过10亿,付费订阅用户超过5000万,用户规模远高于Claude。

但在B端市场,这种优势就没那么明显了。Anthropic更早抓住了AI Coding和Agent的商业化机会,Claude Code逐渐成为企业高频使用的产品。

而眼下,B端业务对OpenAI越来越重要。今年4月,OpenAI披露企业业务收入占比超过40%。7月,企业收入已经首次超过消费者收入。此外,OpenAI服务的企业和机构数量超过200万,是一年前的两倍。B端市场从增量业务变成越来越重要的收入基本盘。

Anthropic也给它带来了更大的压力。今年二季度,OpenAI收入增长到67亿美元,环比增长18%,但经营亏损扩大到123亿美元。Anthropic同期收入则超过115亿美元,环比增长超过一倍,并实现小幅运营盈利,这也是Anthropic季度收入首次超过OpenAI。

7月底,Anthropic披露的年化收入(run rate)已经超过650亿美元,OpenAI约为400亿美元。需要说明的是,两家公司公布的年化收入数字统计方式存在差异,不能直接比较高低。但至少能够看出,Anthropic带给OpenAI的压力从模型能力延伸到了企业增长和盈利效率。

两家公司已经先后秘密递交IPO申请,企业增长和盈利效率也会成为资本市场衡量两家公司商业化能力的重要指标。

OpenAI也看到了企业客户使用习惯的变化。截至今年6月,在企业客户产生的Codex和ChatGPT输出Token中,Codex已经占到64%。这说明企业端的AI使用正在从问答转向更长、更复杂的Agent任务。放到这个背景下,GPT-6 Astra这一轮的升级实际上都服务于扩大模型能够独立承接的工作范围。对于OpenAI来说,新模型的一项重要任务就是把更强的模型能力继续导向Codex和企业Agent场景。

价格拉平之后,两家在企业客户面前的竞争也更直接。GPT-6 Astra的API价格已经与Claude Fable 5.1持平。OpenAI需要证明,更高的价格能够换来足够明显的任务完成率和使用价值。

OpenAI还要承担越来越高的算力投入。今年OpenAI的计算支出预计约500亿美元,未来几年还要继续投入数据中心、芯片等基础设施。投入越大,公司就越需要让前沿模型能力转化成持续增长的企业收入。

拥有10亿级消费用户之后,OpenAI下一阶段的任务是追上Anthropic已经领先的B端市场。

本文为转载内容,授权事宜请联系原著作权人。

OpenAI

  • ChatGPT、Grok、Claude集体宕机后服务现已恢复
  • 奥特曼首次明确表态:OpenAI将自研人形机器人

评论

暂无评论哦,快来评价一下吧!

下载界面新闻

微信公众号

微博

AGI,真的来了?

GPT-6 Astra来了,OpenAI还要追Anthropic。

文|AIX财经 雷晶

编辑|金玙璠

9月3日凌晨,预热已久的GPT-6 Astra正式发布。

发布前半个月,OpenAI一直在为这款模型的发布释放信号。8月18日,在判断Astra可能达到“Critical”网络安全能力阈值后,公司放慢部分前沿模型训练,并暂停两周面向部署模型的强化学习训练,用来加强监控、对齐和研究环境安全。9月1日,OpenAI进一步披露Astra的安全评估情况。几轮信息提前放出之后,GPT-6 Astra在正式发布前已经积累了不少关注。

但发布之后,大部分用户暂时还用不了。目前,GPT-6 Astra只向少量机构开放,Plus、Pro、Business等付费用户将在未来几天陆续获得访问权限,API也会逐步开放。面对用户的等待,OpenAI很快给出了一套补偿方案。Codex负责人Tibo表示,付费用户每有一天无法使用Astra,就会获得一次可以留到之后使用的额度重置。这也缓解了部分用户对延迟开放的不满。

回到模型本身,这次更新最值得关注的变化主要有两个:模型更能直接操作电脑,也更擅长完成复杂任务。OpenAI称GPT-6 Astra是目前最智能的模型,相比GPT-5.6 Sol,它在软件工程、科研、网络安全和专业工作等方向都有提升,计算机操作进步尤其明显。

API的价格也提高了。GPT-6 Astra的API价格为每百万Token输入10美元、输出50美元,是GPT-5.6 Sol的2.5倍,与Anthropic最新旗舰Claude Fable 5.1处在同一价格水平。OpenAI还提供Fast Mode,生成速度可以提高至约2倍,但价格也会翻倍。

OpenAI对这次升级的定调也比以往更高。在发布前的媒体沟通会上,公司总裁Greg Brockman表示,“欢迎来到AGI时代”,并认为几年后回头看,人们可能会把GPT-6 Astra视为AGI时代开始的一个节点。

关注度有了,能力也确实更强了。此外,OpenAI与Anthropic也都进入了上市筹备阶段。GPT-6 Astra足以支撑OpenAI口中的AGI时代了吗?又能不能帮OpenAI在新一轮竞争中占据主动?

01 跑分接近上限,长任务进步更明显

先来看最直观的跑分成绩。我们主要关注两类,一类是成绩已经接近测试上限的,另一类是相比上一代提升明显的。

先看第一类。在OpenAI公布的基准测试中,GPT-6 Astra在ARC-AGI-3上的得分达到99.9%,ExploitBench达到100%;FrontierMath Tier 4 v2的正确率也达到97.6%。

这三项测试考察的能力各不相同。ARC-AGI-3考察模型能不能在陌生环境摸索出规则并迁移到更难的关卡,测的是对新环境的理解和适应;FrontierMath Tier 4 v2考察高难度数学推理;ExploitBench则要求模型针对已知漏洞,构造出可以运行的漏洞利用程序。

这说明,GPT-6 Astra在研究级推理、陌生环境适应和复杂网络安全任务上已经表现出很强的能力。尤其是ARC-AGI-3,今年3月刚推出时,前沿模型得分还不到1%。GPT-6 Astra如今接近满分,说明这类过去能够明显拉开前沿模型差距的陌生环境推理任务,已经很难再成为它的瓶颈。

图源 / Artificial Analysis官网

不过,第三方综合测试给出的成绩没有这么突出。在Artificial Analysis最新智能指数中,GPT-6 Astra最高推理档拿到61分,与GPT-5.6 Sol持平,排名第5,低于Claude Fable 5.1最高档的66分。从综合成绩来看,GPT-6 Astra并没有和上一代拉开明显差距,它的进步更多集中在部分能力上。

接下来,我们再看相比上一代提升明显的部分。

这主要集中在操作电脑、调用工具、连续执行步骤以及处理更长任务这些Agent能力上。其中,科研工作流测试Terminal-Bench Science 0.1的变化最大,GPT-6 Astra从GPT-5.6 Sol的22.4%提高到64.6%,接近上一代的三倍。其他长程Agent和自动化任务测试也普遍提高了20个百分点左右。

电脑操作的成绩也有明显的进步。ScreenSpot-Pro从76.9%提高到92.7%,意味着GPT-6 Astra在看懂界面、找准操作位置这件事上更加实用了。OSWorld 2.0则达到72.6%,分数只增加了6.9个百分点,但完成一项任务的模拟平均时间从约75分钟缩短到40分钟,耗时减少了接近一半。

这些变化,也能从第一批拿到GPT-6 Astra的用户实测中看到。

一位网友让GPT-6 Astra在Unreal Engine(虚幻引擎,3D创作工具)里搭建曼哈顿的虚拟场景,整个任务持续了一周。他提到,GPT-6 Astra可以沿着街道逐步补充建筑和环境细节,持续运行多天后,仍能继续此前的进度完善场景。不过效率仍然有限,他提到,按照目前的速度,如果要把整个纽约做完仍需要数月。

曼哈顿的虚拟场景

另一位网友做了包括生成3D模型和动画、制作游戏等六组测试。他认为,这一代模型的能力提升比此前更明显,尤其是在长时间运行中表现稳定。实测期间,他同时运行了数百个Agent,也没有遇到明显问题。

摩托艇游戏

Codex团队的Thomas Ricouard则重点测试了GPT-6 Astra的3D建模能力。他让模型根据一栋房屋的平面图完成3D场景的搭建,GPT-6 Astra先在Blender中完成建模,再把场景转到Unreal Engine,最终生成一个可以实时“行走”的3D空间。除了最开始几次提示词,后续的天空盒、电影化灯光、镜头角度等都由GPT-6 Astra完成。Ricouard认为,GPT-6 Astra非常擅长3D建模,它对材质、纹理和视觉效果的处理比较到位。

房屋3D场景

这些实测还只是早期样本,但它们和官方跑分呈现出的方向基本一致。GPT-6 Astra明显的增量,集中在长时间执行、专业软件操作,以及把多种能力连续串进一项复杂任务。

02 模型开始吃掉Agent?

GPT-6 Astra有两个变化值得单独展开。一个是Computer Use(电脑操作能力),模型可以直接读取电脑界面,在软件里完成操作;另一个是Judgment(判断力),模型会自己处理一些不影响方向的小问题,只在真正需要用户拍板时停下来询问。一个解决怎么动手,一个解决什么时候该自己做主。

先来看Computer Use。简单来说,就是让模型像人一样看着屏幕干活。它通过截图理解当前界面,根据用户目标判断下一步该做什么,再把计划转成点击、输入等实际操作。执行完成后重新读取页面,继续下一步,形成一个循环。

图源/OpenAI官网展示的寻找儿童医生的演示

它提供的是一条更通用的软件操作路径。很多Agent要接入外部系统,通常需要开发者提前接好API、MCP或者专用工具。Computer Use则让模型直接操作原本为人设计的图形界面,在没有现成接口的情况下,也可以继续完成任务。

这项能力此前已有过尝试。2024年,Anthropic就已经在Claude上开放了Computer Use,微软、OpenAI也陆续跟进。2025年,OpenAI推出Operator,背后的Computer-Using Agent同样可以通过截图理解网页,再用鼠标和键盘完成操作。之后,这类能力又被整合进ChatGPT Agent产品。

早期的Computer Use并不算好用。大模型研究员姚宇航告诉「AIX财经」,OpenAI此前推出的AI浏览器Atlas也是让模型直接控制网页,但延迟很长,效果并不理想。在他看来,这类能力未来一两年仍有很大提升空间。不过从这次官方展示的几组专业软件操作Demo来看,GPT-6 Astra对图形化界面的理解和软件操作已经出现明显进步。

Computer Use的价值,在于补上API、CLI和MCP覆盖不到的部分。有现成接口时,Agent仍然可以选择更快、更稳定的方式;没有接口时,模型仍能通过GUI直接操作这些软件。

模型能够自己读网页并完成操作,也表明一部分原本由Agent承担的执行能力正在被底层模型接过去。姚宇航认为,未来Agent层会越来越薄。看屏幕、调用常见工具这些通用能力,会不断沉进基础模型。但Agent仍然有价值。进入金融、法律、医疗等专业场景后,还需要领域知识、业务流程、权限管理以及责任边界。垂直Agent可以依靠这些专业能力保留更高的附加价值。

GPT-6 Astra另一个值得关注的变化,是OpenAI专门强调的Judgment。

Judgment解决的是协作问题。Agent面对信息缺失时,经常需要在两个选择之间取舍。如果频繁停下来确认,自动化流程又会变成反复的人机沟通;如果完全自行决定,也可能直到任务后期才发现方向出了偏差。

GPT-6 Astra的做法是先判断缺失信息的重要程度。不影响最终方向的小问题,依据上下文自己判断;可能改变结果的决策,再交给用户拍板。Judgment降低的其实是使用Agent时的监督成本。用户需要确认的节点减少,Agent才能真正接下更长、更复杂的任务。

03 OpenAI不想掉队

GPT-6 Astra发布的时间点,正赶上前沿模型最密集的一轮更新。

9月1日,Anthropic发布Claude Fable 5.1;9月2日,Google推出Gemini 3.8 Flash,Meta也在同一天更新Muse Spark 1.3。几家公司挤在同一周更新模型,前沿能力的领先窗口期还在继续缩短。

但对OpenAI来说,这次发布的压力不只来自竞争对手。GPT-6 Astra发布前,OpenAI创始人Sam Altman在接受《时代》采访时复盘了OpenAI过去一年的表现。他承认,公司在产品方向和模型预训练上都没有达到预期。过去一年,OpenAI同时铺开Sora、Atlas浏览器等多条产品线。今年以来,公司开始重新收缩,把更多资源拉回底层模型和Codex等核心项目。

OpenAI需要重新证明,它不仅能做出“最强”模型,也能把模型能力转化为收入。

消费端依然是OpenAI最明显的优势。截至8月底,ChatGPT周活用户已经超过10亿,付费订阅用户超过5000万,用户规模远高于Claude。

但在B端市场,这种优势就没那么明显了。Anthropic更早抓住了AI Coding和Agent的商业化机会,Claude Code逐渐成为企业高频使用的产品。

而眼下,B端业务对OpenAI越来越重要。今年4月,OpenAI披露企业业务收入占比超过40%。7月,企业收入已经首次超过消费者收入。此外,OpenAI服务的企业和机构数量超过200万,是一年前的两倍。B端市场从增量业务变成越来越重要的收入基本盘。

Anthropic也给它带来了更大的压力。今年二季度,OpenAI收入增长到67亿美元,环比增长18%,但经营亏损扩大到123亿美元。Anthropic同期收入则超过115亿美元,环比增长超过一倍,并实现小幅运营盈利,这也是Anthropic季度收入首次超过OpenAI。

7月底,Anthropic披露的年化收入(run rate)已经超过650亿美元,OpenAI约为400亿美元。需要说明的是,两家公司公布的年化收入数字统计方式存在差异,不能直接比较高低。但至少能够看出,Anthropic带给OpenAI的压力从模型能力延伸到了企业增长和盈利效率。

两家公司已经先后秘密递交IPO申请,企业增长和盈利效率也会成为资本市场衡量两家公司商业化能力的重要指标。

OpenAI也看到了企业客户使用习惯的变化。截至今年6月,在企业客户产生的Codex和ChatGPT输出Token中,Codex已经占到64%。这说明企业端的AI使用正在从问答转向更长、更复杂的Agent任务。放到这个背景下,GPT-6 Astra这一轮的升级实际上都服务于扩大模型能够独立承接的工作范围。对于OpenAI来说,新模型的一项重要任务就是把更强的模型能力继续导向Codex和企业Agent场景。

价格拉平之后,两家在企业客户面前的竞争也更直接。GPT-6 Astra的API价格已经与Claude Fable 5.1持平。OpenAI需要证明,更高的价格能够换来足够明显的任务完成率和使用价值。

OpenAI还要承担越来越高的算力投入。今年OpenAI的计算支出预计约500亿美元,未来几年还要继续投入数据中心、芯片等基础设施。投入越大,公司就越需要让前沿模型能力转化成持续增长的企业收入。

拥有10亿级消费用户之后,OpenAI下一阶段的任务是追上Anthropic已经领先的B端市场。

本文为转载内容,授权事宜请联系原著作权人。