「欢迎来到AGI时代」:GPT-6 Astra如何重新定义AI的工作方式
从「回答问题」到「完成工作」:GPT-6 Astra的定位跨越
OpenAI联合创始人Greg Brockman在发布会上用一句「欢迎来到AGI时代」为新品收尾。美国时间9月3日,GPT-6 Astra正式亮相。与历代主要负责回答、生成和调用工具的前辈不同,Astra更进一步——它能够持续执行完整任务,从接收指令、操作软件,到根据执行结果动态调整下一步动作。
这种跨越正是OpenAI重提「AGI时代」的核心依据。在其官方叙事中,Astra被定位为「全球最强的计算机使用模型」。其能力边界已从浏览器、邮件、表格等简单任务,延伸到Power BI、KiCad、FreeCAD等专业软件,开始进入数据分析、工程设计、软件测试和故障排查等更复杂的工作流程。
核心突破:让AI真正「会用电脑」
Astra强调的最大变化,在于「使用电脑」这一能力维度。传统模式下,用户让AI完成工作,通常还需要企业额外开发API、插件、检索系统和各类连接器,模型才能调用内部工具。Astra试图改变这一范式——它可以直接「看到」计算机界面,通过鼠标、键盘和浏览器完成操作,无需为每个软件单独适配。
官方演示场景涵盖多个维度:
- 企业办公:填写在线表格、更新CRM客户记录、安排日历、搜索网页并将结果整理成邮件或文档
- 数据分析:打开Python笔记本分析科学数据,在Power BI中处理数据集
- 工程设计:使用KiCad和FreeCAD完成电路板设计,模型从电子原理图开始,自动完成元件放置和铜线布线
- 创意制作:在Blender中建立3D房屋模型,再将其转换为Unreal Engine 5中的可步行场景
在OSWorld 2.0离线子集测试中,Astra得分72.6%,上一代模型为65.7%。模拟实际延迟条件下,Astra完成单任务平均耗时约40分钟,而上一代模型约需75分钟,效率提升约47%。
基准测试:专业能力全面提升
OpenAI此次公布的大量基准成绩显示,能力提升集中出现在计算机操作、长程编码、工程设计和科学研究等需要连续行动的任务上。
编码与软件工程
| 测试集 | GPT-6 Astra | 对比模型 |
|---|---|---|
| Terminal-Bench 4.0 | 57.9% | GPT-5.6 Sol: 37.3% |
| DeepSWE v1.1 | 74.1% | GPT-5.6 Sol: 72.7% |
| 内部数据库迁移任务 | 63.9% | GPT-5.6 Sol: 42.7% |
在Agents’ Last Exam中,Astra得分59.3%,超越Claude Opus 5的55.5%,同时在最高分设置下,使用的输出Token比Claude Opus 5少约65%。
工程设计
BenchCAD测试中,Astra达到95.9%的几何重叠得分,远超GPT-5.6 Sol的83.3%和Claude Fable 5.1的84.3%。这一测试直接验证了模型在CAD软件中完成工程设计任务的能力。
科学研究
Terminal-Bench Science 0.1测试科学研究流程,包括数据分析、模拟和模型拟合。Astra达到64.6%,Claude Fable 5.1为52.6%,而GPT-5.6 Sol仅为22.4%。这意味着在需要持续操作科学软件的场景中,Astra展现出质的飞跃。
长任务处理的新机制
Astra加入了一项针对长时间任务的改进。过去,长任务遇到上下文窗口限制时,模型通常需要压缩此前工作,将大量信息整理成摘要——这样做容易丢失关键细节,例如某次修复为何失败、某个组件此前出现过什么问题。
Astra在Codex框架中实现了工作过程记忆的保留机制。早期消息和工具输出仍然可以检索,模型能够重新找到之前的需求、测试结果和工具操作记录。这对于需要数小时甚至数天完成的复杂项目尤为重要。
安全边界:能力越强,门槛越高
Astra在安全方面的表现同样引人关注。在ExploitBench中,Astra达到100%,GPT-5.6 Sol为78.5%;在SRE-Bench(逆向软件二进制文件测试)中,Astra单次尝试解决88.0%的任务,四次尝试达到99.2%。
测试过程中,Astra还发现了两个此前未知的零日漏洞,OpenAI表示已向相关维护者披露。这既是能力的证明,也带来了新的安全考量。
OpenAI坦承,Astra已达到其网络安全准备框架中的关键阈值。模型能够发现此前未知的软件漏洞,也可能进一步形成漏洞利用链。因此,当前版本会拒绝执行更高级的网络安全任务,例如创建漏洞概念验证。
在对齐方面,数据同样亮眼:
- 内部计算机使用安全基准中,Astra不当行为率为2.4%,GPT-5.6 Sol为22.0%
- 内部规避基准中,Astra为0.00%,GPT-5.6 Sol为0.29%
- ExploitGym蜜罐测试中,Astra为0%,GPT-5.6 Sol为48.2%
不过,OpenAI首席科学家雅库布·帕乔基也指出了一个深层问题:模型能力越强,推理过程可能越难监控。当模型能够用更少的自然语言推理Token解决更复杂问题时,人类也越来越难通过文字推理过程判断它究竟在做什么。
为此,Astra部署中加入了未对齐监控系统,会检查模型的推理和行动轨迹,发现未经授权的行为时可暂停任务。这意味着合法任务有时也可能被减速、暂停甚至停止。
定价策略:更贵,但「更会做事」
Astra的定价引发广泛讨论。OpenAI API标准价格为每百万输入Token 10美元、每百万输出Token 50美元,是GPT-5.6 Sol的2.5倍。
但OpenAI希望企业换一种方式计算成本。Greg Brockman认为,随着模型越来越像代理,单个Token的价格已经很难准确反映真实成本。一个模型即使Token便宜,如果需要反复尝试、人工修正,最后完成一项任务的成本可能更高。
从OpenAI公布的效率数据看:
- Terminal-Bench Science 0.1中,Astra相比Claude Fable 5.1预估API成本降低约31%
- BenchCAD中,Astra预估API成本比Claude Fable 5.1低约86%
- 在Codex环境下,Astra完成任务所需的Token明显减少,相比Claude Fable 5.1,完成同类任务的成本不到一半
不过,第三方测评机构Artificial Analysis给出了不同视角:GPT-6 Astra在Intelligence Index中得分61.2,与GPT-5.6 Sol的60.9接近,但输出Token约减少10%。由于价格上涨2.5倍,单任务成本反而比GPT-5.6 Sol高约75%。
这说明: Token单价的下降与实际任务成本的下降之间,存在复杂的换算关系,企业在选型时需要综合考量任务类型、人工介入频率和整体效率。
企业落地:从「AI能做什么」到「AI该怎么做」
Astra的发布带来一个很现实的变化:AI开始获得更多电脑权限之后,企业需要关注的也从「模型会不会回答错」扩展到「模型能操作什么、能访问什么、什么时候必须停下来」。
这意味着企业在引入这类强代理能力模型时,需要重新审视内部流程和数据权限配置。当AI能够自主操作软件时,传统的「人在回路」设计需要升级为更精细的权限分级体系。
Greg Brockman对「AGI」的定义并不回避争议。他认为,AGI本身没有一个所有人都认可的标准,但如果一个系统已经能够在浏览器、电脑操作、编程、数学、科学、法律和其他专业工作中承担大量任务,那么称其进入AGI时代并不牵强。
写在最后
GPT-6 Astra的出现,标志着大模型从「被动应答」向「主动执行」的转变进入新阶段。模型能够自主操作计算机界面、调用专业软件、持续完成复杂任务——这些能力正在重新定义AI在企业中的角色。
对于正在规划AI落地的企业而言,Astra带来的启示不仅在于模型能力的提升,更在于对「AI员工」边界的重新思考:当AI能够独立完成工作时,如何设计有效的人机协作机制、如何建立合理的权限与监控体系,将成为下一阶段的核心课题。
至于Astra是否真正开启了AGI时代,这个问题的答案或许并不重要。重要的是,这场从「回答问题」到「完成工作」的跨越,正在真切地改变AI与企业业务之间的距离。
