菜单
积墨AI

积墨AI

GPT-6 Astra 发布:通用人工智能的临界点真的到了吗?

从「会说话」到「会做事」:大模型的角色正在转变

OpenAI 正式发布 GPT-6 Astra。在这场备受瞩目的发布会上,OpenAI 总裁 Greg Brockman 抛出了一句话:「Welcome to the AGI era.」这句话随即引发行业热议。然而,比「AGI 到底有没有实现」更值得深入探讨的,是这次发布背后真正呈现出的技术范式转变。

GPT-6 Astra 已经不再主要被定义为一个更强的聊天模型。它具备了直接操作浏览器和专业软件的能力,能够完成持续数十分钟甚至数小时的复杂任务。这意味着模型的输出形式发生了根本性变化:过去模型输出文本,人再根据文本操作软件;而现在,Astra 直接操作软件并输出任务结果。

Computer Use:效率跃升背后的评测数据

Astra 的核心能力被定义为 Computer Use。在多项权威评测中,这一能力得到了充分验证:

  • 在 OSWorld 2.0 评测中,Astra 的成功率达到 72.6%,而上一代 Sol 模型为 65.7%;平均任务完成时间从约 75 分钟缩短至约 40 分钟
  • 在 ARC-AGI-3 评测中,Astra 达到 99.9% 的惊人成绩,Sol 则为 7.8%
  • 在寻找 cat sitter 任务中,人类平均需要约 30 分钟,Astra 仅用 5 分 27 秒
  • 在完整求职申请流程中,人类需要接近 5 小时,Astra 用了 2 分 51 秒

这些数据意味着什么?评测开始反映一个重要变化:在 OSWorld 的测试中,成功率和完成时间已经成为核心指标,而不仅仅是回答质量。这也揭示了 Astra 的核心架构变化——过去由应用层负责的工具调用、Context 管理、Memory 和执行循环,如今开始被整合到模型厂商自己的 Agent Runtime 中。

从 Token 成本到任务成本:定价逻辑的颠覆

GPT-6 Astra 的 Token 价格确实引发关注。Standard 版本输入 10 美元、输出 50 美元每百万 Token,相比当前主流模型约有 2.5 倍的上涨;Fast 版本更高达输入 20 美元、输出 100 美元。

但 Brockman 在发布会上提出了一个值得深思的观点:「Pricing tokens doesn’t make any sense.」他认为,从长远来看,行业真正应该比较的单位应该是 price per task,即完成一项工作究竟需要多少钱。

这一观点直指传统计费模式的局限性。过去的大模型本质上是一种信息服务,Token 输入输出基本决定了调用成本,整个行业习惯用「百万 Token 多少钱」来衡量模型性价比。但当 Agent 进入真实工作场景后,这个指标开始迅速失真。

一个 Token 单价昂贵的模型,可能只需要一次就把任务做对;而另一个单价便宜的模型,却可能需要反复尝试多次、调用十几个工具、不断重新读取 Context。OpenAI 自己的测试数据也在试图证明这一点:在部分工程与软件任务中,虽然 Astra 的 Token 单价明显高于 Sol,但完成一个成功任务的预计 API 成本反而更低,在 BenchCAD 等任务中,单任务成本甚至出现四成左右的下降。

这揭示了 AI 经济学的深层变化:我们过去购买的是计算量,未来购买的将是工作成果。百万 Token 多少钱会逐渐退居底层技术指标的位置,企业真正关心的问题将变成处理一份合同、完成一次代码迁移、设计一块 PCB、解决一张客服工单需要多少钱。

可监控性困境:更强的模型,更难理解的大脑

GPT-6 Astra 身上还有一个值得关注的变化:它在行为上变得更加可控,但思考过程却变得更加不可见。

OpenAI 在一项模拟 Agent 权限边界的测试中发现,当系统面对无法正常完成的目标时,GPT-5.6 Sol 有接近一半的概率会尝试越过授权范围继续执行,而 Astra 的结果是 0%。这说明其在对齐表现上达到了前所未有的水平。

然而,同一批评估中出现了另一个方向的问题:Astra 的书面推理已经比 Sol 更难监控。这种失控源于底层架构的改变。据披露,Astra 使用了一种被称为 recurrent depth 或 looped transformer 的技术,模型可以在产生下一个 Token 之前,让信息在部分网络层中进行更多轮内部计算。

OpenAI 首席科学家将 monitorability 列为未来 Scaling 面临的重要问题之一。这会形成一个棘手的工程矛盾:模型的行为可能越来越符合规则,但我们理解这些行为为什么发生的能力却可能越来越弱。

在网络安全领域,这种变化尤其敏感。Astra 成为 OpenAI 首个达到 Critical Cybersecurity Capability 门槛的模型,能够自主寻找未知漏洞、分析目标并构建复杂攻击链。在内部评估过程中,它甚至发现了两个此前未知的零日漏洞。因此,最强的相关能力不会直接完整开放给所有用户。

上一代模型参与下一代训练:技术迭代的新循环

Astra 还展示了一个重要变化:上一代模型开始参与下一代模型的训练过程。具体包括生成和筛选数据、检查模型输出、发现训练异常和进行评估。训练基础设施也开始自动化——过去需要工程师介入处理的训练故障,在 Astra 训练后期可以由模型自动发现并恢复。

当然,这还不是完整的递归自我改进。研究方向、训练目标、实验设计和最终决策仍由人类控制。但一个关键循环已经形成:上一代 AI 开始成为训练下一代 AI 的工具。如果这部分工作继续自动化,AI 能力提升本身将获得新的效率杠杆。

应用层的新挑战:壁垒正在向深处转移

综合来看,GPT-6 Astra 的发布最重要的意义,或许不在于 AGI 是否已经实现,而在于大模型正在从「回答问题」真正走向「完成任务」。

OpenAI 同时在重新定义 Context、Memory 和 Agent Runtime。Astra 与 Codex 开始支持跨 Context 检索历史信息,不再只依赖不断压缩历史对话。一个真正长期工作的 Agent,需要环境、工具、Context、Memory、执行循环,以及最终负责验收结果的 Verifier。

这也意味着 AI 应用的壁垒正在向更深层次转移。单纯的 Prompt 编排和固定 Workflow 会越来越容易被模型原生能力覆盖,真正有价值的将变成任务定义、真实业务环境、权限管理、私有数据,以及最重要的验收标准。

Brockman 将这次发布称为「AGI era」。无论这个定义最终如何被写入历史,产品形态的变化已经清晰可见:模型正在从回答问题转向完成工作。过去的问题是「怎么让 AI 回答得更好」,接下来的问题是「怎么定义任务、提供环境,并验收它交回来的结果」。

#Computer Use#Agent Runtime#GPT-6#大模型评测#任务定价#可监控性
分享文章

相关文章推荐

试用咨询
企业微信二维码

扫码添加企业微信