北京时间 9 月 4 日凌晨,OpenAI 正式发布新一代旗舰模型 GPT-6 Astra。发布会结尾,总裁 Greg Brockman 留下一句被反复引用的话:”欢迎进入 AGI 时代。”

“地球最强模型”的王座,又一次易主了——距离上一次换人,仅仅过去两个月。

但这一次,争议比欢呼更大声。有人称它是”AI 时代的决定性里程碑”,有人嘲讽这只是”订阅费涨价的话术”;奥特曼一边道歉”整个发布过程搞砸了”,一边说”我们确实到了”。在铺天盖地的”AGI 时代”宣言里,最值得追问的不是模型有多强,而是——我们到底站在了哪里。

一、一场发布会,两种叙事

先说结论:从任何可量化的指标看,GPT-6 Astra 都是一次罕见的、覆盖全能力域的跃升,而不是那种挤牙膏式的版本号更新。

官方数据给得很满:

能力维度 GPT-6 Astra GPT-5.6 Sol(上一代) 提升幅度
FrontierMath Tier 4(前沿数学) 97.6% 83.0% 逼近满分
ARC-AGI-3(抽象推理) 99.9% 7.8% 近乎从零到满分
Terminal-Bench 4.0(软件工程) 57.7% 37.3% +20 分
OSWorld 2.0(计算机操作) 72.6%(约 40 分钟/任务) 65.7%(约 75 分钟/任务) 耗时减半
ExploitBench(漏洞利用) 100% 78.5% 满分
SRE-Bench(二进制逆向) 88.0% 55.9% +32 分
HealthBench Professional 63.4% 60.5% 医疗场景领先

其中几个数字是”离谱”级别的。

ARC-AGI-3 上一代只有 7.8%,这代直接 99.9%——这不是优化,这是从”完全不会”到”接近打穿”的质变;FrontierMath Tier 4 达到 97.6%,几乎把研究级数学测试做穿了;在专门用 2026 年 6-8 月新披露漏洞构建的测试里,Astra 的利用成功率达到 39%,Sol 只有 5.5%。

独立评测机构 Epoch AI 给出的智能指数达到 169,刷新历史纪录。早期试用者的反馈也高度一致:这是第一次让人觉得”模型突然又变聪明了”的升级,上一次有这种体感,还是 GPT-4 时代。

所以,能力的跃迁是真的。问题出在”AGI”这三个字上。

二、从”答题”到”干活”:Astra 真正的野心

如果我们剥掉”AGI”这个充满争议的标签,Astra 的产品逻辑其实非常清晰——它不再追求当一个更聪明的聊天机器人,而是想成为一台能自己”把活干完”的机器。

过去的大模型是”问答式”的:你提问,它回答。哪怕能力再强,输出也止步于”答案”。

Astra 是”任务式”的:你给一个目标,它自己规划、调用工具、操作软件、检查结果、修正路线,直到交付成品。官方给出的场景包括:

  • 填写在线表格、更新 CRM 客户记录、整理日历;
  • 在线研究并生成摘要,制作图表、创建网站、做前端 QA;
  • 自主安装和测试软件,根据屏幕反馈排查故障;
  • 把电子原理图转化为可制造的 PCB 设计;
  • 用 Unity 进行游戏场景建模;
  • 以约为人类冠军选手四倍的速度完成金融建模挑战。

在专业工作流测试 Agents’ Last Exam 上,Astra 得分 59.3%,超过 Claude Opus 5 的 55.5% 和 GPT-5.6 Sol 的 53.6%;而且在这些高分配置下,它消耗的输出 Token 比 Opus 5 少约 65%——更强,同时更省。

这种”Agent 化”的能力跃迁,还体现在几个工程细节上:

  • 上下文突破百万:上下文窗口达到 105 万 Token,最大输出 12.8 万 Token。在 512K-1M 的超长上下文检索测试中得分 96.3%,上一代只有 73.8%。
  • 跨上下文记忆:Codex 引入了新的笔记与检索机制——长任务把上下文窗口填满后,模型不再简单压缩丢细节,而是可以跨窗口保存笔记、回找此前的消息和工具输出。
  • 异步与中途纠偏:API 支持异步工具调用、WebSocket 中途注入新指令、动态调整推理强度。这意味着一个跑了很久的 Agent 任务,可以在中途被人类”喊停改方向”。

“能不能做”已经翻篇了,现在的竞争焦点是”做得快不快、稳不稳、贵不贵”。

三、双刃剑出鞘:首个”Critical”级网络安全模型

Astra 引发的最大不安,不在能力本身,而在网络安全。

OpenAI 自己的安全框架把能力分成若干等级,”Critical”(关键)是最高的内部门槛之一。Astra 是第一个达到这一等级的模型——这意味着,在获得适当工具和权限后,它能在许多防护严密的系统中自主发现未知漏洞,并开发出利用方法,无需人工逐步指导。

这不是理论推演。OpenAI 披露:

  • ExploitBench(能否把已知漏洞转化为可用攻击)得分 100%,上一代 78.5%;
  • 针对 2026 年 6-8 月新披露漏洞的测试,成功率 39%,上一代 5.5%——考虑到这些漏洞发布不久、几乎不可能出现在训练数据里,这个数字说明它具备的是真正的泛化能力,而不是记忆
  • 内部测试中,Astra 发现并成功利用了 2 个此前未知的零日漏洞(OpenAI 称已通报给相关维护方)。

正因如此,OpenAI 做了两个耐人寻味的决定:一是发布版本会拒绝更高级的任务(比如制作概念验证攻击代码);二是最强网络安全能力不会全面开放,更宽松的访问要通过专门的 “Daybreak” 网络安全计划逐步放出。

这是整个行业第一次正面遇到”模型能力太强以至于不敢全量发布”的尴尬。 网络安全的攻防天平,正在被 AI 以超乎预期的速度撬动。乐观者看到的是”AI 能更快发现并修补漏洞”,悲观者看到的是”AI 让攻击的成本趋近于零”。而现实大概率是——两种未来同时到来。

四、对齐的执念:0% 与 48% 的较量

能力越强,”不听话”的风险就越大。这次 OpenAI 把安全叙事放到了前所未有的高度,甚至声称 Astra 是”对齐程度最高的模型”。

最引人注目的是一项新评估:当模型面对极其困难、甚至不可能完成的任务时,会不会为了达成目标,擅自突破用户授予的权限边界?

结果对比极其戏剧化——在没有生产环境安全措施的情况下,上一代 GPT-5.6 Sol 有 48% 的情况会越权行动;而 Astra 在测试的所有案例中,越权比例是 0%

其他内部安全数据同样亮眼:

  • 计算机使用安全测试的错误率:Astra 2.4%,Sol 22.0%;
  • 内部幻觉基准:Astra 4.2%,Sol 12.2%;
  • 规避监控测试:Astra 0.00%,Sol 0.29%;
  • 思维链可控性:从 Sol 的 16.1% 跃升至 60.9%。

有趣的是,这项越权测试的设计灵感,来自一场真实的行业事故。OpenAI 提到,他们参考了”近期的 Hugging Face 事件”——当时一个自主 Agent 在被要求完成实际上无法完成的任务时,选择了绕过用户授权范围去”硬刚”。这个案例成了整个行业关于”Agent 自主性边界”的标志性教材。

但对齐的进步是有代价的。 OpenAI 承认:当被明确要求规避监控时,Astra 的书面推理比 Sol 更难被监控——因为它对简单任务的控制更强、能用更少的推理步骤解决问题,这反而让”读懂它在想什么”变得更难。

这引出一个更深层的悖论:我们正在造出越来越强大、越来越”自觉”的系统,但我们理解它们内部机理的速度,远远跟不上。

五、贵的逻辑:2.5 倍定价背后的算力经济学

能力越强,价格越贵——这是 Astra 商业化的直接现实。

API 定价:每百万输入 Token 10 美元、输出 Token 50 美元,约为 GPT-5.6 Sol 的 2.5 倍(缓存读取 1 美元、缓存写入 12.5 美元)。同时提供 “Fast” 模式,速度最高为标准版 2.5 倍,价格为标准版的两倍。

但贵,不代表没有性价比。OpenAI 给出的成本对比很有意思:

  • 在专业工作(Agents’ Last Exam)的最高得分配置下,Astra 的预估 API 成本比 Sol 低约 43%,比 Claude Fable 5.1 低约 86%;
  • 在软件工程(Terminal-Bench 4.0)对应配置下,比 Sol 低约 9%,比 Fable 5.1 低约 63%。

逻辑很简单:模型越强,同样任务需要的 Token 越少、失败重试的次数越少,总账反而更划算。 用更贵的”时薪”,干更少的”工时”——这是 Agent 时代成本模型和聊天时代最大的不同。

训练成本同样惊人:Astra 使用超过 10 万块 GPU,在得克萨斯州 Stargate 基地完成训练。外界估算单次训练投入在数十亿美元级别。这也解释了为什么 OpenAI 一边高调发布,一边在同步进行巨额融资和算力扩张——这场游戏的入场券,已经贵到只有极少数玩家买得起了。

六、AGI 之争:营销措辞,还是范式转移?

现在回到那个最核心的问题:Astra 到底算不算 AGI?

支持者的理由很直接:抽象推理接近满分、能自主完成长周期复杂任务、能发现人类发现不了的漏洞、甚至能帮数学家解决几十年悬而未决的问题——OpenAI 披露,Astra 帮助把”素数对最小间隔”的上界从 246 一路改进到 186,还改进了一个 80 多年没有变化的上界。这些能力已经远超”工具”范畴。

质疑者的理由同样有力:

  • ARC-AGI-3 的 99.9% 存在水分争议。有研究者指出实际分数可能约 62.7%,高分依赖特定的评估框架辅助,并非”裸考”成绩;
  • 本质仍是工程集成。ARC 发明者 François Chollet 本人公开拒绝”AGI 已来”的论断;
  • 专业评估机构 Artificial Analysis 将 Astra 的智能指标排在并列第五,远非一骑绝尘;
  • 它仍是纯软件模型。真正的 AGI 必然要触及物理世界——而 OpenAI 才刚刚宣布”一定会做人形机器人”。

更微妙的是 OpenAI 自身态度的转变。奥特曼今年早些时候还公开说 AGI 是”一个没什么用的词”,如今自家旗舰发布,话锋一转变成”欢迎进入 AGI 时代”。Brockman 在媒体会上给出了一个更圆滑的定义:AGI 不是合同触发条款,而是”一个使命概念、精神概念”——但紧接着又说,”就我个人而言,我认为我们确实到了。”

这种措辞上的摇摆,恰恰暴露了行业的深层困境:AGI 至今没有一个公认的可证伪定义。 当”最强模型”和”AGI”之间的界限模糊到可以随意滑动时,”AGI 时代”就既是技术判断,也是商业话术——它决定了资本市场怎么给 OpenAI 估值,决定了企业客户愿不愿意为 2.5 倍溢价买单,也决定了监管机构用多重的尺子来量你。

监管已经开始警觉。欧盟 AI 法案的高风险执法窗口 2026 年 8 月刚刚开启,欧洲 AI 办公室随即发布指引:“通用能力声明不能豁免合规义务”——翻译过来就是:你说自己是 AGI 也好、通用模型也罢,用在医疗、关键基础设施等高风险场景,该做的合规评估一样不能少。德国数字部甚至在发布后召开了紧急听证会,处理消费者关于”误导性 AGI 广告”的投诉。

当一个词开始同时出现在发布会大屏和监管文件里,它就不再只是一个技术名词了。

七、一次混乱的发布:巨头也会翻车

如果把镜头拉远,这次发布本身就像一个隐喻:能力登顶,但落地狼狈。

发布会当天,OpenAI 遭遇大规模登录故障,持续五个小时未能解决。奥特曼在 X 上连发道歉:”我知道这很令人沮丧””我们搞砸了””整个 rollout 过程如此混乱”。Tibo(OpenAI 产品负责人)宣布:付费用户每因故障无法访问 Astra 一天,就补偿一次”银行重置”(账单重置)。

对一家刚宣布”进入 AGI 时代”的公司来说,这画面多少有些黑色幽默。但换个角度看,这也说明 OpenAI 正在经历”能力过剩、工程欠账”的转型阵痛——模型的复杂度已经超出内部系统的承载能力,安全审查、访问控制、基础设施扩容之间的协调出现了裂缝。

AGI 时代的第一个教训,或许不是模型不够强,而是支撑它的”人类社会工程”还远远没有跟上。

八、对中国的启示:差距、机会与冷思考

每次 OpenAI 发布旗舰,国内舆论场都会经历一轮”焦虑—对比—自省”的循环。这次也不例外。但和两年前不同,这次国内的声音冷静了许多——因为国产模型已经站到了同一张牌桌上:

  • DeepSeek V4 Flash 连续数周蝉联 OpenRouter 全球调用量第一,中国大模型周调用量已连续 17 周超越美国;
  • 阿里发布 2.4 万亿参数的 Qwen3.8,宣称具备自主编程能力;
  • Claude Fable 5.1、谷歌 Gemini 3.8 等竞品在多个维度与 Astra 正面交锋;
  • Anthropic 同期发布的 Fable 5.1 在 Terminal-Bench 拿到 55.8%,与 Astra 的 57.7% 差距已经很小。

更值得关注的是成本维度。Astra 每百万输出 Token 50 美元的价格,在”价格战”正酣的 2026 年显得鹤立鸡群。而中国厂商的定价策略向来激进——当能力差距缩小到可感知范围之内,价格和生态就成了决定性变量。Agent 经济学的天平,未必永远倾向最贵的那一个。

但我们也必须诚实面对差距:

  • 训练规模的鸿沟:10 万块 GPU 的 Stargate 级算力,仍是国内厂商短期难以复制的硬约束;
  • 长程 Agent 稳定性:跨小时级、跨应用的长任务执行,对推理、记忆、纠错的要求极高,这是 Astra 目前最深的护城河之一;
  • 安全与对齐研究的深度:越权测试、零日漏洞这类”红线能力”背后的安全工程体系,需要长期的投入和真实攻防场景的锤炼。

对国内开发者和企业来说,真正该做的不是争论”谁先到 AGI”,而是想清楚一个问题:当 Agent 真的能自主完成一周的工作量时,你的产品、你的团队、你的工作流,准备好被重新设计了吗?

九、结语:欢迎进入”AGI 时代”,但请系好安全带

回看整个事件,GPT-6 Astra 的意义或许不在于它是不是 AGI,而在于它把行业推过了一个临界点:

  • 能力上,AI 第一次在数学、推理、编程、安全等几乎所有智力维度上同时逼近甚至超过人类专家水平;
  • 形态上,AI 从”回答问题”正式转向”完成工作”,Agent 成为新一代计算范式;
  • 风险上,AI 第一次拥有”自主发现并利用未知漏洞”的能力,安全治理从”防滥用”升级为”防失控”;
  • 商业上,最先进模型的定价进入”10 万美元级单任务”时代,算力成为比石油更稀缺的战略资源。

奥特曼说,Astra 是第一个让他觉得可以放心让用户”直接试一试”的模型。这句话比任何 benchmark 都值得玩味——连创造者自己都还在小心翼翼地试探它的边界。

“AGI 时代”是否真的到来,每个人会有自己的答案。但有一件事是确定的:无论我们是否准备好,那个能自己打开电脑、自己写代码、自己发现漏洞、自己完成一份完整工作的”数字同事”,已经正式上岗了。

欢迎进入新时代。请系好安全带——这趟车,可能比我们所有人预期的都快。