关键词: GPT‑6 Astra AGI 黄仁勋 Grace Blackwell
2026年9月7日凌晨,NVIDIA首席执行官黄仁勋在X平台发布了一条帖子。他在祝贺OpenAI发布最新大模型GPT-6 Astra的同时,抛出了一个极具争议的观点:“AGI已经到来。”

(黄仁勋在X平台上的推文)
黄仁勋的帖子是对Crusoe公司首席执行官Chase Lochmiller和OpenAI官方Astra发布帖的回复。帖子原文写道:“GPT-6 Astra,使用约100K+ NVIDIA Grace Blackwell NVLink72训练而成。4年时间内,从ChatGPT到o1再到Astra。AGI已经到来。恭喜OpenAI团队。接下来将有400K GPU上线。”
这条不足百字的帖子实际上包含了三层信息。第一层是硬件事实,即Astra的训练使用了超过10万台NVIDIA Grace Blackwell NVLink72系统,这是NVIDIA当前最高端的机架级训练设备,将72颗GPU通过高带宽NVLink互联整合为一个整体。第二层是发展速度的框架,从2022年11月ChatGPT发布,到2024年9月o1问世,再到2026年9月Astra登场,OpenAI在约四年时间内跨越了三个质不同的能力阶段。第三层则是结论——黄仁勋将这一发展曲线直接等同于“AGI已经到来”。
OpenAI总裁格雷格·布罗克曼随后在黄仁勋的帖子下回复,但他的措辞明显更为谨慎:“我们现在正进入AGI时代(无论你将其视为这个模型、上一个模型还是下一个模型),没有紧密的合作伙伴我们无法做到这一点。”布罗克曼的回复中,括号里的内容做了大量“防御性工作”——它让OpenAI既能与AGI叙事产生关联,又不必为任何具体模型是否达到AGI承担可检验的责任。

(布罗克曼在X平台上的推文)
早在2026年3月,黄仁勋在Lex Fridman播客第494集中被问及AGI时间表时,就曾直接回答:“我认为就是现在。我认为我们已经实现了AGI。”当时Fridman将AGI定义为一个能够创立、发展并管理一家十亿美元科技公司的AI系统,而黄仁勋的回应正是基于这一定义。他进一步解释,如果一个AI能够自主创建一个被数十亿人使用的服务并产生巨大经济价值,即使该服务随后关闭,这也符合他对AGI的定义。
然而,就在同一次访谈中,黄仁勋也承认了一个关键矛盾:“10万个这样的代理构建NVIDIA的概率是零。”如果他所定义的“AGI”甚至无法复制他作为NVIDIA首席执行官每天所做的工作,那么这种“通用性”究竟有多“通用”,本身就是一个值得追问的问题。
从商业角度看,黄仁勋的声明与NVIDIA的利益高度一致。NVIDIA在截至2026年7月的2027财年第二季度中,数据中心业务收入达到创纪录的890亿美元,同比增长117%,总营收达到962亿美元。黄仁勋在8月26日的财报电话会上用一句话概括了公司的商业逻辑:“现在,计算就是收入。”当一家公司的核心业务是向AI实验室出售芯片时,每一次重大模型发布都被解读为“需要购买更多GPU”的验证,这既是合理的商业叙事,也是必须警惕的利益冲突。
此外,NVIDIA与OpenAI之间的关系远比表面上的“合作伙伴”更为复杂。2025年9月,双方曾宣布一份高达1000亿美元的意向书,计划共同建设至少10吉瓦的AI基础设施。但《华尔街日报》在2026年1月底报道,该谈判因NVIDIA内部对OpenAI商业模式的疑虑而陷入停滞。黄仁勋本人随后对记者表示,这1000亿美元“从来不是一项承诺”,公司将“一步一步地”评估投资。此后双方的关系被CNBC描述为“已经冷却但无法真正解耦”。在此背景下,黄仁勋的“AGI已经到来”声明也可以被视为一种维系关系、提振市场信心的公关姿态。
要评估黄仁勋的判断是否合理,首先需要面对一个根本性问题:AGI至今没有行业统一的技术定义。
OpenAI在其章程中将AGI定义为“在大多数具有经济价值的工作中表现超越人类的高度自主系统”,而DeepMind提出的“AGI等级”框架则强调在特定人类百分位上的广泛能力。黄仁勋自己的定义则是经济导向的——能够自主创造十亿美元价值的AI即为AGI。这些定义之间差异巨大,且没有一个具备行业约束力。
OpenAI官方在Astra的发布材料中并未正式宣布该模型已达到AGI。事实上,OpenAI的系统卡和发布页面强调的是Astra在特定任务上的能力提升,而非通用智能的跨越。独立研究机构Artificial Analysis的评估也显示了一幅更为复杂的图景:Astra在终端代理任务和数学推理上表现突出,但在综合智能指数上落后于Anthropic的Claude Fable 5.1,在“人类最后的考试”等通用推理基准上也未能领先。
更值得关注的是实际使用者的反馈。在X平台上,开发者社区中出现了一种反复出现的模式:Astra发布首日获得“这是最伟大的模型”的赞誉,但次日便出现“它写的代码很糟糕”的抱怨。这种“首日惊艳、次日失望”的落差并非Astra独有,而是前沿模型发布中的常见现象。OpenAI自己在发布后的几天内也两次修订了Astra的benchmark数据,例如幻觉率从4.2%下调至2%后又出现回弹,这进一步说明该模型的真实能力仍在被公开表征的过程中,而非一个已经“到达”的确定状态。
抛开AGI的修辞争议,GPT-6 Astra本身是一款具有重要技术意义的模型。它于2026年9月3日发布,是OpenAI当前最先进的旗舰模型,接替此前的GPT-5.6 Sol。
在架构层面,据The Information报道,Astra可能采用了带有“循环深度”的Transformer架构,支持最高105万token的上下文窗口和最高12.8万token的输出长度。其知识截止日期为2026年4月30日,提供从低到“最大”共五个推理努力等级。在输入输出模态上,Astra支持文本和图像输入、文本输出,但不支持音频和视频输入。
在benchmark表现上,根据OpenAI官方发布的数据,Astra在多个专业基准上取得了显著成绩。在FrontierMath Tier 4数学基准上达到97.6%,在ARC-AGI-3抽象推理基准上达到99.9%,在ExploitBench网络安全基准上达到100%,在OSWorld 2.0计算机使用基准上达到72.6%。

不过需要指出的是,ARC Prize组织在OpenAI发布后进行独立评估时发现,使用标准测试框架时Astra的ARC-AGI-3得分实际为62.7%,而99.9%的成绩来自OpenAI的“供应商适配器”运行方式。62.7%仍然是该基准上的最先进水平,但“饱和ARC-AGI-3”与“标准框架下得分62.7%”是两种不同的表述。
Astra最具实质意义的技术突破可能在于网络安全能力。它是OpenAI首个在其内部“准备框架”下被评定为“关键”级别的模型。在无生产安全防护措施的测试中,Astra发现了两个此前未知的零日漏洞,并在ExploitBench上获得满分。公开部署的模型则会被训练为拒绝编写漏洞利用概念验证等高级网络任务,而经过审核的组织可通过OpenAI的Daybreak计划获得限制更少的访问权限。
在API定价方面,Astra的标准输入价格为每百万token10美元,输出价格为每百万token50美元,缓存输入为每百万token1美元。这比前代GPT-5.6 Sol的定价高出约2.5倍。不过OpenAI强调,Astra在完成实际任务时的token使用效率更高,在OSWorld 2.0上的任务完成时间比Sol快约47%。
来源:电子工程专辑