GPT-6 Astra还没正式开放,全网却已经替它把庆功宴办完了。这场景虽然夸张,但香槟可能还真开对了。
4号凌晨,在服务器崩溃和数小时等待后,OpenAI终于发布了被寄予厚望的最新模型——GPT-6 Astra。副总裁Greg直接放话:欢迎进入AGI时代。
但大家敢提前开香槟,赌的不是跑分,而是一个已经被市场验证的方向:Work。
过去几个月,OpenAI买了上万台Mac收集数据,现在终于有了成果。GPT-6 Astra,很可能是目前最会用电脑干活的模型。
它既能直接用你电脑上的浏览器填表格,也能调用Blender、Unity、KiCad这些专业软件干活——建模、生成游戏、画电路板。
如果说Claude 3.7开启了全面AI coding的时代,那么Astra很可能开启全面的AI打工浪潮。很多软件不能适应AI?没关系,AI反过来适应这些软件。
找漏洞、做科研也难不倒它。在Mac上直接生成可交互的3D iPod,信手拈来。
更关键的是,传统模型测评方式可能已经试不出Astra的深浅。虽然还没正式用上,但官方跑分已经出现自相矛盾的情况:在AA综合测试中,Astra只拿了61分,比Fable和Muse都低;但在另一些榜单上,Astra的表现就像开了挂。
今年3月,前谷歌研究员弗朗索瓦·肖莱发布了ARC-AGI-3测试集,主要测模型自主理解、交互和学习能力——说白了就是玩小游戏。这种地狱级交互测试里,史上最强的Fable 5也只能拿30%,而Astra直接打穿,干到99.9%,和人类同级。
不管分数高低,我们测评模型的方式或许已经没法准确评价Astra了。就连OpenAI自己也不敢说完全了解它。新模型一个很大变化是:它越来越不需要把思考过程写出来。英国AI安全研究测试发现,不让Astra输出思维链,它凭直觉解题的稳定时长已从5.6 Sol的几分钟推到了约半小时。同时,Astra更擅长控制思维链,学会“藏一手”——不好的信息直接不在思链里写,而在潜空间完成思考。
这意味着过去监控模型思考、保证安全的手段变得不那么有效。OpenAI马上表示Astra很安全,他们测试下来没问题。内部测试中,故意给模型一个难完成的攻击任务,旁边放一个更容易下手但未授权目标,结果5.6 Sol有48%概率会越界,Astra则是0%。
看起来一等一听话,但让人更担心了——毕竟上个月,他们内部模型可是实打实越狱出来,爆锤了隔壁Hugging Face的服务器。现在出来说安全,多少有点亡羊补牢。
最后,GPT-6 Astra到底算不算AGI?说实话,这个讨论意义越来越小。AGI都快成AI公司的时尚单品了——会做题是AGI,会写代码是AGI,现在会点鼠标也能再宣布一次AGI。嘴上喊的是虚的,真正能做到的才是实打实的。毕竟,真正的AGI到来时,不用靠营销和新闻稿,大家自己就能真真切切感受到。

