OpenAI 在 GPT-6 Astra 的发布页上放了一个演示,模型在 Blender 里给一栋房子建模,再把它变成 Unreal Engine 5 里可以走进去的场景,设计师和客户可以在房子盖起来之前先体验一遍空间。
一、到底强在哪
在 OSWorld 2.0 的延迟模拟里,Astra 拿到 72.6% 的成绩,每个任务耗时约 40 分钟。上一代 GPT-5.6 Sol 是 65.7%,约 75 分钟。准确率更高,单任务时间少了大约 47%。
AutomationBench 上的差距更大。Astra 41.4%,Sol 18.1%,Claude Fable 5.1 是 31.4%,Claude Opus 5 是 26.9%。
这是一次真实的代际提升,而且提升的方向很明确,不在于回答得更好,在于操作得更快更准。
二、不是最聪明的那个
Artificial Analysis Intelligence Index v4.1.1 上,Astra 得分 61.2。同一张表里,Claude Fable 5.1 是 65.7,Claude Opus 5 是 63.1,Claude Fable 5 是 62.1。Astra 排在这几个模型后面。
我认为这两组数字放在一起才有意义。**Astra 是被专门训练成会用电脑的模型,不是被训练成更会思考的模型。**在通用智能维度上它甚至没有拿到第一,但在操作软件这件事上它把同代拉开了一个身位。
这是一个明确的产品选择,不是能力的全面碾压。对选型的人来说,这意味着任务类型比模型排名更重要。要它替你在软件里跑一套繁琐流程,选它;要它帮你想清楚一个复杂问题,答案可能是另一个。

三、2.4% 这个数字的意义
发布页上有一项内部 computer use 安全基准,数值越低越好。
Astra 是 2.4%,GPT-5.6 Sol 是 22.0%,Claude Fable 5.1 是 9.5%,Claude Opus 5 是 11.5%。
差距接近十倍。OpenAI 还说明,在专门挑选出来诱导模型做出不当行为的对抗性任务里,Astra 更善于避免意外后果。
我觉得这一项才是它敢把 computer use 作为主打能力推出来的前提。让模型接管屏幕、点击、输入、打开应用,风险从回答错了升级成动作做错了。安全指标没有先做上去,其他能力再强也不敢开这个口子。
四、这笔账怎么算
用四十分钟和一笔 token 消耗,换掉的是一个熟练工的一两个小时,同时要接受大约三成的失败率和重试成本。
我的判断是,这笔账目前只在一类场景里划算,就是那些步骤繁琐、结果可验证、做错了重来代价很低的活。自动化 QA 是典型,把生成好的素材按规格排进设计稿也是。反过来,需要来回权衡、失败代价高、或者中途要改主意的工作,让它自己跑四十分钟,多半是在烧钱。
五、贬值的是什么
「执行能力正在贬值」这个说法这几天说的很多,我认为它描述过于宽泛。
真正在贬值的是熟练操作软件这项技能的溢价。会用 Blender、会在 Unity 里搭场景、知道某个功能藏在哪级菜单里,这些能力过去需要几百小时练出来,现在一部分可以交给模型来完成。
但执行本身没有贬值。判断一个模型跑了四十分钟的结果对不对,需要的恰恰是执行经验。没做过的人看不出哪里不对,也没法判断是该重试还是该换个思路。
对产品经理来说,可以现在就动的一件事是把工作流里的步骤分类。哪些是有明确验收标准、做错了能一眼看出来的,这些可以开始试着交出去。哪些依赖综合判断,则先留着。
写到最后
Astra 确实把电脑操作又往前推了一大步,但它还是一个成本很贵、偶尔失手、需要人盯的熟练助手。
常规软件操作能力很难成为专业优势,但对于方向的选择、商业的判断,会变得更加稀缺。