(来源:章启明 不慌实验室)
作者 | 章启明
编辑 | 魏樊曦
离生产力还有多远?
9月3日,OpenAI正式发布GPT-6 Astra。早期测试者已经展示了Astra通过工具或MCP操作Blender、Unreal Engine 5、Ableton Live等专业软件的案例。比起模型又“聪明了多少”,这次升级更值得关注的变化是:AI正在走出聊天框,开始操作软件、调用工具,完成一整套工作流程。
01)
不慌实验室
验证尚少
GPT-6 Astra被定位为面向复杂端到端工作的旗舰模型,对话只是其能力的一部分。
根据OpenAI公布的信息,Astra目前率先向少量机构开放,未来几天将陆续覆盖ChatGPT Plus、Pro、Business和Enterprise用户,并进入OpenAI API、Microsoft Azure和Amazon Bedrock。Pro、Business和Enterprise用户还将获得Astra Pro访问权限。
开发者Pietro Schirano让Astra先在Blender中制作一台3D iPod,再封装成Mac应用,还原点击滚轮和菜单交互,最终用于浏览Codex任务。
按照其公开记录,从发出指令到可运行版本出现,大约用了15分钟。该时间并非第三方标准化测评,但案例的意义在于,模型一次完成了3D资产、界面设计、交互逻辑和外部数据连接。
OpenAI的演示中,Astra还能根据视觉参考生成3D资产,并把Blender中的房屋转换为Unreal Engine 5中的可行走场景。游戏公司Playco表示,在相同的原型开发任务中,Astra所需的人工修正次数较前代模型减少50%。
这意味着,GPT-6的能力边界从传统推理延伸至电脑界面、三维空间和连续工作流。
02)
不慌实验室
Agent开始算总账
Astra更重要的变化,是将推理、代码、视觉、电脑操作和工具调用串联进同一条执行链,为Agent持续处理复杂任务提供了能力底座。
OpenAI公布的Terminal-Bench 4.0结果显示,GPT-6 Astra得分57.9%,高于GPT-5.6 Sol的37.3%和Claude Fable 5.1的55.8%。在OpenAI采用的测试配置下,Astra的估算单任务API成本较GPT-5.6 Sol低约9%。
电脑操作能力同样提升明显。
在OSWorld 2.0离线子集中,Astra得分72.6%,GPT-5.6 Sol为65.7%。OpenAI的延迟模拟显示,Astra与GPT-5.6 Sol完成相应任务的报告耗时分别约为40分钟和75分钟,前者缩短约47%。
跑分之外,人工介入是否减少,才决定这些能力能够产生多大的实际价值。衡量Agent的标准,也因此从单次回答质量,转向任务成功率、执行时间、人工修正次数和综合成本。
大模型行业由此开始从“回答得对不对”,转向“事情能不能替你做完”。过去,竞争单位是一条Prompt;现在,竞争单位正在变成一条Workflow。模型负责规划,专业软件成为工具,Codex一类Agent负责执行,专项模型处理图像、视频等环节,最后再由模型检查结果、继续修改。
如果这种模式成熟,专业软件的产品形态、收费方式和价值分配都可能随之改变。设计、建模、游戏开发和音乐制作等专业软件,都可能逐渐从供人操作的工具,变成供Agent调用的基础设施。人的角色也会更多转向提出目标、设定约束和验收结果。
03)
不慌实验室
更大的安全代价
Agent能力更强,成本也随之上升。GPT-6 Astra的API标准价格为每百万Token输入10美元、输出50美元,高于GPT-5.6 Sol。但OpenAI试图证明另一套逻辑:不要只看Token单价,而要看完成一项工作的总成本。
Astra拥有105万Token上下文窗口,最大输出长度为12.8万Token,与GPT-5.6 Sol保持一致。Agent可以在这一容量内处理较长流程,但持续浏览资料、读取文件和调用工具,也会迅速推高单次任务的资源消耗。
Agent商业化能否成立,最终取决于它节省的人工成本能否覆盖推理与工具成本。
如果更贵的模型能够少走弯路,减少反复调用和人工修正,最终成本反而可能下降。进入Agent阶段后,模型可能连续浏览网页、运行代码、修改文件和操作软件,持续工作几十分钟甚至数小时。
OpenAI希望进一步改变模型的收费单位:从聊天次数转向任务价值,并将其包装成可以持续工作的“数字劳动力”。但这种商业模式能否成立,仍取决于推理、工具调用、任务重试和人工复核共同构成的总成本。
从OpenAI此次公布的案例看,企业软件是Astra重点瞄准的商业化场景。法律科技公司Legora的早期测试显示,Astra在一项包含41份文件的财务报表核对任务中找出了全部4个预埋错误。在财务报表核对这一特定工作流中,Astra较前代模型提升近40%;不过,若覆盖BAR的全部测试任务,平均提升约为3%。
Legora并未披露此次测试的实际模型成本,也没有计算人工复核和错误处置成本。数小时专业工作能否被几十美元的模型调用替代,目前仍是OpenAI希望早期案例证明的假设。
这也是OpenAI此次反复强调“professional work”的原因。与普通聊天相比,企业流程更复杂、付费能力更强,也更容易用节省的工时、减少的错误和缩短的交付周期衡量模型价值。
不过,能力越强,风险也越大。Astra是OpenAI首个网络安全能力达到Preparedness Framework“Critical”等级的模型。
在拥有适当工具和访问权限时,它已经能够发现此前未知的安全漏洞,并开发新的利用方式。OpenAI因此同步加强了隔离、监控、模型权重保护和高风险行为拦截。
更棘手的是,OpenAI同时承认,Astra的可监控性较GPT-5.6 Sol有所下降。
在刻意诱导模型规避监控的对抗性测试中,它能够隐藏部分策略性行为,在个别破坏任务中也可能绕过内部监控。
OpenAI强调,这些结果主要来自明确要求模型规避监控的对抗性评估。但这至少说明,随着模型能力增强,仅凭推理过程判断其行为意图正在变得更加困难。
这构成了GPT-6时代最核心的矛盾:Agent只有获得足够多的工具权限,才能进入实际工作流程,但权限越大,错误、越权和安全事件造成的后果也越严重。
GPT-6试图推动大模型从内容生成进一步进入生产工具的直接调度。能否以更少的人工修正、可控的成本和明确的权限,将Token稳定兑换成企业里的工作小时,将决定Agent商业化能走多远。
但在任务成功率、实际总成本和权限风险得到规模化验证之前,OpenAI的“生产力”叙事仍主要建立在厂商自测、演示和少量早期客户案例之上。