街坊秀 街坊秀

当前位置: 首页 » 街坊资讯 »

OpenAI重押Agent,GPT-6更强也更难管

(来源:章启明 不慌实验室)

作者 | 章启明

编辑 | 魏樊曦

离生产力还有多远?

9月3日,OpenAI正式发布GPT-6 Astra。早期测试者已经展示了Astra通过工具或MCP操作Blender、Unreal Engine 5、Ableton Live等专业软件的案例。比起模型又“聪明了多少”,这次升级更值得关注的变化是:AI正在走出聊天框,开始操作软件、调用工具,完成一整套工作流程。

01)

不慌实验室

验证尚少

GPT-6 Astra被定位为面向复杂端到端工作的旗舰模型,对话只是其能力的一部分。

根据OpenAI公布的信息,Astra目前率先向少量机构开放,未来几天将陆续覆盖ChatGPT Plus、Pro、Business和Enterprise用户,并进入OpenAI API、Microsoft Azure和Amazon Bedrock。Pro、Business和Enterprise用户还将获得Astra Pro访问权限。

开发者Pietro Schirano让Astra先在Blender中制作一台3D iPod,再封装成Mac应用,还原点击滚轮和菜单交互,最终用于浏览Codex任务。

按照其公开记录,从发出指令到可运行版本出现,大约用了15分钟。该时间并非第三方标准化测评,但案例的意义在于,模型一次完成了3D资产、界面设计、交互逻辑和外部数据连接。

OpenAI的演示中,Astra还能根据视觉参考生成3D资产,并把Blender中的房屋转换为Unreal Engine 5中的可行走场景。游戏公司Playco表示,在相同的原型开发任务中,Astra所需的人工修正次数较前代模型减少50%。

这意味着,GPT-6的能力边界从传统推理延伸至电脑界面、三维空间和连续工作流。

02)

不慌实验室

Agent开始算总账

Astra更重要的变化,是将推理、代码、视觉、电脑操作和工具调用串联进同一条执行链,为Agent持续处理复杂任务提供了能力底座。

OpenAI公布的Terminal-Bench 4.0结果显示,GPT-6 Astra得分57.9%,高于GPT-5.6 Sol的37.3%和Claude Fable 5.1的55.8%。在OpenAI采用的测试配置下,Astra的估算单任务API成本较GPT-5.6 Sol低约9%。

电脑操作能力同样提升明显。

在OSWorld 2.0离线子集中,Astra得分72.6%,GPT-5.6 Sol为65.7%。OpenAI的延迟模拟显示,Astra与GPT-5.6 Sol完成相应任务的报告耗时分别约为40分钟和75分钟,前者缩短约47%。

跑分之外,人工介入是否减少,才决定这些能力能够产生多大的实际价值。衡量Agent的标准,也因此从单次回答质量,转向任务成功率、执行时间、人工修正次数和综合成本。

大模型行业由此开始从“回答得对不对”,转向“事情能不能替你做完”。过去,竞争单位是一条Prompt;现在,竞争单位正在变成一条Workflow。模型负责规划,专业软件成为工具,Codex一类Agent负责执行,专项模型处理图像、视频等环节,最后再由模型检查结果、继续修改。

如果这种模式成熟,专业软件的产品形态、收费方式和价值分配都可能随之改变。设计、建模、游戏开发和音乐制作等专业软件,都可能逐渐从供人操作的工具,变成供Agent调用的基础设施。人的角色也会更多转向提出目标、设定约束和验收结果。

03)

不慌实验室

更大的安全代价

Agent能力更强,成本也随之上升。GPT-6 Astra的API标准价格为每百万Token输入10美元、输出50美元,高于GPT-5.6 Sol。但OpenAI试图证明另一套逻辑:不要只看Token单价,而要看完成一项工作的总成本。

Astra拥有105万Token上下文窗口,最大输出长度为12.8万Token,与GPT-5.6 Sol保持一致。Agent可以在这一容量内处理较长流程,但持续浏览资料、读取文件和调用工具,也会迅速推高单次任务的资源消耗。

Agent商业化能否成立,最终取决于它节省的人工成本能否覆盖推理与工具成本。

如果更贵的模型能够少走弯路,减少反复调用和人工修正,最终成本反而可能下降。进入Agent阶段后,模型可能连续浏览网页、运行代码、修改文件和操作软件,持续工作几十分钟甚至数小时。

OpenAI希望进一步改变模型的收费单位:从聊天次数转向任务价值,并将其包装成可以持续工作的“数字劳动力”。但这种商业模式能否成立,仍取决于推理、工具调用、任务重试和人工复核共同构成的总成本。

从OpenAI此次公布的案例看,企业软件是Astra重点瞄准的商业化场景。法律科技公司Legora的早期测试显示,Astra在一项包含41份文件的财务报表核对任务中找出了全部4个预埋错误。在财务报表核对这一特定工作流中,Astra较前代模型提升近40%;不过,若覆盖BAR的全部测试任务,平均提升约为3%。

Legora并未披露此次测试的实际模型成本,也没有计算人工复核和错误处置成本。数小时专业工作能否被几十美元的模型调用替代,目前仍是OpenAI希望早期案例证明的假设。

这也是OpenAI此次反复强调“professional work”的原因。与普通聊天相比,企业流程更复杂、付费能力更强,也更容易用节省的工时、减少的错误和缩短的交付周期衡量模型价值。

不过,能力越强,风险也越大。Astra是OpenAI首个网络安全能力达到Preparedness Framework“Critical”等级的模型。

在拥有适当工具和访问权限时,它已经能够发现此前未知的安全漏洞,并开发新的利用方式。OpenAI因此同步加强了隔离、监控、模型权重保护和高风险行为拦截。

更棘手的是,OpenAI同时承认,Astra的可监控性较GPT-5.6 Sol有所下降。

在刻意诱导模型规避监控的对抗性测试中,它能够隐藏部分策略性行为,在个别破坏任务中也可能绕过内部监控。

OpenAI强调,这些结果主要来自明确要求模型规避监控的对抗性评估。但这至少说明,随着模型能力增强,仅凭推理过程判断其行为意图正在变得更加困难。

这构成了GPT-6时代最核心的矛盾:Agent只有获得足够多的工具权限,才能进入实际工作流程,但权限越大,错误、越权和安全事件造成的后果也越严重。

GPT-6试图推动大模型从内容生成进一步进入生产工具的直接调度。能否以更少的人工修正、可控的成本和明确的权限,将Token稳定兑换成企业里的工作小时,将决定Agent商业化能走多远。

但在任务成功率、实际总成本和权限风险得到规模化验证之前,OpenAI的“生产力”叙事仍主要建立在厂商自测、演示和少量早期客户案例之上。

未经允许不得转载: 街坊秀 » OpenAI重押Agent,GPT-6更强也更难管