街坊秀 街坊秀

当前位置: 首页 » 街坊资讯 »

大模型的分岔口,智效比是探索真实世界的答案吗?

文|新眸 鹿尧

许多金融科技从业者面对AI时,都经历过类似的时刻。

团队做的AI投研助手Demo效果不错,能自己搜公告、找财报、做计算、整理研究材料。

但一扩规模,问题就来了:复杂任务需多轮搜索和工具调用,Token消耗飙升;数据口径偶有偏差,后续分析跟着跑偏,最后仍需人工复核。

于是问题从“模型能不能做”,变成了“算不算得过账,出了错谁来兜底?”

这也是大模型进入真实业务普遍撞上的两堵墙:成本与可信。

今年OpenAI、Anthropic、Google及国内厂商纷纷推Flash版、轻量版模型。原因并不复杂:旗舰模型代表能力上限,但日调用百万、千万次的业务,更关心同样完成任务花多少钱、多少时间、成功率多高。

“智效比”因此从技术问题变成产业问题。

大模型擅长生成“最可能的答案”,但真实世界需要的是“把事情办成”。两者之间隔着的,不只是参数规模,还有成本能否控制、错误能否约束、任务能否闭环。

01 Token开始记账之后

今年AI行业有个很流行的说法叫“The Great Inversion”——推理正在取代训练,成为AI最大的成本中心之一。

训练成本虽然高,但相对集中;推理却是一笔持续性支出。用户越多、任务越复杂、调用链条越长,成本就越高。

这与传统软件边际成本不断下降的逻辑并不完全相同。

Gartner今年曾预测,到2028年,复杂Agent工作流的推理成本可能显著增加。问题并不在于Token单价上涨——事实上单价一直在下降——而在于模型正在从“聊天”走向“做事”。

过去问一句、答一句就结束,现在一个Agent先拆解任务,再搜索、调用工具、验证结果、失败重试,最后生成答案。同样完成一个任务,消耗的Token和计算量可能是过去的数倍甚至数十倍。

这也是很多企业AI项目从Demo走向规模化时的真实困境。

Demo阶段每天只有几百次调用,成本几乎可以忽略;一旦进入真实业务,调用量扩大几个数量级,再加上运维、人工审核和错误修复,ROI很快承压。

麦肯锡针对全球企业的调查也反复呈现类似趋势:大量企业已经开展生成式AI试点,但真正能把AI规模化转化为经营收益的仍是少数。尤其在金融、制造等业务链复杂、数据和合规约束更强的行业,试点与规模化之间还有不小距离。

背后的商业逻辑其实很简单:

如果推理成本下不来,模型质量又不够替代人工,AI创造的价值就必须同时覆盖模型成本和新增的人力成本。

账算不过来,项目就很难规模化。

Token开始记账之后,大模型的游戏规则正在发生变化。

02 “智效比”为什么现在重要

今天的大模型市场,出现一条明显的路线分岔。

一是继续冲击能力上限。更大的模型、更长的思维链、更复杂的推理,目标是不断逼近更强的通用智能。

另一条则开始回答一个更现实的问题:在有限的算力、时延和成本下,怎样把单位任务的有效产出做到最大?

后者构成了今天“智效比”讨论的产业基础。

目前行业对“智效比”并没有统一定义。蚂蚁百灵给出的视角比较直接:与其只看一次推理花了多少Token,不如从端到端任务看——完成一件事情共花多少钱、要多久、重试多少次,最终结果是不是可靠。

换句话说,智效比并不是单纯追求“便宜”,而是在智能水平、计算成本、响应速度和任务完成率之间寻找平衡。

这也是为什么,MoE、低激活参数、Token效率、推理调度、缓存等技术开始越来越受重视。它们解决的是同一件事:把有限的计算资源花在真正有价值的地方。

蚂蚁百灵算是较早明确走上这条路线的模型团队之一。

据了解,蚂蚁内部此前就提出过计算效率、参数效率和Token效率“三个Efficiency”的理念,也较早开展MoE Scaling Law和混合线性注意力架构探索。

但真正让它重视智效比的,可能还是场景。

当模型进入亿级用户产品或者高频业务系统,推理成本不再是理论问题。模型能力、响应速度和成本必须同时考虑,否则越成功的产品,反而带来越大的计算压力。

因此,蚂蚁百灵的自我定位,不是单纯做能力最强的模型,而是做“真实世界的AI探索者”:把模型放进真实业务中,验证它能不能以可接受的成本把事情办成。

从Ling-2.6-flash开始,Token效率就成为其重点优化方向。官方资料显示,在一项评测中,Ling-2.6-flash以约1500万输出Token取得26分的Intelligence Index,而同期部分模型需要消耗超过1.1亿Token。

到了Ling-3.0-flash,这条路线更加明显。模型总参数124B,激活参数仅5.1B,目标就是在较小激活规模下维持较高智能水平。

从整个产业看,这两条路线并不矛盾。旗舰模型继续抬高能力上限,而Flash类模型负责把能力真正带入高频应用。

当行业从比“谁更聪明”走向比“谁能持续把事情做成”,智效比就不再只是一个公司的技术选择,而会成为大模型产业化的一项基础能力。

03 比成本更难的是“敢不敢用”

不过,高智效比只解决了“用得起”的问题。

进入企业以后,还有两个更难的问题:模型是否足够专业,以及企业是否敢让它真执行任务。

先看专业化。

过去很多人对行业模型的理解,是“拿大量行业数据再微调一次”。但进入业务以后,专业化不只是懂更多知识。

模型要能够读取企业私有数据、调用内部工具、遵循业务规则,还要按照特定格式交付结果。

也就是说,专业化已经从“知识专业化”走向“工作流专业化”。

金融尤其典型。

投资研究是一条长链路:搜索信息、判断信源、读取财报、计算数据、形成逻辑,最后完成报告。

Ling-3.0-flash-Fin选择投研作为切入口,本质上也是在验证模型能否进入这样一条完整工作链。

除了模型本身,百灵此次也开放了网页搜索、文件解析、Python、数据库和电子表格等工具接入能力,以及本地和私有化部署相关能力。

只有到了这一步,大模型才真正变成企业数字工作流的一部分。

而比专业化更难的是可信。

在开放式聊天里,偶尔答错没有太大关系;但在金融、医疗、工业等专业场景中,一个错误数据可能会影响最终结果。

因此行业从追求“不会幻觉的模型”,转向建设“不容易出事的系统”。

检索负责把模型拉回可靠资料,工具完成精确计算,评测发现问题,权限系统限制模型能做什么,日志记录执行过程,必要时再加入人工审核。

可信不再是模型单点能力,而是整个系统的工程能力。

百灵同步开放金融评测体系FinFIRST,也可以放在这个逻辑下理解。

今天海外已经有不少金融模型评测,但往往建立在北美市场的数据与业务环境之上。FinFIRST尝试解决的是本土金融场景中的问题:信源是否可靠、数据口径是否准确、分析过程能否溯源。

据官方介绍,FinFIRST由50余位金融专业人士参与设计,希望把金融研究中的专业判断,转化成可验证、可复用的评测方法。

Ling-3.0-flash-Fin目前已在FinFIRST、FinSearchComp Verified等金融智能体基准上接受测试,其综合表现超过部分更大尺寸的旗舰模型。

这里还有一个值得关注的现象。

专业化看起来是在给模型增加约束,但高质量专业场景也在反过来强化基础模型。

Ling-3.0-flash-Fin在经过高质量金融数据持续训练后,金融能力得到增强的同时,AA Intelligence Index也由38分提升至41分。

原因并不难理解。

金融对数据精度、逻辑严谨、工具调用和结论溯源的要求,本身就在逼模型提升推理、纠错和执行能力。

这些并不只属于金融,也属于通用智能的一部分。

真实场景因此不只是模型的“应用出口”,也可能成为模型继续进化的训练场。

这或许也是蚂蚁做金融模型最大的优势之一:它不仅拥有模型,也长期处在真实金融和商业场景中,不断用场景验证模型,再让模型能力反过来支持更多业务。

回到最关键的一个问题,高智效比是大模型迈向真实世界的可靠路径吗?

它是必要条件,但还不够。

只有低成本没有专业化和可信执行,关键场景里依然不敢用;只有专业化和可信执行没有低成本,大规模落地又算不过来账。如果模型既便宜又聪明,却无法进入企业内部数据和工具体系,最后只能停留在Demo里。

所以,AI真正进入产业以后,至少需要同时满足三个条件:智效比、专业化、可信执行。

蚂蚁百灵开源金融版模型,是这个趋势里的一个注脚。

它展示了一种可能:当一家公司愿意把模型、工具、评测和工作流放到同一个体系里,在真实世界里持续答题,AI就有机会变成一个能办事的基础设施。

未经允许不得转载: 街坊秀 » 大模型的分岔口,智效比是探索真实世界的答案吗?