文|新眸 鹿尧
许多金融科技从业者面对AI时,都经历过类似的时刻。
团队做的AI投研助手Demo效果不错,能自己搜公告、找财报、做计算、整理研究材料。
但一扩规模,问题就来了:复杂任务需多轮搜索和工具调用,Token消耗飙升;数据口径偶有偏差,后续分析跟着跑偏,最后仍需人工复核。
于是问题从“模型能不能做”,变成了“算不算得过账,出了错谁来兜底?”
这也是大模型进入真实业务普遍撞上的两堵墙:成本与可信。
今年OpenAI、Anthropic、Google及国内厂商纷纷推Flash版、轻量版模型。原因并不复杂:旗舰模型代表能力上限,但日调用百万、千万次的业务,更关心同样完成任务花多少钱、多少时间、成功率多高。
“智效比”因此从技术问题变成产业问题。
大模型擅长生成“最可能的答案”,但真实世界需要的是“把事情办成”。两者之间隔着的,不只是参数规模,还有成本能否控制、错误能否约束、任务能否闭环。
01 Token开始记账之后
今年AI行业有个很流行的说法叫“The Great Inversion”——推理正在取代训练,成为AI最大的成本中心之一。
训练成本虽然高,但相对集中;推理却是一笔持续性支出。用户越多、任务越复杂、调用链条越长,成本就越高。
这与传统软件边际成本不断下降的逻辑并不完全相同。
Gartner今年曾预测,到2028年,复杂Agent工作流的推理成本可能显著增加。问题并不在于Token单价上涨——事实上单价一直在下降——而在于模型正在从“聊天”走向“做事”。
过去问一句、答一句就结束,现在一个Agent先拆解任务,再搜索、调用工具、验证结果、失败重试,最后生成答案。同样完成一个任务,消耗的Token和计算量可能是过去的数倍甚至数十倍。
这也是很多企业AI项目从Demo走向规模化时的真实困境。
Demo阶段每天只有几百次调用,成本几乎可以忽略;一旦进入真实业务,调用量扩大几个数量级,再加上运维、人工审核和错误修复,ROI很快承压。
麦肯锡针对全球企业的调查也反复呈现类似趋势:大量企业已经开展生成式AI试点,但真正能把AI规模化转化为经营收益的仍是少数。尤其在金融、制造等业务链复杂、数据和合规约束更强的行业,试点与规模化之间还有不小距离。
背后的商业逻辑其实很简单:
如果推理成本下不来,模型质量又不够替代人工,AI创造的价值就必须同时覆盖模型成本和新增的人力成本。
账算不过来,项目就很难规模化。
Token开始记账之后,大模型的游戏规则正在发生变化。
02 “智效比”为什么现在重要
今天的大模型市场,出现一条明显的路线分岔。
一是继续冲击能力上限。更大的模型、更长的思维链、更复杂的推理,目标是不断逼近更强的通用智能。
另一条则开始回答一个更现实的问题:在有限的算力、时延和成本下,怎样把单位任务的有效产出做到最大?
后者构成了今天“智效比”讨论的产业基础。
目前行业对“智效比”并没有统一定义。蚂蚁百灵给出的视角比较直接:与其只看一次推理花了多少Token,不如从端到端任务看——完成一件事情共花多少钱、要多久、重试多少次,最终结果是不是可靠。
换句话说,智效比并不是单纯追求“便宜”,而是在智能水平、计算成本、响应速度和任务完成率之间寻找平衡。
这也是为什么,MoE、低激活参数、Token效率、推理调度、缓存等技术开始越来越受重视。它们解决的是同一件事:把有限的计算资源花在真正有价值的地方。
蚂蚁百灵算是较早明确走上这条路线的模型团队之一。
据了解,蚂蚁内部此前就提出过计算效率、参数效率和Token效率“三个Efficiency”的理念,也较早开展MoE Scaling Law和混合线性注意力架构探索。
但真正让它重视智效比的,可能还是场景。
当模型进入亿级用户产品或者高频业务系统,推理成本不再是理论问题。模型能力、响应速度和成本必须同时考虑,否则越成功的产品,反而带来越大的计算压力。
因此,蚂蚁百灵的自我定位,不是单纯做能力最强的模型,而是做“真实世界的AI探索者”:把模型放进真实业务中,验证它能不能以可接受的成本把事情办成。
从Ling-2.6-flash开始,Token效率就成为其重点优化方向。官方资料显示,在一项评测中,Ling-2.6-flash以约1500万输出Token取得26分的Intelligence Index,而同期部分模型需要消耗超过1.1亿Token。
到了Ling-3.0-flash,这条路线更加明显。模型总参数124B,激活参数仅5.1B,目标就是在较小激活规模下维持较高智能水平。
从整个产业看,这两条路线并不矛盾。旗舰模型继续抬高能力上限,而Flash类模型负责把能力真正带入高频应用。
当行业从比“谁更聪明”走向比“谁能持续把事情做成”,智效比就不再只是一个公司的技术选择,而会成为大模型产业化的一项基础能力。
03 比成本更难的是“敢不敢用”
不过,高智效比只解决了“用得起”的问题。
进入企业以后,还有两个更难的问题:模型是否足够专业,以及企业是否敢让它真执行任务。
先看专业化。
过去很多人对行业模型的理解,是“拿大量行业数据再微调一次”。但进入业务以后,专业化不只是懂更多知识。
模型要能够读取企业私有数据、调用内部工具、遵循业务规则,还要按照特定格式交付结果。
也就是说,专业化已经从“知识专业化”走向“工作流专业化”。
金融尤其典型。
投资研究是一条长链路:搜索信息、判断信源、读取财报、计算数据、形成逻辑,最后完成报告。
Ling-3.0-flash-Fin选择投研作为切入口,本质上也是在验证模型能否进入这样一条完整工作链。
除了模型本身,百灵此次也开放了网页搜索、文件解析、Python、数据库和电子表格等工具接入能力,以及本地和私有化部署相关能力。
只有到了这一步,大模型才真正变成企业数字工作流的一部分。
而比专业化更难的是可信。
在开放式聊天里,偶尔答错没有太大关系;但在金融、医疗、工业等专业场景中,一个错误数据可能会影响最终结果。
因此行业从追求“不会幻觉的模型”,转向建设“不容易出事的系统”。
检索负责把模型拉回可靠资料,工具完成精确计算,评测发现问题,权限系统限制模型能做什么,日志记录执行过程,必要时再加入人工审核。
可信不再是模型单点能力,而是整个系统的工程能力。
百灵同步开放金融评测体系FinFIRST,也可以放在这个逻辑下理解。
今天海外已经有不少金融模型评测,但往往建立在北美市场的数据与业务环境之上。FinFIRST尝试解决的是本土金融场景中的问题:信源是否可靠、数据口径是否准确、分析过程能否溯源。
据官方介绍,FinFIRST由50余位金融专业人士参与设计,希望把金融研究中的专业判断,转化成可验证、可复用的评测方法。
Ling-3.0-flash-Fin目前已在FinFIRST、FinSearchComp Verified等金融智能体基准上接受测试,其综合表现超过部分更大尺寸的旗舰模型。
这里还有一个值得关注的现象。
专业化看起来是在给模型增加约束,但高质量专业场景也在反过来强化基础模型。
Ling-3.0-flash-Fin在经过高质量金融数据持续训练后,金融能力得到增强的同时,AA Intelligence Index也由38分提升至41分。
原因并不难理解。
金融对数据精度、逻辑严谨、工具调用和结论溯源的要求,本身就在逼模型提升推理、纠错和执行能力。
这些并不只属于金融,也属于通用智能的一部分。
真实场景因此不只是模型的“应用出口”,也可能成为模型继续进化的训练场。
这或许也是蚂蚁做金融模型最大的优势之一:它不仅拥有模型,也长期处在真实金融和商业场景中,不断用场景验证模型,再让模型能力反过来支持更多业务。
回到最关键的一个问题,高智效比是大模型迈向真实世界的可靠路径吗?
它是必要条件,但还不够。
只有低成本没有专业化和可信执行,关键场景里依然不敢用;只有专业化和可信执行没有低成本,大规模落地又算不过来账。如果模型既便宜又聪明,却无法进入企业内部数据和工具体系,最后只能停留在Demo里。
所以,AI真正进入产业以后,至少需要同时满足三个条件:智效比、专业化、可信执行。
蚂蚁百灵开源金融版模型,是这个趋势里的一个注脚。
它展示了一种可能:当一家公司愿意把模型、工具、评测和工作流放到同一个体系里,在真实世界里持续答题,AI就有机会变成一个能办事的基础设施。