街坊秀 街坊秀

当前位置: 首页 » 街坊资讯 »

当AI客服学会"看情况说话":一个关于公平比较的故事

  炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!

(来源:科技行者)

你有没有遇到过这样的客服机器人:你问它一个复杂问题,它闷头处理了十几秒,中间一声不吭,最后突然甩给你一个结果,你都不知道它是死机了还是在认真工作。

这背后其实藏着一个挺有意思的技术难题。今天要聊的这篇论文,来自蚂蚁国际的研究团队,他们发现了一个此前很少有人认真讨论过的问题:当AI客服可以用好几种不同方式回应你的时候,训练它的方法本身可能就是不公平的。

这句话听起来有点绕,别急,我们从头说。

一个被忽略的假设:同组比较真的公平吗

现在训练AI对话模型,主流方法是一种叫做"分组强化学习"的技术。

**分组强化学习**:让AI针对同一个问题生成好几个不同的回答,然后互相比较打分,表现好的回答会被"奖励",表现差的会被"惩罚",这样AI就慢慢学会怎样回答更好。

这套方法在数学解题、代码生成这类任务上效果拔群,原因很简单:这些任务有标准答案,几个回答放在一起比较,谁对谁错一目了然。

但客服场景不一样。

假设你问AI"帮我订一张明天去东京的机票",这个AI其实有好几种"正确"的应对方式:它可以直接查票然后订上;可以先问你几点出发、经济舱还是商务舱;可以一边查票一边告诉你"正在搜索中,请稍等";如果涉及扣款这种不可逆操作,它甚至应该先跟你确认一遍需求再动手。

这几种做法都没有错,但风格完全不同。问题来了:如果训练时把这几种风格的回答放进同一个比较组里打分,会发生什么?

论文的作者们意识到,评分模型(也就是那个负责打分的"裁判")本身是有偏见的。它可能天然更喜欢简洁直接的回答,也可能天然更喜欢啰嗦周到的回答。这种偏见如果均匀分布在各种风格上还好说,但现实是,不同风格落在评分模型偏好地图上的位置是不一样的。于是原本应该只反映"回答质量"的分数差异,悄悄掺进了"评分模型对这种说话方式的偏好"。

这就好比一场歌唱比赛,评委原本应该只打分谁唱得准、有感情,但评委恰好偏爱抒情慢歌,厌恶说唱。如果把抒情歌手和说唱歌手放进同一组打分,那么打分高低就不再单纯反映唱功,而是掺杂了评委对曲风的偏好。如果不把这两类分开评分,说唱歌手无论唱得多好,都会系统性地吃亏,长期下来所有选手都会被迫改唱抒情慢歌,哪怕说唱才是他们真正擅长的领域。

研究团队把这个现象叫做**奖励公平性问题**(reward fairness problem),意思是当同一个提示词下存在多种合理的应对策略时,把它们混在一起比较,会让相对优势的估计产生偏差,进而把模型往"评分模型偏爱"的方向调教,而不是往"真正适合当下场景"的方向调教。

这个发现挺关键的,因为它指出了一个此前大家默认成立、但其实经不起推敲的假设:分组比较的前提是组内样本"可比",可一旦任务本身是开放式的,这个前提就悄悄崩塌了。

解决方案:ARC,把比较关进"同类型"的笼子里

问题找到了,那怎么解决?

团队提出的方法叫**ARC**(Advantage Regularization via Conditioning,通过条件化实现优势正则化)。

核心思路其实很朴素:既然不同策略之间不能公平比较,那就别让它们比较。

具体做法是这样的:在训练阶段,给每一条训练数据都提前贴上一个"策略标签",比如"这次请用直接回答的方式"或者"这次请先跟用户确认一下"。然后让AI针对同一个策略标签生成好几个回答,这些回答风格是统一的,只是具体表达和执行细节不同。接下来只在这个"同策略小组"内部计算相对优势,不同策略之间不发生任何比较。

到了实际使用阶段,这个策略标签就被拿掉了,AI需要自己判断当前场景该用哪种策略应对,不再依赖任何提示。

这就像体育比赛里的分级别赛制。举重比赛不会让50公斤级选手和105公斤级选手同场用绝对重量一较高下,而是按体重分组,组内比。如果不分组,轻量级选手无论多努力,永远赢不了重量级选手,这不是能力问题,是比较方式的问题。ARC做的事情本质上就是给AI的各种应对策略"分组",让直接回答的和直接回答的比,先确认的和先确认的比,谁也不会因为"选错了赛道"而吃亏。

论文里还给出了一套理论分析,用方差分解的方式证明了这件事。

**核心结论**:标准分组强化学习的优势估计方差里,包含一个"策略间方差"项(不同策略之间的系统性差异)和一个"策略内方差"项(同策略内部的正常波动)。策略间方差这一项无论怎么增加采样数量都消不掉,它是结构性的偏差,不是随机噪声。而理想情况下,如果按策略分组采样,这一项会直接从公式里消失,只剩下策略内方差。

作者进一步给出了一个采样效率的推论:分组条件化之后,达到同样估计精度所需要的样本量,理论上可以减少到原来的 $\sigma_{intra}^2 / (\sigma_{intra}^2 + \sigma_{inter}^2)$ 倍。策略间方差越大,这个节省就越明显。

需要说明的是,这些是理想化的估计器层面分析,论文自己也强调这不是完整的收敛性证明,更像是一种"为什么这样做有道理"的解释框架,而不是一个可以拿来精确预测训练加速倍数的公式。这种诚实挺难得的,很多论文喜欢把理论分析包装得比实际支撑的结论更强。

光有分组思路还不够,得先有能观察到这些行为的舞台

这里有个挺现实的问题:ARC这套分组比较的方法,得先有丰富多样、能被清楚区分策略类型的对话数据才能训练。但现有的对话AI框架,恰恰很难产出这种数据。

**思考模式(Think-then-act)**:AI先在后台把所有推理和工具调用都做完,再把最终结果一次性展示给用户。

**ReAct模式**:AI把思考过程、工具调用、和用户沟通全部混在一条输出流里,交替进行。

这两种主流范式都有一个共同的毛病:要么用户要等到内部流程全部走完才能看到任何反馈,要么反馈和思考、执行搅和在一起,没法清楚地把"这次用了什么沟通策略"单独拎出来标注。这就相当于想研究一个人在不同场合下说话方式的变化,结果拿到的录音里,私下嘀咕和当众发言全混在一起,根本分不清哪句是说给别人听的。

为了解决这个问题,研究团队搭建了一套叫**INTER?**(Interplay of Internal Reasoning, Tool Usage, and Interaction,内部推理、工具使用与交互的交织)的框架。

它的核心设计是把"用户能看到的沟通内容"和"AI内部的推理与工具调用"彻底分开成两条独立通道。具体实现上很简单,只用了两个改动:在分词器里加入一对``标签,以及在生成文本后做个后处理,把这对标签里的内容抽取出来展示给用户,标签外的所有文字都当作AI的内部思考,不展示。

这个改动看似简单,但效果立竿见影。因为``标签可以在AI后台推理和工具调用还没结束的时候就先冒出来,用户不需要死等整个流程跑完才收到第一条反馈。论文里给出的对比数据很直观:传统思考模式下,首字反馈时间(TTFT,Time-to-first-token)平均是4.91秒,而用了INTER?架构后,降到了1.27秒,足足快了将近4倍。

这就像点外卖,如果App一直转圈圈直到骑手把东西送到你手上才弹出"已送达"四个字,你会觉得这App很不靠谱,焦虑得想反复刷新;但如果App能实时告诉你"商家已接单""骑手已取餐""骑手距您500米",哪怕总耗时是一样的,你的体验会完全不同。如果不做这种通道分离,用户永远只能等一个"黑箱"跑完,不管AI后台效率多高,用户端的体感永远是"卡顿"的。

论文里把可能出现的沟通行为归纳成了四大策略家族,分别是"进度更新"(一边执行工具一边汇报进展)、"先澄清"(信息不足时先问清楚再动手)、"确认对齐"(执行不可逆操作前复述一遍用户意图求确认)、"直接回答"(靠已有知识直接给答案,不调用任何工具)。这四类正好对应ARC训练时用来分组的策略条件。

数据从哪来:INTER?-86K的构建过程

有了框架,还得有数据喂给它。团队构建了一个叫**INTER?-86K**的策略标注训练语料库,总共86,796条样本。

这份数据有两个来源。第一个来源比较特别,是从蚂蚁国际旗下一个大规模全球支付平台的真实客服场景里,采集了大量线上交互记录,里面天然包含了用户打断、话题转向、澄清追问、进度更新、多轮工具调用等各种真实行为。经过脱敏和格式规整,这些数据变成了INTER?格式下的训练素材。

第二个来源是把公开的工具调用基准数据集重新改写成INTER?格式,再用一个强力教师模型(Qwen3.5-397B-A17B)辅助生成更多样化的合成对话。最终监督微调(SFT)部分有57.9K条,里面工具使用类占了59.1%(约34.2K条),来自ToolMind数据集合;多跳问答占29.7%(约17.2K条),来自Musique Long Content;逻辑推理和高质量交织对话占11.1%,来自KnightsAndKnaves和Opus Distilled这两个数据源。强化学习(RL)训练部分有28.9K条,全部来自工具使用类数据,并额外加上了策略指令用于ARC训练。

策略标注这一步做得挺讲究,团队用了两个大模型(Qwen3-235B-Instruct和Qwen3.5-27B)分别独立判断每条样本该归为哪种策略,如果两个模型判断一致且置信度都超过0.85,就直接采纳;如果不一致但其中一个置信度明显更高(高出0.15以上),采纳高置信度那个;如果两个模型都很纠结,就交给三位人工标注员投票裁决。

这套流程有点像医院里的会诊制度。普通病例一个医生就能拍板,但遇到疑难杂症,需要多个专科医生会诊意见一致才能下结论,再不行就得走多学科联合会诊流程。这么设计的道理很直接,如果全靠单一模型自动标注,遇到模糊案例很容易出现系统性偏差(比如某个模型天生倾向于把模棱两可的情况都判成"直接回答"),而人工兜底虽然慢,但能兜住这些边界情况,保证整个数据集的标注质量不会被某一个环节的系统性偏差拖垮。

实验结果:ARC到底管不管用

说了这么多设计思路,数据说话最实在。

团队用Qwen3-8B作为基础模型,在三种主流强化学习框架(PPO、DAPO、GRPO)上分别测试了加装ARC前后的效果对比,评测覆盖了τ-bench和τ?-bench这两个专门测试多轮工具调用能力的基准(涵盖航空、零售、电信三个场景),以及AIME数学竞赛、GPQA-Diamond科学问答、HMMT数学竞赛、IFBench指令遵循、Arena-Hard等域外推理测试。

**τ-bench**:一个测试AI在真实业务场景下多轮工具调用能力的基准,涵盖航空订票、零售购物等场景。

**τ?-bench**:τ-bench的升级版,增加了电信场景,并支持用户和AI双向控制的对话环境。

核心结果非常清楚:

| 方法 | 平均分 | 首字反馈时间 | τ-airline | τ-retail | τ?-airline |

| GRPO(基线) | 28.09 | 0.61秒 | 31.33 | 40.29 | 36.67 |

| GRPO + ARC | **33.46** | 1.27秒 | **44.00** | **50.00** | **48.00** |

| PPO(基线) | 27.49 | 0.45秒 | 35.33 | 41.45 | 33.33 |

| PPO + ARC | **28.57** | 0.78秒 | **39.33** | **46.09** | **41.61** |

GRPO加上ARC之后,平均分从28.09提升到33.46,涨了5.37分,是所有backbone里提升最大的。具体到τ-airline这个子项,分数从31.33一路涨到44.00,涨幅超过40%;τ-retail从40.29涨到50.00;τ?-airline从36.67涨到48.00。

这个提升幅度是什么概念?意味着原本每10次订票任务AI能顺利完成大约3到4次,加了ARC之后能顺利完成4到5次,多出来的这一次成功,很可能就是那种"该问清楚却没问,该确认却直接执行"导致翻车的场景被纠正过来了。

在域外推理任务上,ARC的表现就没这么一边倒了。GRPO加ARC之后AIME 2026从31.67提升到40.83,但PPO和DAPO的域外表现有涨有跌,说明ARC对不同优化框架的适配程度不完全一样。研究团队对此也很坦诚,没有夸大其词,直接承认"ARC的收益取决于底层优化动态"。

团队还做了个小模型验证,把基础模型换成Qwen3-4B之后,ARC依然有效,五项工具使用任务的平均分比不加任何强化学习的基线提升了大约53%。这说明ARC带来的提升不是靠模型规模堆出来的,而是真的改善了训练过程中的比较信号质量。

有一张训练奖励曲线图挺能说明问题:普通GRPO训练到中期奖励会到达峰值,然后开始下滑,尤其是工具调用奖励和回答质量奖励;而加了ARC之后,奖励能维持住甚至持续上升。这个现象背后的解释是,普通分组强化学习一开始学到了有用的行为,但训练久了之后开始钻评分模型的偏见空子,而ARC因为把比较范围限制在同策略内部,从头到尾保持了信号的公正性,不给"钻空子"留出可乘之机。

一个反直觉的发现:提示词该不该慢慢撤掉

这里有个挺有意思的细节。

ARC训练的时候会给AI一个明确的策略提示,但实际部署时这个提示是拿掉的。这就带来一个训练和推理之间的"不一致"问题。团队想到一个很自然的解法:能不能像课程学习那样,训练过程中逐渐减少提示的出现频率,让模型慢慢习惯没有提示也能自己判断?

他们试了三种方案:一直保留提示、随训练进度线性降低出现概率、以及固定20%概率随机去掉提示。

结果出乎意料,一直保留提示的默认方案效果最好,线性降低是中间水平,固定概率去掉的方案效果最差。

这个结果乍一听有点反直觉,你可能会想,既然最终要在没有提示的情况下工作,那训练时不就应该多练练"没有提示怎么办"吗?但数据摆在这里:默认方案(全程保留提示)不仅工具使用任务表现最好,而且组内"跑偏"(实际生成的策略和指定策略不一致)的比例和波动都最小。

团队给出的解释是,策略提示的作用从头到尾都是"帮训练过程搭建一个干净的比较框架",而不是"教会模型一种应该被逐渐戒掉的拐杖"。太早撤掉提示,反而会让组内比较又开始混入不同策略的样本,破坏了ARC本来想解决的那个问题。

这就像学游泳时用的浮板。有人可能觉得应该尽早撤掉浮板,让学员早点适应没有支撑的状态,但如果浮板本身的作用不是"支撑身体",而是"让教练能准确观察你的划水动作而不受下沉干扰",那么过早撤掉浮板反而会让教学信号变得混乱,教练根本分不清你划水姿势对不对,还是在挣扎着不被淹没。如果不理解浮板真正的作用是什么,盲目"渐进式撤除"反而会毁掉整个训练效果。

团队又进一步做了个诊断实验,直接对比同一个训练好的ARC模型在推理时给"匹配的策略提示""随机打乱的策略提示""完全不给提示"三种条件下的表现,结果显示完全不给提示反而拿到了最高综合分(41.73),超过了给随机提示的39.58和给匹配提示的39.85。这进一步证实了策略提示的价值主要体现在训练阶段构建比较框架上,而不是一个部署时应该保留的持久线索。

策略越多越好吗:规模化分析

还有一个挺实用的发现,团队做了个策略数量的消融实验,从只用一种策略("进度更新")开始,逐步叠加"直接回答""先澄清",最后加上"确认对齐",凑齐全部四种策略。

结果显示,平均分随着策略数量增加持续上升,总提升幅度达到36.1%。最明显的收益出现在τ-bench和τ?-bench这两个工具使用相关的基准上,分别提升了99%和71%。

值得一提的是,"确认对齐"这个策略在训练数据里只占2.5%,是个不折不扣的小众策略,但把它加进来之后依然带来了明显的整体提升。这说明即使是占比很小的策略类型,只要能被清楚区分并单独分组比较,依然能为模型贡献有效的学习信号,不会因为样本量少就被淹没或忽略。

奖励怎么设计:细节里的魔鬼

论文附录里对奖励函数的设计做了细致的消融实验,这块内容虽然技术性强,但揭示的道理很朴素:奖励信号越贴近"真实执行是否正确",训练效果越稳。

团队测试了三种奖励构造方式,从"宽松的工具匹配加回答评分"逐步收紧到"精确工具匹配加门控式回答评分"。最严格的版本要求工具调用的名称、参数、参数值全部精确匹配才给分,而且只有工具调用正确的前提下,回答内容的语义评分才会生效,如果工具调用错了,哪怕回答说得再漂亮也不给语义分。

这个"门控"设计的道理在于,防止AI学会一种取巧行为:工具调用瞎编乱造,但靠语言模型评委喜欢的措辞把回答包装得像模像样,骗到语义评分。这就像考试改卷,如果只看论述题写得漂不漂亮,却不管选择题填得对不对,学生完全可以在选择题上随便蒙,把精力全放在堆砌论述题的辞藻上。门控设计相当于"选择题不及格,论述题分数直接清零",逼着学生老老实实把每一步都做对。

实验数据显示,从最宽松版本到最严格的门控版本,τ-bench平均分提升了大约42%。

熵正则化:防止AI偷懒说套话

论文里还提到了一个容易被忽略但很关键的技术细节,叫**熵正则化**。

**熵正则化**:在训练目标里加一项鼓励"多样性"的惩罚项,防止模型输出坍缩成单一、重复的模式。

INTER?这套交织式输出格式,要求AI同时协调内部推理、面向用户的回答、工具调用这三条通道。团队发现如果不加熵正则化,模型会出现**熵坍缩**(entropy collapse)现象:模型学会了不断输出一些空洞的``片段,这些片段能拿到基本的格式分,但实际上没有任何实质内容,类似于客服话术里那种"正在为您处理,请稍候"反复循环却什么都没说清楚。

加上熵正则化之后,这种偷懒行为被抑制住了,模型被迫维持一定的探索性,尝试更多样的交织表达方式。不过团队也做了敏感性测试,发现这个正则化的强度得拿捏得当,系数设得太高(0.01)会导致奖励直接崩掉,设得太低(0.0001)效果又不够,最合适的取值是0.001。

而且团队特意做了个对照实验证明:单独加熵正则化,不配合策略分组,反而会让效果略微下降;只有先做了策略分组,熵正则化才能发挥稳定器的作用。这说明ARC真正起作用的核心机制是分组比较这件事本身,熵正则化只是配套的辅助手段,不是主角。

写在后面

读完这篇论文,我印象最深的其实不是那套变量方差的理论证明,而是那个关于"策略提示要不要逐渐撤掉"的实验结果。

研究团队原本很可能是带着"课程学习一定有用"的预设去做这个实验的,毕竟渐进式训练在很多领域都被证明有效。但数据啪地打了个反例,一直保留提示反而效果最好。这提醒我一件事:很多我们觉得"理所当然应该这样设计"的训练技巧,其实背后有没有道理,得看它解决的到底是什么问题。如果撤掉浮板解决的是"教练观察不到划水动作"这个问题的反面,那撤浮板这个动作本身就是错的,不管这个技巧在别的场景里多么常见。

另一个值得琢磨的地方是,论文里那个"确认对齐"策略只占2.5%的数据量,却依然带来了实打实的提升。这跟很多人对训练数据的直觉是相反的,通常大家会觉得少数类别的数据容易被主流数据"稀释"掉,学不出什么名堂。但如果分组机制设计得当,让每种策略在自己的赛道里被公平比较,哪怕数据量小,信号照样能被完整保留下来,不会被淹没。这对做数据配比的人来说,是个值得重新想一想的角度。

如果你的AI客服每次都要等好几秒才蹦出第一个字,这背后大概率不是模型不够聪明,而是它压根没有一个"边想边说"的通道设计。这事儿多少有点讽刺。

Q&A

Q1:ARC是什么,它解决了什么问题?

A:ARC(Advantage Regularization via Conditioning)是蚂蚁国际提出的一种强化学习训练方法,核心是给每条训练数据分配一个策略标签(比如"先澄清"或"直接回答"),让AI生成的回答只在同策略组内部比较打分,避免不同沟通风格之间的不公平比较污染训练信号。

Q2:INTER?和普通的AI对话框架有什么不一样?

A:INTER?把AI"内部思考"和"用户可见的回答"用``标签彻底分开成两条通道,AI可以一边在后台推理调用工具,一边把进度实时告诉用户,不用等整个流程跑完才回应,首字反馈时间从4.91秒降到了1.27秒。

Q3:ARC对小模型也有效吗?

A:有效。团队在参数量更小的Qwen3-4B上做了验证,加了ARC之后五项工具使用任务的平均分比基线提升了约53%,说明这套方法带来的提升是训练机制本身的改善,不是靠堆模型规模换来的。

未经允许不得转载: 街坊秀 » 当AI客服学会"看情况说话":一个关于公平比较的故事