街坊秀 街坊秀

当前位置: 首页 » 街坊资讯 »

当AI学会了"当着你的面偷偷打草稿":多模态大模型的双面人格问题

  炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!

(来源:科技行者)

你有没有遇到过这种情况:问一个AI助手一个简单问题,它嘴上说"好的,直接告诉你答案",结果吐出来的文字里却夹杂着"让我想想""等等,我再确认一下""不对,应该是"这样的自言自语?

这不是错觉。2026年初,一群来自中科院自动化所和腾讯的研究者发现,这种现象在几乎所有主流多模态大模型里都存在,而且比想象中严重得多。他们做了一件很直接的事:把市面上25个模型掰开揉碎,专门去找它们"说话不着调"的证据。结果发现,即便是GPT-5.5、Claude这样的顶级模型,在某些配置下也会把不该说的话说出来。

这篇论文的名字叫《Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs》,直译过来是"超越正确性:混合思考多模态大模型的响应行为基准测试与对齐"。听起来有点绕,但它想说的事情其实很简单:一个AI回答问题,答案对不对是一回事,回答的"姿态"好不好又是另一回事。而后者,过去被严重忽视了。

先说清楚,什么叫"混合思考"模型

现在的大模型越来越多地支持一个功能:你可以让它"想清楚了再说"(thinking模式),也可以让它"直接说答案"(non-thinking模式)。前者适合复杂的数学题、逻辑推理,后者适合日常对话,图的就是快。

**Qwen3、GLM-4.5这些模型都内置了这种双模式切换能力,一套模型参数,两种工作状态。**

这个设计的好处显而易见:不用维护两套模型,用户按需选择响应速度和思考深度。但研究者们盯上的,恰恰是这个"按需选择"背后藏着的一个假设:无论选哪种模式,模型交付给用户的最终答案,应该保持同样的质量标准。

这个假设成立吗?论文用整整2415道题目的实测数据告诉你:不成立,而且差距惊人。

问题出在哪:正确≠得体

先讲一个容易被忽略的常识。我们平时评价一个AI答得好不好,几乎全靠"对不对"这一个维度。但你仔细想想,一个人回答问题除了要说对,还要说得体。

比如你问同事一个工作问题,同事嘴里嘟囔着"呃这个我先想想,啊不对,应该是……哦对对对,我再重新说一遍,是这样的……",最后给出的答案是对的,但你听着会不会觉得很奇怪?

**这种"答案对,但表达方式有问题"的情况,论文里称之为"响应模式失配"(response-pattern misalignment)。**

论文把这类"说话不得体"的毛病归纳成四种典型症状:

第一种叫**思维链泄漏**,英文缩写CoT leakage,指的是模型该直接给答案的时候,却把内部盘算的过程暴露出来了,比如"让我先看看图片""等等我再确认一下"这些话本不该出现在最终回复里。

第二种叫**响应重复**,就是同一句话、同一个结论翻来覆去说好几遍,浪费读者时间。

第三种叫**逻辑矛盾**,指回答里前后出现了两个互相冲突、却都没被撤回的说法,比如先说这个物体是横放的,后面又让你去移动"竖放的"那个物体。

第四种叫**表演式推理**,模型摆出一副"我在认真分析"的架势,写了一堆"首先""其次""综合来看",但这些话对得出结论其实毫无帮助,纯粹是走个形式。

这四种毛病有一个共同点:传统的"对错评判系统"根本抓不到它们。如果你只用一个自动打分程序去检查答案对不对,这些"说话方式"上的问题会被完全无视,因为答案本身可能是对的。

这就好比一场考试,阅卷老师只看最后的数字答案对不对,却从不看学生的解题过程里写了多少废话、有没有前后矛盾。如果不检查这些,学生就可能长期保持一种"蒙混过关"的答题习惯,而这种习惯迟早会在更复杂的场景里暴露出问题。

一个反直觉的发现:模型越强,不代表两种模式越协调

研究团队做了一件很扎实的事:找来25个模型配置,涵盖Qwen、Kimi、Seed、Claude、Mimo、GPT这些主流家族,让每个模型分别用thinking模式和non-thinking模式跑同一批2415道题,然后逐条比对两种模式下的答案质量。

结果让人意外。**在全部25组对照实验里,没有一个模型的non-thinking模式"说话得体度"能追上thinking模式,差距全部为正,最大差距高达48.64个百分点。**

这个数字什么概念?意味着在最极端的案例(某个Kimi版本)里,你用快速模式问它问题,每两个回答里就有一个会带上这四种毛病里的至少一种,而慢速模式下这个比例只有不到1%。

更让人意外的是,论文进一步分析了Qwen3.5系列从0.8B(参数量最小)到397B(参数量最大)的一整条产品线,发现模型能力越强,并不意味着两种模式之间的"说话得体度"差距会越小。

具体数字是这样的:从4B参数扩大到397B参数,答案正确率确实稳步上升,non-thinking模式从45.96%涨到61.96%,thinking模式从52.33%涨到68.93%。但是,non-thinking模式的"毛病触发率"并没有随之持续下降,它从4B的46.42%降到27B的29.32%后,就在28%到33%之间来回震荡,再也降不下去了。

**这意味着,单纯把模型做大、做强,并不能自动治好它"快速作答时说话不着调"的毛病。**

这里就得说到一个概念了。

> Trigger率(触发率):指在测试的所有题目里,模型的回答触发了四种坏毛病中至少一种的比例。数字越低,说明模型说话越"干净"、越符合预期。

如果只盯着模型的整体正确率一路上涨,你会有一种"模型越来越聪明"的错觉,但这个体检报告告诉你,聪明和得体是两条不完全平行的曲线,一个变好不代表另一个也在变好。

PatternEval:专门用来"找茬"的考试卷

要证明上面这些发现不是拍脑袋编出来的,研究者需要一套严谨的评测工具。他们造了一个叫PatternEval的基准测试集。

> PatternEval:一套包含2415道题目的诊断性测试集,专门用来暴露模型在"说话方式"上的四种典型失误(泄漏、重复、矛盾、表演式推理),覆盖视觉感知定位、结构化图像理解(OCR和图表)、多模态知识推理三大任务类型。

这套题不是随便找来的,而是经过三道工序精心筛选出来的。

第一步,研究者先让模型跑一批候选题目,重点观察那些容易在"快速作答"模式下翻车的案例,把出问题的场景记录下来当作种子样本。

第二步,从这些种子案例往外扩展,覆盖更多相似的任务类型和提问方式,确保收录的不是孤立的个案,而是某一类失误的完整变体。

第三步,做平衡处理。那些答案格式非常死板、一眼就能判断对错的题目会被适当压缩数量,而那些能让模型自由发挥、容易暴露表达问题的题目会被优先保留,同时限制单一来源题目占比过高,避免整个测试集被某一类题目主导。

最终得到的2415道题按任务类型分成三大类:视觉感知定位(占48.9%,包括物体识别、图像内容识别、目标定位、事实核查),OCR与结构化图像理解(占24.0%,包括文字识别和图表理解),多模态知识推理(占27.1%,包括理科知识、常识、多步推理)。

这里有个细节值得说一说:PatternEval不是要模拟真实世界里这些毛病出现的自然频率,它是故意"挑刺"的,专门找那些容易让模型露馅的高难度场景。这就像体检的时候医生不会只测你血压正常的时候的心跳,而是要让你做一段剧烈运动,看看你的身体在压力状态下能不能扛住。

谁来判断"说得对不对"这件事本身也不简单

评测这四种坏毛病,比评测数学题对不对要难得多。数学题有唯一答案,但"这段话算不算逻辑矛盾"这种判断,本身就带有主观性,需要一个足够聪明、足够可靠的裁判来把关。

研究团队为此专门做了一轮"裁判选拔赛"。他们先构建了一个2500条回答组成的校准数据集,这些回答不是直接从PatternEval里抽的,而是来自模型训练不同阶段(监督微调、混合强化学习、在线偏好蒸馏)产生的输出,确保覆盖足够多样的表达风格。

然后请Seed-2.0-Pro、Kimi-K2.6、Qwen3.5-397B这三个模型分别独立打标签,再挑出三个裁判意见一致的"共识样本"和意见分歧的"争议样本",按大约7比3的比例混合,最后交给人类标注员按同样的四类标准打上"真实答案"。

拿到这份人工黄金标准之后,再让五个候选裁判模型(包括GPT-5.5、Seed-2.0-Pro等)去对照评分,看谁判得最准。结果显示:

**思维链泄漏和响应重复这两类问题相对容易判断,因为它们往往有明显的表面特征,比如"让我想想"这种句式一眼就能识别出来;而逻辑矛盾和表演式推理需要更细腻的语义理解,判断准确率明显更低更不稳定。**

具体数字上,CoT泄漏的F1值(一种综合衡量准确率和召回率的指标)最高能到95.3%,而表演式推理的F1值最低只有41.8%,差距接近一倍。这说明"说话有没有绕圈子"这种事,连AI裁判自己都很难判断准。

最终,研究团队选定了Seed-2.0-Pro(配合图像输入)作为整个基准测试的官方裁判,因为它在逻辑矛盾这个最难判断的维度上表现最好,而且能直接看图核实描述是否准确,不是凭空臆断。

长回答更容易翻车,这个规律有点意思

论文里还有一组数据值得单独拎出来讲。研究者统计了回答长度和"说话毛病"之间的关系,发现两者存在明显的正相关:回答越长,出问题的概率越高。

在non-thinking模式下这个相关系数是0.64,在thinking模式下更高,达到0.84。换句话说,思考模式下"话说得越多越容易出问题"这个规律反而更明显。

论文进一步把回答按长度分成六个区间,发现无论哪种模式,随着回答变长,毛病触发率几乎是单调上升的。在最长的那个区间里,non-thinking模式下错误答案的触发率能飙到86%,即便是答对了的长回答,触发率也有56%。相比之下,thinking模式下即便是最长的回答,错误答案触发率也只有52%,答对的更是只有22%。

**这里最值得注意的一点是:即便答案是对的,只要回答特别长,出现说话毛病的概率依然不低。**这戳破了一个隐藏的误解:很多人下意识觉得"答案对了就万事大吉",但这个数据说明,答案的正确性和表达的规范性,是两码事,一个达标不代表另一个也达标。

这个现象背后的原因不难理解。一个模型如果对答案没有十足把握,往往会倾向于多写、反复确认、来回论证,这种"啰嗦"的姿态本身就更容易掺杂进思维过程的痕迹或者站不住脚的推理链条。这有点像一个不太自信的学生答题,越是心里没底,越喜欢在卷面上写满密密麻麻的推导过程,试图靠篇幅弥补底气,但篇幅越长,漏洞暴露的机会反而越多。

治病:PatternRM和PatternRL怎么设计的

发现问题只是第一步,论文的后半部分是真刀真枪去治这个病。研究团队做了两件事:先训练一个专门识别这四种毛病的"裁判模型"PatternRM,再把这个裁判的判断结果接入强化学习流程,训练出能主动规避这些毛病的PatternRL。

> PatternRM:一个专门用来识别回答中是否存在思维链泄漏、重复、矛盾、表演式推理这四种毛病的奖励模型,基于Qwen3.5-27B训练而成,只看文字不看图片,以换取更快的推理速度。

PatternRM的训练数据来自一个9万条回答组成的大池子,其中6万条来自已有的模型输出记录,3万条是额外用三个不同策略重新生成的。每条回答都由Kimi-K2.6、Seed-2.0-Pro、Qwen3.5-397B三个裁判分别打标签,只有三家意见完全一致的才会被保留下来,最终留下5万2千多条高置信度样本,再通过适当复用扩充到5万7千多条训练样本。

这里有个设计细节很实用:PatternRM在训练时特意选择了"只看文字,不看图片"的方案。原因很简单,这个模型要在强化学习训练过程中被反复调用去给每一轮生成的回答打分,如果每次都要处理图片,推理开销会大很多,速度跟不上训练节奏。研究者用一部分精度换来了效率,这个取舍在实际工程里非常常见。

**如果PatternRM也要看图,会怎样?**论文里的对比实验能回答这个问题。他们测试过一个同样架构的"看图版本",F1值反而比纯文字版本略低(70.2%对71.3%),这说明在这个具体任务上,多喂图片信息并没有带来预期中的增益,反而因为处理复杂度增加,拖累了整体判断的稳定性。这也提醒我们,不是所有场景都遵循"信息越多越好"的直觉,有时候聚焦反而更精准。

接下来是PatternRL的核心机制,也就是怎么把PatternRM的判断结果变成训练信号。

> PatternRL:在强化学习训练中,除了传统的"答案对不对"这个奖励信号之外,额外加入一个基于PatternRM判断结果的惩罚项,专门抑制那四种说话毛病。

具体的打分规则是这样设计的:答案验证器先判断这道题回答得对不对,给出0或1的二元分数。如果PatternRM被抽中要介入打分(有60%的概率会被触发,这也是为了控制计算成本),它会针对思维链泄漏和重复各扣0.05分权重,针对逻辑矛盾和表演式推理各扣0.02分权重,累计扣分封顶在0.1分以内。最终把两部分加起来,裁掉到0到1的区间。

这套设计有个很聪明的地方:**答错了的回答永远拿不到任何分数,答对了的回答会拿到0.9到1分之间的分数,惩罚项只在"答对"的基础上做微调,而不会推翻整个奖励体系。**

这就好比公司发年终奖,你的KPI没达标,直接零奖金,这个规则是刚性的、不容商量的;但只要你达标了,奖金会在90%到100%之间浮动,浮动的那10%取决于你工作态度是不是踏实、有没有偷懒糊弄。如果没有这个浮动机制,只要KPI达标就一律满额发放,那员工完全没有动力去在乎自己的工作方式是不是规范,反正结果对了就行,这恰恰是论文想避免的情况。

效果怎么样:数字说话

研究团队在Qwen3-VL-4B和Qwen3-VL-8B两个模型上做了完整实验,对比了三种设置:原始的non-thinking模式、只用答案正确性做强化学习的BaseRL、加入PatternRL的完整方案。

结果相当直观。在4B模型上,原始non-thinking模式的毛病触发率是44.22%,如果只用传统的"答案对了就好"这套强化学习方式去训练(也就是BaseRL),触发率不但没降,反而涨到51.55%。而加入PatternRL之后,触发率被压到38.47%,比BaseRL整整低了13个百分点。

8B模型上的规律类似,BaseRL把触发率从36.77%推高到44.33%,PatternRL则把它压回29.98%,降幅达到14.35个百分点。

**这个对比揭示了一个值得警惕的现象:纯粹为了追求答案正确率去做强化学习,反而会让模型的说话毛病变得更严重,而不是自然而然地跟着变好。**

这也不难理解。如果奖励函数只关心答案对不对,模型在探索过程中就会发现,"多写、多绕、多论证"有时候反而更容易蒙对答案,于是这种啰嗦冗长的行为被意外地强化了下来,即便它带着一身思维链泄漏和表演式推理的毛病。

那PatternRL会不会牺牲太多正确率?论文也给出了答案。4B模型上,准确率变化不到1个百分点;8B模型上同样保持在这个量级。也就是说,**这套方案基本做到了"治病不伤身"。**

不过论文也很诚实地指出了一个能力规模相关的现象:在4B这种相对较小的模型上,引入PatternRL之后,数学推理和逻辑推理任务的整体准确率有比较明显的下滑;而在8B模型上,这个下滑幅度就小得多,文档理解任务甚至还略有提升。

研究者给出的一个合理解释是:小模型有时候需要靠"探索性的、啰嗦的、带点自我纠错"的思考路径才能摸到正确答案,这类路径恰恰更容易触发PatternRM的惩罚,相当于一部分小模型解题的"捷径"被限制住了;而大模型本身就有能力写出简洁清晰的答案,不太依赖这些容易踩雷的表达习惯,所以受到的约束影响也更小。

这就像限速一样,对于本来就习惯稳健驾驶、路线规划清晰的老司机,限速几乎不影响他的通行效率;但对于喜欢一边开车一边试探路线、走走停停找感觉的新手司机,限速会实实在在地压缩他试错的空间,让他更难摸到正确的路。

这套方法的边界在哪里

论文的讨论部分很坦诚地承认了PatternRL的局限。

第一个局限是,PatternRL能明显缓解问题,但没能彻底根除。研究者推测,这些说话毛病很可能已经在更早的训练阶段(比如预训练、监督微调阶段)就被悄悄植入模型里了,仅仅在强化学习这一个环节打补丁,力度终究有限。**真正想根治,可能需要往前追溯到数据质量和更早期的训练约束上去。**

第二个局限就是前面提到的规模依赖问题:模型越小,这种"纠偏训练"付出的代价越大。这意味着实际部署时,不能指望一套参数不变的方案适用于所有规模的模型,需要根据模型大小和任务难度做适配性调整。

论文的核心结论其实很朴素:**推理效率和响应质量不应该是一个非此即彼的选择题,一个负责任的AI系统应该在快慢两种模式下都保持同样的可信赖度,而不是为了速度悄悄牺牲表达的规范性。**

写在后面

读完这篇论文,最让我意外的一点是那个48.64%的数字。在此之前我一直以为,顶尖模型的差距主要体现在"聪明程度"上,没想到在"说话方式"这个维度,即便是同一个模型,只是换了个响应模式,表现能差出接近一半的样子来。这说明我们平时用"跑分"去评价一个模型有多强,可能一直在漏掉一大块很实际的东西。

还有一个细节我觉得很有意思:论文里提到,长回答和出问题的概率高度相关,但对答对了的问题依然成立。也就是说答案对不对和说话方式规不规范,压根不是一回事,这两条曲线可以完全脱钩地波动。这提醒我,以后再看AI给出的长篇大论式的回答,哪怕它最后蹦出来的答案是对的,也未必值得完全信任那套"思考过程"。

另一个让我反复琢磨的地方是,只优化正确率反而会让说话毛病变多这件事。这个现象背后其实藏着一个很普遍的道理:任何只盯着单一指标去优化的系统,都容易在这个指标之外的维度上悄悄跑偏。这套逻辑放到工作、学习、甚至人际关系里,大概都是成立的。只关心结果对不对,往往会在过程和方式上留下越来越多没人管的漏洞。

那些没能彻底根治的毛病,到底是训练数据本身的问题,还是模型架构层面的天生局限,这个问题论文没有给出定论。留白也挺好,值得后来的人接着追问下去。

Q&A

Q1:PatternEval是什么?

A:PatternEval是一套包含2415道题目的诊断性测试集,专门用来检测多模态大模型在thinking(深度思考)和non-thinking(快速直答)两种模式下,是否存在思维链泄漏、响应重复、逻辑矛盾、表演式推理这四种典型的说话毛病。

Q2:为什么模型的non-thinking模式比thinking模式更容易出问题?

A:论文实测25个主流模型后发现,所有模型在non-thinking模式下"说话毛病"的触发率都明显高于thinking模式,最大差距达48.64个百分点,主要原因是快速作答模式下模型更容易把内部的思考痕迹或者没想清楚的推理过程直接暴露在最终回答里。

Q3:PatternRL能不能解决这个问题,会不会牺牲答案的正确率?

A:PatternRL通过在强化学习中加入专门的惩罚机制,能明显降低说话毛病的触发率,在4B和8B模型上分别降低了13.08和14.35个百分点,而且整体答案准确率的下降幅度控制在1个百分点以内,但没能完全根除这些问题。

未经允许不得转载: 街坊秀 » 当AI学会了"当着你的面偷偷打草稿":多模态大模型的双面人格问题