让置信度改变,别让预测结果改变:一篇关于AI"改口"的论文
先说一件挺反常的事。
你训练好一个图像分类模型,让它去认一张猫的照片。模型说:这是猫,我有98%的把握。听起来挺靠谱。但后来你发现,这个模型平时说话"太自信"了,它说98%把握的时候,实际对的概率可能只有70%多。于是研究者们发明了一套"校准"技术,专门用来修正这种过度自信。
(资料图片仅供参考)
问题是,这套修正技术在悄悄干一件谁都没太在意的事:它有时候会把模型原本的答案给改了。
模型原来说这是猫,经过校准之后,它说这是狗。听起来很荒谬对吧,校准本来只是想调整"说话的语气",怎么把"说的内容"也换了?但这是真实发生的事情,而且发生得比你想象的更频繁。
**校准,本来只想改自信程度,没想到连答案也改了**
这篇论文的作者们做了一个实验。他们拿一个在ImageNet-1K上训练好的ResNet-50模型(一个很经典的图像分类网络),用一种叫做Vector Scaling的校准方法去修正它的置信度。
Vector Scaling*:一种后处理校准技术,通过给模型输出的每个类别分别乘上一个缩放系数,来调整模型输出的置信度分布,让报告的置信度更贴近真实的准确率。
结果这套校准让整体准确率只掉了0.24个百分点,看起来几乎没什么损失。但如果你去看每一张图片的具体预测结果,会发现校准前后,模型对5.74%的图片给出了不同的答案。
这两个数字放在一起看才让人吃惊:准确率几乎没变,但接近6%的预测被悄悄换掉了。
这是怎么回事?原来这些改动里有一部分是把错的改对了(1.78%),有一部分是把对的改错了(2.02%),还有一部分是把一个错误答案换成了另一个错误答案(1.94%)。前两类互相抵消,第三类根本不影响准确率的计算。三种效应加在一起,最后表现在准确率上,就只剩0.24这么一点点。
**这就是这篇论文的第一个核心发现:准确率这个指标,只能告诉你"净效果",掩盖了背后真实发生了多少次改动。**
论文作者给这个被忽视的现象起了个名字,叫做Top-1预测变化率(Top-1 Prediction Change Rate,简称TPCR)。
TPCR*:衡量校准前后模型给出的最终判断(也就是概率最高的那个类别)发生变化的比例,不管这个变化让结果变好还是变差。
打个比方,这就像你去查一个班级期中考试和期末考试的平均分变化,发现只涨了0.5分,你可能会觉得这个班整体没什么波动。但如果你去看每个学生的具体分数,会发现有一半学生成绩涨了,另一半跌了,只是涨跌幅度刚好互相抵消,平均分才显得"风平浪静"。如果不去看个体数据,你永远不知道这个班级内部发生了多大的动荡。准确率就是那个"平均分",它把真实的混乱藏起来了。
论文因此提出一个问题:能不能有一种办法,让模型改变的只是"自信程度",而不改变"最终判断"?
**修复而不重建:CORD的设计思路**
作者提出的方法叫CORD,全称是Calibrator-Output Repair for Top-1 Decision Preservation(校准器输出修复,用于保留Top-1决策)。
这里有个关键的设计选择:CORD不是去改进校准器本身,而是在校准器已经训练好、已经给出输出之后,再做一次"修补"。
为什么要这样做?因为如果试图在训练校准器的时候就加入"不能改变原始预测"这个约束,会让校准器的表达能力变差。之前有一篇叫做Mix-n-Match的论文就明确指出过这个矛盾:你想让校准更准,同时又想让预测结果保持不变,这两个目标是会打架的,鱼和熊掌不能同时占。
CORD的思路是把这两个目标彻底分开处理。先让校准器自由地去追求最准确的置信度校准,不用管会不会改变预测结果。等校准器训练完、给出输出之后,再单独用一个轻量级的"修复"步骤,把被改掉的预测结果修复回原来的样子,但保留校准器对置信度的调整成果。
具体怎么修复?这里有个精巧的数学设计。CORD只做一件事:调整"分配给原始预测类别"的概率质量,同时完全保留校准器给出的、其余类别之间的相对比例关系。
打个比方,假设你有一块披萨要分给5个人吃,校准器原本的分法是:小明40%,小红25%,小刚20%,小丽10%,小张5%。但小明本来应该拿到最大的那一块(这是"原始预测"),校准器却把最大份给了别人。CORD要做的,不是把整块披萨重新乱分一遍,而是先确保小明重新拿到最大的一块,然后把剩下的部分,按照校准器原来给小红、小刚、小丽、小张分配的比例(25:20:10:5)继续分下去。这样一来,校准器辛苦学出来的"谁该多分谁该少分"的相对关系完全没有被破坏,只是把最大的那一块归位了。
如果不这样设计,直接把校准器的输出整体作废、随便给原始预测类别塞一个很大的数字进去,那校准器辛苦学到的关于其他类别之间相对可信度的信息就全浪费了。这就好比重新分披萨的时候,干脆把所有人的份都掀翻重新瞎分一次,虽然小明确实拿到了最大块,但小红原本该多拿一点、小张原本该少拿一点的合理安排全都乱套了。CORD的聪明之处就在于它只动一个自由度:原始预测类别该拿多少,其他的比例关系原封不动继承下来。
论文用KL散度(一种衡量两个概率分布差异程度的数学工具)证明了这种修复方式在数学上是唯一最优的:给定"原始预测拿多少份"这个约束之后,保留校准器输出的相对分布是让"改动幅度"最小的方案。
**协调全局:不能只顾单点,要看整体的平均水位**
如果CORD只是逐个样本地去修复,会带来一个新问题。
假设你独立地给每张图片做修复,选一个刚好能让原始预测重新排在第一的最小数值。这样做确实解决了单张图片的问题,但把所有样本放在一起看,你会发现:模型现在给"原始预测"这个类别分配的平均置信度,可能已经和校准器本来想表达的平均水平不一样了。
这就像一个班级,你单独去调整每个学生的某一门课分数,让每个人都刚好及格。看起来每个学生都过关了,但整个班的平均分可能因此被你悄悄拉高或拉低了,偏离了老师原本打分时想表达的整体水平。
CORD的解决方案是引入一个"全局协调"步骤。它先计算出校准器原本给所有样本的"原始预测类别"平均分配了多少置信度,然后在修复的时候,尽量让修复后的平均值贴近这个原始水平(如果做不到完全一致,就选择最接近的可行值)。
技术实现上,这个协调过程用到了一个共享的标量参数,论文里叫做η(读作"eta")。
拉格朗日乘子*:一种数学工具,用来在有约束条件的情况下寻找最优解。这里的η就是用来协调"每个样本的修复值"与"全局平均值必须匹配"这两个要求之间的平衡点,只需要计算一次,就能应用到所有新样本上。
有了这个共享的η之后,CORD在处理任何新的输入时,都不需要重新训练或调参,直接套用这一个数值就能完成修复。整套方法用到的所有输入,只有原始分类器的输出和校准器的输出这两组数据,不需要额外的监督信号,也不需要用户手动去调什么超参数。这一点在论文里被反复强调,作者称之为满足"R1到R4"四条设计要求:只用已有的输出、不额外训练模型、不需要调参、保证预测结果100%不变。
**实验结果:不只是保住了预测,置信度质量还更好了**
CORD做出来之后,最重要的问题是:这套修复到底有没有代价?会不会为了保住预测结果,反而让置信度质量变差?
论文在CIFAR-10、CIFAR-100和ImageNet-1K三个数据集上做了大规模测试,覆盖了从VGG、ResNet到Vision Transformer等多种模型架构,还测试了七种不同的校准方法。
结果是这样的:CORD在所有测试场景下都做到了TPCR为零,也就是100%保留原始预测,这是设计上就能保证的,不是靠运气。
更让人意外的是,CORD修复后的输出,在三个衡量校准质量的核心指标上,平均表现反而比校准器原本的直接输出更好。
这三个指标分别是:
期望校准误差(ECE)*:衡量模型报告的置信度和实际准确率之间的偏差,数值越低说明模型"说的自信程度"和"实际靠谱程度"越吻合。
负对数似然(NLL)和Brier分数*:两种更全面的评分方式,不只看最高置信度那一项,而是综合评估整个概率分布的质量,数值越低越好。
在CIFAR-100上,NLL从平均1.844降到1.705,ECE从平均下降了约2到5个百分点(具体因校准方法不同而不同),Brier分数也稳定下降。ImageNet-1K上的结果也是一致的,ECE的平均下降幅度达到0.847个百分点。
论文里还有一个特别有意思的规律:CORD带来的改善幅度,和原本的TPCR大小是正相关的。也就是说,如果一个校准方法本身改动预测结果的比例很高,CORD修复它之后带来的提升就特别明显;如果一个校准方法本身改动很少,CORD的提升幅度就相对温和。这个规律其实很符合直觉,改动越多的地方,说明这个校准方法在"预测保留"这件事上做得越粗糙,留给修复的改善空间自然也越大。
**面对图片模糊、噪声干扰,这套修复依然稳得住**
真实世界里,模型部署之后经常会遇到各种数据质量下降的情况,比如图片被压缩、被雨雪天气干扰、传感器噪声等等。论文特意用了CIFAR-10-C和CIFAR-100-C这两个"添加了各种人工噪声"的测试集,来检验CORD在数据变差的情况下是否依然可靠。
结果显示,随着噪声程度从1级加到5级,原始校准器的TPCR从1.65%一路涨到4.58%(CIFAR-10-C),数据越脏,校准器改动预测结果的次数越多。但CORD在每一个噪声等级上都稳定保持TPCR为零,同时置信度质量的改善幅度反而随着噪声加重而进一步扩大。
这说明CORD不是那种"实验室条件下好看,实际部署就翻车"的方法。数据越乱,它反而越能体现价值,因为数据越乱,校准器越容易"跑偏",CORD拉回来的效果就越明显。
论文还测试了校准数据量大小的影响。有些实际场景下,你只有很少的标注数据可以用来做校准,论文把校准集的大小从10%一路缩减测试到100%,发现即便校准数据只有10%那么少,CORD依然能把TPCR维持在零,而且置信度质量的提升在数据量小的时候反而更显著。这对于资源有限的实际部署场景来说是个好消息。
**这个修复到底要花多少计算成本?**
论文也很实在地给出了运行时间数据。在单线程CPU上,对ImageNet-1K这种超过100万张图片的大规模数据集,CORD构建阶段(计算那个共享参数η)只需要1.38秒,之后每处理一张图片的修复只需要25.64微秒。
这个速度快到什么程度?意味着CORD完全可以作为一个"即插即用"的轻量级后处理步骤,加在任何已经训练好的校准流程末端,几乎不增加额外的部署负担。而且部署时唯一需要保存的数据就是那一个η值,占用存储空间是8个字节,比一张图片的大小小了几百万倍。
**和"预防式"方法比起来,CORD表现如何?**
除了CORD这种"事后修复"的思路,学术界之前也有一批方法试图在训练校准器的时候就直接约束它不能改变预测结果,比如Temperature Scaling(温度缩放)、Mix-n-Match提出的多类别单调回归,还有更晚一些的AdaTS、TS-TvA等等。这些方法被称为"拟合时预测保留"(fit-time preservation)方法。
论文把CORD和这些方法放在CIFAR-10上做了直接对比。这个对比场景本身对CORD是相对"不利"的,因为CIFAR-10上的校准器本身TPCR就很低,改动预测结果的情况很少见,CORD能发挥的改善空间理论上应该更小。
即便如此,实验结果显示,先不加约束训练校准器、再用CORD做事后修复的组合方案,在ECE、等质量均分ECE_EM、平滑版smECE这三种校准质量指标上,普遍比那些"从训练时就加约束"的预防式方法表现更好或相当。这说明"先放开手让校准器充分发挥,再用轻量级手段修回来"这个思路,在实践中是可行的,甚至可能比"从头就套上枷锁"更有效。
**写在后面**
读到这篇论文的时候,我最先被触动的其实不是CORD这个方法本身,而是TPCR这个指标背后揭示的认知漏洞。
我们太习惯用一个单一的数字去判断一个系统好不好用了。准确率涨了0.24个百分点还是跌了0.24个百分点,看起来像个可以忽略的小数目。但这篇论文告诉你,这个小数目背后可能藏着近6%的具体决策被悄悄换掉了,而这些换掉的决策,最终会真实地影响某个具体的人、某个具体的判断。
这让我想到,很多我们习以为常的"综合指标",平均分、通过率、满意度评分,都可能在用同样的方式掩盖内部的剧烈波动。一个班级平均分不变,可能是一半学生进步一半学生退步;一个产品的整体满意度不变,可能是老用户流失了、新用户涌入了。TPCR提醒我的,其实是一种更普遍的思维习惯:任何时候看到一个"净效果"指标保持稳定,都应该多问一句,这个稳定,是真的没有变化,还是只是变化互相抵消了?
论文最后也很坦诚地留了一个开放性问题:什么时候应该要求预测结果一定不能变?什么时候又可以接受它变?这不是一个纯技术问题,而是一个需要结合具体应用场景去权衡的问题。医疗诊断系统或许该要求极度保守,绝不能让校准悄悄改变诊断结论;但一个内容推荐系统或许根本不在乎某次校准把"猫"的标签换成了"猎豹"的标签,只要置信度校准得更准就行。CORD提供的是一个选择权,而不是一个标准答案。
Q&A
Q1:CORD是什么?
A:CORD是一种事后修复方法,全称是Calibrator-Output Repair for Top-1 Decision Preservation,用于在模型置信度校准之后,把被校准过程悄悄改变的最终预测结果修复回原来的样子,同时保留校准器对置信度的调整效果。
Q2:Top-1预测变化率(TPCR)和准确率有什么区别?
A:准确率只反映预测结果改动带来的净效果,好坏抵消后可能显示变化很小。TPCR则统计所有被改动的预测总数,不管改动是变好、变差还是在两个错误答案之间切换,能揭示准??率掩盖的真实改动规模。
Q3:使用CORD需要重新训练模型或调参吗?
A:不需要。CORD只利用原始分类器和已训练好校准器的输出结果,不额外训练监督模型,不需要用户手动调节任何超参数,计算开销也很小,可以直接接在现有校准流程后面使用。
责任编辑:孙知兵
免责声明:本文仅代表作者个人观点,与太平洋财富网无关。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。
如有问题,请联系我们!
- Opta计算欧联夺冠概率排行:伯恩茅斯居首,尤文第6,米兰第82026-09-16
- 1-0,西甲倒数第一掀翻西甲第4,瓦伦西亚终结4连败+逃离降级区2026-09-16
- 焦点日报:特努斯展示iPhone Duo 屏幕画面模糊被吐槽 博主:苹果自带防窥功能2026-09-16
- 科尔曾决定离开勇士,季后赛期间达成两年续约 每日热议2026-09-16
- 米尔纳:克洛普最棒的地方就是你看到什么样,他就是什么样2026-09-16
- 谷歌公司发布Gemini 3.8实时对话模型|焦点观察2026-09-16
- 欧联安德莱赫特vs里昂主裁数据:近20场执法73黄、6红、13点2026-09-16
- 帝奥微大宗交易成交12.50万股 成交额487.50万元2026-09-16
- 让置信度改变,别让预测结果改变:一篇关于AI"改口"的论文2026-09-15
- 速讯:前米兰前锋马特里:莫德里奇跑动少是位置问题,战术要求问题2026-09-15
- 湖人新老板被指不为理财:买球队就是要夺冠2026-09-15
- 每日聚焦:业绩炸裂、股价重挫:宁德时代的“去宁化”之问2026-09-15
- 临床认可持续提升:蚕丝蛋白口腔修复膜获医生群体积极评价2026-09-15
- 豪恩汽电(301488.SZ):多名股东拟合计减持0.9638%股份-今日热文2026-09-15
- 美股加密货币概念股普跌 Circle跌近9% 独家焦点2026-09-15
- 向太陈岚表示:“郭碧婷过生日、放假、逢年过节,都会带着孙子,我们在哪,她就到哪”2026-09-15
- 山东黄金(01787.HK)拟9月24日举行2026年半年度业绩说明会2026-09-15
- 速读:曼联对布莱顿,ITV解说阵容出炉:奥谢默里坐镇2026-09-15
- 海港亚冠有惊无险,6-4泰超球队,武磊1球1助攻,格劳人挪活成高级货2026-09-15
- 焦点要闻:三分不中后,詹姆斯在安哥拉表演了一记双手扣篮2026-09-15
- 王小七晒与库里合照:明年见咯2026-09-15
- 前景无忧增长叙事“堪忧”:计量产品收入下滑40%,境外收入占比萎缩至4%以下丨读懂IPO2026-09-15
- 北证50急跌后迎布局窗口 美联储扰动不改中小创修复逻辑 实时焦点2026-09-15
- 【图解】8月高频数据凸显中国经济韧性活力 焦点简讯2026-09-15
- 经营贷利率悄然上行!银行主动缩规模,贸易类申请人被收紧|今亮点2026-09-15
- 壹石通(688733):壹石通关于最近五年未被证券监管部门和证券交易所采取监管措施或处罚情况2026-09-15
- 渣打集团:9月14日斥资817.39万英镑回购35.33万股 今日聚焦2026-09-15
- 看动车组在全自动洗车房如何高效“搓澡”2026-09-15
- 9月15日生意社锰硅市场基差为-82元/吨 最新资讯2026-09-15
- 信义光能(00968.HK)9月15日耗资307.5万港元回购150万股 速递2026-09-15
精彩推荐
- 焦点日报:特努斯展示iPhone Duo 屏幕画面模糊被吐槽 博主:苹果自带防窥功能
- 向太陈岚表示:“郭碧婷过生日、放假、逢年过节,都会带着孙子,我们在哪,她就到哪”
- 【图解】8月高频数据凸显中国经济韧性活力 焦点简讯
- 9月15日港股工用支援行业共2只股票被沽空,总沽空金额为2758.91万港元
- 兰州边玩边想电子有限公司成立 注册资本10万人民币
- 星空体育透露多特主帅科瓦奇否决桑乔回归:阵容已足够庞大-每日热点
- 每日聚焦:科创板新股高涨幅延续 打新收益已超去年全年
- 一口气发布9款机器人, FF这么牛吗?
- 济南昆龙再生资源有限公司成立 注册资本5万人民币
- 每日热门:今起禁停!许昌五一路(八一路至天宝路段)停车位取消
- 七条举措促进智能家居消费-微速讯
- 牛散先“赔钱”换取持股解禁 上市公司业绩补偿难题可以这样解-焦点讯息
- 视频丨探访马道枢纽 看平陆运河超级船闸里的精密巧思
- 醒醒吧 明年大批燃油车将迎来全面大换新,谁说油车要被电车取代?
- 9月14日生意社PX市场基差为234元/吨_每日看点





中国互联网违法和不良信息举报中心