AI圈报
论文研究普通

高效推理训练并不总会损害 CoT 忠实性与可监控性

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Efficient Reasoning Training Does Not Always Harm CoT Faithfulness and Monitorability

内容摘要

研究用固定生成预算、按样本长度目标和组相对长度奖励三种方式对大语言模型做长度压缩微调,发现高效推理对 CoT 忠实性与可监控性的影响并不相同。多数设置下忠实性下降,主因是训练后模型一致性变差;可监控性更稳健,即使 CoT 大幅缩短,模型仍会说明输入干预对答案的影响。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-8fe580afbaecb277d0119ca7