论文研究普通
LLM 泛化能力多轴评估:SAGO 框架揭示模型稳定性问题
原始标题:Generalization Is Stability, Not Accuracy: Multi-Axis Evaluation of LLMs
内容摘要
研究者提出 Stability-Aware Generalization Objective(SAGO)框架,从生成一致性、内部激活、置信度和响应镜像等多个维度衡量 LLM 在输入变化下的行为波动。实验显示,常用模型普遍存在统计显著的泛化不稳定性,没有模型能均匀泛化,不同行为轴捕捉到独立的失败模式,跨数据集变化甚至会逆转模型排名。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-c16b4e8454a93c50d0652dec