论文研究普通
论文《Do LLMs Capture the Diversity in their Training Data?》发现 LLM 输出多样性低于训练数据
原始标题:LLMs learn a narrower set of answers than their training data, even when you sample instead of using…
内容摘要
论文比较模型与训练数据在同一前缀下的条件熵,发现 OLMo、Pythia、GPT-Neo 的输出条件多样性均低于训练数据,图像生成器也存在类似差距。OLMo 20K 样本上训练数据得分 338.58,贪心解码为 218.88,nucleus 采样 287.31,ancestral 采样 297.31;调高温度到 T=1.9 虽匹配训练熵但精度和外部条件 NLL 变差。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Rohan Paul (@rohanpaul_ai)
站内情报编号intel-b9a2b00c84938154d55312d8