AI圈报
论文研究普通

研究揭示 LLM 全流程为何默认偏向美式英语:1,813 组 AmE–BrE 变体与 DiAlign 方法

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:How Does "English (US)" Become the Default? Triangulating Structural Bias Towards American English Across the LLM Pipeline

内容摘要

研究以 1,813 组匹配的美式英语(AmE)与英式英语(BrE)变体为资源,提出免训练的 DiAlign 方法,从数据分布证据估计区域对齐度。AmE 在全部 6 个预训练语料和 21 个后训练数据集中均被偏好,tokenizer 表示更紧凑、预测成本更低,且在中性英语提示下仍是默认生成偏好;改用英式英语提示可向 BrE 偏移,但无法稳定消除 AmE 默认。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-87f07e018735dee87f597a85