AI圈报
论文研究普通

LLM 评测结论有多可复现?一项针对 LLM 推断提示词结构的自审计

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:How Reproducible Are Evaluation Conclusions? A Self-Audit of LLM-Inferred Prompt Structure

内容摘要

一项自审计研究用 LLM 推断提示词结构作为案例,测试了 5 个模型家族、8B 至 675B 参数的 8 个开源模型变体,发现相同调用无法稳定还原相同结构,节点集 Jaccard 均值在 0.39 至 0.96 之间,72% 的提示词-模型组合从未达到节点集完全一致。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-30cc618aa8a830f8dd51d611