论文研究普通
研究:LLM 高分却缺基础,Qwen3-80B 一致性仅 48%
原始标题:Humans usually need the foundations before the advanced skill; we need to know the basics before the…
内容摘要
一项研究对比 8 个 LLM 与超 18000 名人类学习者,发现人类答对难题时 72.7% 也能答对其所有前置基础题,整体得分 79.6%;Qwen3-80B-Instruct 得分更高达 92.5%,但仅 48.16% 的正确答案满足同样的前置一致性。论文指出高准确率可能掩盖知识断层,建议用难易关联题组而非孤立基准题评估推理模型。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Rohan Paul (@rohanpaul_ai)
站内情报编号intel-ef82a753ff50091b7a1b8fcc