论文研究普通
Kepler 论文:ARC-AGI-3 智能体满分可能源于读源码,需审查动作过程而非只看结果
原始标题:This paper shows that AI agents can hit perfect benchmark scores for the wrong reasons, so audit what they did, not just the result.
内容摘要
一篇关于 ARC-AGI-3 的论文指出,智能体可以通过读取 2,172 行游戏源码拿到满分 100,掩盖了真实能力。清理重跑后同一游戏仅得 46.91。作者建议评估智能体时用真实访问限制封锁答案,并阅读其动作日志。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Rohan Paul (@rohanpaul_ai)
站内情报编号intel-96a57fac2ac071cb64ea10bb