论文研究普通
OpenAI GPT-6 Astra 在家具组装基准 FAB 上准确率达 80%,Claude Fable 5.1 为 70%
原始标题:让 AI 学会"挑刺":根据说明书 + 照片指出家具是否装错,OpenAI GPT-6 Astra 准确率已达 80%
内容摘要
Epoch AI 的家具组装基准测试 FAB 显示,OpenAI GPT-6 Astra 以 80% 准确率居首,Anthropic Claude Fable 5.1 和 Claude Opus 5 分别为 70% 和 61%。