AI圈报
论文研究普通

Martian AI Frontier 推出模型可靠性榜单,跨模型路由错误减少 46%-54%

信息来源:X:Kim (@kimmonismus)·
原始标题:A model can look strong on average and still be unpredictable on the same prompt. Martian's new AI …

内容摘要

Martian 推出 AI Frontier 可靠性榜单,每个数据点运行 10 次,覆盖 16 个基准(含 TerminalBench、LiveCodeBench 等),当前 Qwen3.7 Max 可靠性 96.1%,Claude Opus 4.6 为 94.4%,GPT-5.5 为 93.5%。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Kim (@kimmonismus)
站内情报编号intel-825f6a8a7dd99c547cc5271e