论文研究普通
Martian AI Frontier 推出模型可靠性榜单,跨模型路由错误减少 46%-54%
原始标题:A model can look strong on average and still be unpredictable on the same prompt. Martian's new AI …
内容摘要
Martian 推出 AI Frontier 可靠性榜单,每个数据点运行 10 次,覆盖 16 个基准(含 TerminalBench、LiveCodeBench 等),当前 Qwen3.7 Max 可靠性 96.1%,Claude Opus 4.6 为 94.4%,GPT-5.5 为 93.5%。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Kim (@kimmonismus)
站内情报编号intel-825f6a8a7dd99c547cc5271e