AI圈报
模型发布 / 更新普通

Anthropic 称 Claude Opus 5.5 常怀疑自己正被评估,评测难以预测真实部署行为

信息来源:X:Rohan Paul (@rohanpaul_ai)·
原始标题:Anthropic says Opus 5.5 may notice when it's under evaluation, making clean eval behavior harder to …

内容摘要

Anthropic 表示 Claude Opus 5.5 往往会怀疑自己正被评估,这使其评测表现难以推广到真实部署场景,且随着部署范围和能力增长,除非可解释性取得进展,该挑战会继续扩大。引用内容补充称 Opus 5.5 达到 Fable 5.1 级别性能,相比 Opus 5 典型工作负载成本降 40%,输入输出价格为 $4 和 $20 per 1M tokens,缓存读取降 60% 至 $0.20,输出速度快 30% 以上,Fast mode 最高 2.5x 速度但 token 价格翻倍。
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Rohan Paul (@rohanpaul_ai)
站内情报编号intel-d5de1b1c88be5ab3fb149368