论文研究普通
SlopCodeBench 完整跑分:GLM 5.3、Sol 5.6 与 Astra 对比
原始标题:finally finished a full SlopCodeBench run against GLM 5.3, Sol 5.6, and Astra (Fable 5.1 results com…
内容摘要
Dex Horthy 完成了 SlopCodeBench 对 GLM 5.3、Sol 5.6 和 Astra 的完整基准测试,首次跑完全部场景而非此前的小子集。Astra 得分比 gpt-5.5 高几分,但差距不如预期;Sol 得分低于 gpt-5.5 令他意外。他猜测新模型在更高思考模式下更容易失控,自己日常多用 Sol 的 medium 或 low effort。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Dex Horthy(HumanLayer)(@dexhorthy)
站内情报编号intel-7921988d9fd3ccf1481dfb2b