AI圈报
模型发布 / 更新普通

JevBench 发布:面向类型化决策的新基准

信息来源:X:Rohan Paul (@rohanpaul_ai)·
原始标题:A new benchmark called JevBench just dropped. for models whose output is a bounded software decisio…

内容摘要

新基准 JevBench 发布,专为输出受限软件决策而非开放式文本的模型设计,紧随 TypeSafe 9 月 15 日发布 Jev--输入应用状态与固定选项,返回带概率的类型化答案。该基准综合智能、校准、速度与成本,用几何平均防止单一维度优势掩盖短板。GPT-5.6 Luna 在难题准确率上明显高于 Jev 1.13.0,但 Jev 因延迟、校准和成本更优而在综合分上领先。
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Rohan Paul (@rohanpaul_ai)
站内情报编号intel-b8684705b6cf513ee2c066fd