AI圈报
模型发布 / 更新普通

Grok 4.7 在 Harvey 法律智能体基准上以 9.4% 幻觉门控通过率居首

信息来源:X:Elon Musk (@elonmusk, xAI)·
原始标题:Grok 4.7 ranks first in legal matters

内容摘要

Artificial Analysis 与 Harvey 合作发布 Harvey LAB-AA v1.1,新指标 Hallucination-Gated All-Pass Rate 要求交付物无重大幻觉。Grok 4.7 (xhigh) 以 9.4% 居首,领先 Muse Spark 1.3 (max) 的 8.9% 和 GPT-6 Astra (max) 的 8.6%;测试模型中超过 60% 的原通过结果含重大幻觉。Grok 4.7 每任务约 $9.50,GPT-6 Astra 每任务平均仅 0.03 次重大幻觉。
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Elon Musk (@elonmusk, xAI)
站内情报编号intel-c7840cd5ae8d3456c1ec7463