模型发布 / 更新普通
DeepSeek R1 长思考与蒸馏小模型往事回顾
原始标题:请读完了Section 2后继续看Section 3 . 明确写了模型在长思考时的表现. 当时震撼人心的继续从71.0% 飙升到 86.7% 就是这么来的. 然后将 R1 生成的长思维链蒸馏到了小模型…
内容摘要
DeepSeek R1 长思考表现从 71.0% 飙升至 86.7%,并将 R1 生成的长思维链蒸馏到 Qwen-1.5B、7B、14B 小模型,运行时给足思考预算后解题能力随思考长度正相关暴涨。作者借此回顾去年 ollama 将 deepseek-r1-distilled-qwen-7b 当作 deepseek 装到用户电脑上的事件。
内容分类AI 模型发布与更新
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:karminski (@karminski3)
站内情报编号intel-bb009cf8991513dd99070a63