AI圈报
观点 / 方法精选

AI中心的数据黑洞

信息来源:Dwarkesh Patel:Podcast & Blog(RSS)·
原始标题:The data black hole at the center of AI

内容摘要

智能的一种定义是样本效率,但近年AI进步主要靠扩充数据分布和增加算力。强化学习本质是合成数据生成--投入大量算力通过验证器筛选"好"数据,再训练模型预测正确输出。这一过程需要每个领域和技能的海量人类专家示例,数据行业年收入已达数十亿美元。近日Epoch报告,开源模型仅落后前沿闭源模型4个月,原因在于数据可从公开API蒸馏,而超参数等不易复制。人类一生接触约2亿token,前沿模型训练在数十到数百T token之间,相差近百万倍--机器人、自动驾驶等领域同样存在巨大效率差距。
内容分类AI 观点与方法
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Dwarkesh Patel:Podcast & Blog(RSS)
站内情报编号intel-e5fb72866ec2c71b6b5fe93f