AI圈报
论文研究精选

OpenAI 用单条人类演示训练智能体在 Montezuma's Revenge 上达到 74500 分

信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例)·
原始标题:Learning Montezuma’s Revenge from a single demonstration

内容摘要

OpenAI 训练的智能体仅从单条人类演示出发,在 Montezuma's Revenge 上取得 74500 分的高分,超过此前已发表的最好结果。算法做法是从演示中精心挑选的状态开始连续游戏,使用 PPO 优化游戏得分进行学习,PPO 也是支撑 OpenAI Five 的同一强化学习算法。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源OpenAI:官网动态(RSS · 排除企业/客户案例)
站内情报编号intel-29e0560867b14cfd0b9b4076