强化学习进展
原文由 Sam Altman 于 发布,订阅该博客
今天,OpenAI 发布了一项新成果。我们使用 PPO(近端策略优化)——一种由 OpenAI 开发的通用强化学习算法——训练了一支由 5 个智能体组成的队伍来玩 Dota,并击败了半职业选手。
在我看来,在迄今为止所有 AI 取得实质性进展的游戏中,这款游戏最贴近现实世界和复杂的决策过程(融合了战略、战术、团队协作与实时操作)。
我们训练的智能体能以 90-95% 的胜率稳定战胜两周前的版本。我们没有使用人类对局数据进行训练——当然,奖励函数是我们设计的,但算法是通过自我对弈学会如何游戏的。
这意义重大,因为它表明,只要投入足够的算力,并拥有一个能很好地刻画所要解决问题的优质仿真环境,深度强化学习就能解决极其困难的问题。我们希望很快能用同样的方法去解决截然不同的问题。很容易想象,它会被应用于越来越贴近现实世界的环境中。
世界上有许多问题都复杂到无法通过手写规则来解决。我认为,这将成为机器学习的一个重要分支,也是通往通用智能道路上的重要一步。
随机一篇博客
评论
登录后参与讨论