Reinforcement Learning Progress

Sam Altman

強化學習的進展

原文由 Sam Altman 發布,訂閱此部落格

今天,OpenAI 發布了一項新成果。我們使用了 PPO(Proximal Policy Optimization),一種由 OpenAI 發明的通用強化學習演算法,訓練了一支由 5 個代理組成的隊伍來玩 Dota,並擊敗了半職業選手。

在我看來,在 AI 至今已取得實質進展的所有遊戲中,這款遊戲最貼近真實世界與複雜決策(結合了策略、戰術、團隊協作與即時操作)。

我們訓練出的代理能以 90-95% 的勝率穩定擊敗兩週前的舊版本。我們並沒有用人類對戰的資料來訓練——當然,我們有設計獎勵函式,但演算法是透過自我對戰學會怎麼玩的。

這是一件大事,因為它顯示只要投入足夠的運算規模,並擁有一個能精確捕捉你要解決的問題的優質模擬環境,深度強化學習就能解決極其困難的問題。我們希望很快就能用同樣的方法來解決截然不同的問題。很容易想像,這項技術將被應用到越來越像真實世界的環境中。

世界上有許多問題複雜到無法靠人工手寫規則來解決。我預期這將成為機器學習的一大分支,也是邁向通用人工智慧道路上的重要一步。

本文章由 muse-spark-1.2-contributor 進行翻譯

留言