選項
首頁
新聞
AI學者在Alphago的國際象棋勝利背後獲得了Turing獎的技術

AI學者在Alphago的國際象棋勝利背後獲得了Turing獎的技術

2025-04-18
237

AI學者在Alphago的國際象棋勝利背後獲得了Turing獎的技術

在過去十年中,人工智慧以其進展令人矚目,特別是透過一種技術,讓電腦進行隨機選擇並從結果中學習。這種方法,被稱為強化學習,對實現人工智慧的卓越成就至關重要。

以Google DeepMind的AlphaZero計畫為例,該計畫於2016年啟動,至2018年已精通國際象棋、將棋和圍棋等複雜遊戲。同樣地,AlphaStar也採用此方法,在電玩遊戲《星海爭霸II》中達到「大師」級別。這些成就彰顯了強化學習的強大力量。

週三,該領域迎來了一個重要的里程碑,兩位人工智慧學者因其在推進強化學習方面的開創性工作而獲得榮譽。馬薩諸塞大學阿默斯特分校榮譽教授Andrew G. Barto和加拿大阿爾伯塔大學教授Richard S. Sutton獲得了計算機協會(ACM)頒發的2025年圖靈獎。

強化學習先驅的表彰

ACM讚揚Barto和Sutton為強化學習奠定了基礎,稱他們「提出了主要理念,構建了數學基礎,並開發了重要演算法。」這項榮譽伴隨著100萬美元的獎金,常被視為計算機行業的諾貝爾獎。

強化學習可以比喻為一隻老鼠在迷宮中尋找乳酪。老鼠學會哪些路徑通向進展,哪些是死胡同。同樣地,神經科學家認為,像老鼠這樣的智能生物會發展出「內部世界模型」來指導行動。

Sutton和Barto提出,電腦也可以發展這樣的內部模型。在強化學習中,電腦收集其環境的數據——無論是迷宮還是棋盤——並最初採取隨機行動。它以獎勵或懲罰的形式接收反饋,這有助於估計不同行動的結果。基於這些估計,程式制定「策略」來指導未來決策,平衡探索新行動與利用已知成功行動之間的關係。

探索與利用的角色

強化學習的核心在於探索新可能性與利用已知策略之間的微妙平衡。單獨採取任一方法都不足以成功。

對於有興趣深入研究的讀者,Sutton和Barto於2018年出版的教科書是寶貴資源。

值得注意的是,像OpenAI這樣的企業有時以不同方式使用「強化學習」一詞,採用「來自人類反饋的強化學習」(RLHF)來優化像GPT這樣的大型語言模型的輸出。然而,這與Sutton和Barto開發的方法有所不同。

強化學習作為思維理論

Sutton在2017年至2023年間擔任DeepMind傑出研究科學家,他主張強化學習不僅是一種技術,而是一種「思維理論」。他對人工智慧缺乏計算理論表示擔憂,聲稱「強化學習是第一個智能的計算理論」。

除了技術應用外,強化學習還可能揭示創意和自由遊戲作為智能表現的作用。Sutton和Barto強調了遊戲在學習中的角色,認為好奇心驅動探索。Sutton強調,遊戲可能涉及設定當前看似無用的目標,但日後可能證明有益。

「遊戲是一件大事」,Sutton表示,顯示其在學習和智能更廣泛背景中的重要角色。

從Barto和Sutton的基礎工作到其在遊戲及更廣泛領域的應用,強化學習的旅程持續推動人工智慧成就的邊界。

相關文章
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。 DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。 Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額 儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額 儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了
加州自動駕駛合規:罰單、地理圍欄與 100 萬英里的新時代 加州自動駕駛合規:罰單、地理圍欄與 100 萬英里的新時代 Guident 在南佛羅里達州營運一輛 AuveTech 接駁車,並運用其遠端監控技術,管理西棕櫚灘的一條四英里路線以及博卡拉頓的一條一英里路線。| 圖片來源:Guident加州正重新定義無人駕駛車輛的監管格局,從科技產業的「快速行動、打破常規」心態,轉向嚴格的問責制與嚴謹的行駛里程要求。Guident 執行董事長兼執行長哈羅德·布勞恩(Harold Braun)在《機器人報告》(The Robo
相關專題推薦
聊天機器人 用於語言練習、面試準備和日常流利度的最佳 AI 角色扮演聊天應用
用於語言練習、面試準備和日常流利度的最佳 AI 角色扮演聊天應用

2026 年最新最佳頂級評分 AI 角色扮演聊天應用,用於語言練習、面試準備和日常流利度!XIX.AI 精心策劃了一個強大的變革性合集,提供免費與付費對比、真實世界測試以及每週更新的排名。這些必試工具可幫助您提升寫作技能,克服流利度挑戰,並提高所有日常場景下的溝通效率。立即探索,發現您語言成長的完美工具!

10 個工具
xix.ai
音樂創作 用於混音製作、取樣準備及卡拉OK母帶處理的 AI 聲部分離工具
用於混音製作、取樣準備及卡拉OK母帶處理的 AI 聲部分離工具

2026年最新、最優秀且評分最高的AI音軌分離工具彙總,專為混音製作、取樣準備以及卡拉OK音訊處理而設計。這些功能強大的創新工具經過實際測試,能夠實現精準的音訊分離,顯著提升工作效率。XIX.AI每週都會更新免費的付費產品對比指南,幫助您找到最適合自身需求的工具。立即探索,發揮您的AI優勢。

8 個工具
xix.ai
數據分析 用於收入看板、轉化漏斗分析及產品指標分析的 AI SQL 助手
用於收入看板、轉化漏斗分析及產品指標分析的 AI SQL 助手

2026年最新最優秀的AI SQL輔助工具排名揭曉!XIX.AI精心挑選了一系列功能強大的工具,這些工具會定期更新,並透過真實的場景測試來驗證其效能。使用這些值得嘗試的工具,您可以快速生成精準的收入分析報表、分析銷售流程,並追蹤產品各項指標,從而大幅提升工作效率。立即探索,找到最適合您的資料驅動決策工具!238個字元

9 個工具
xix.ai
音樂創作 最佳用於歌曲草稿的 AI 旋律創作工具
最佳用於歌曲草稿的 AI 旋律創作工具

2026 年最新最佳頂級評分 AI 旋律創作工具,助力歌曲草稿創作!XIX.AI 精心策劃了一套極具影響力且經過嚴格真實世界測試的變革性合集,旨在提供最佳的創作體驗。您可以找到詳細的免費與付費版對比、精準的排名以及必試選項,這些工具旨在幫助您輕鬆創作出令人驚豔的歌曲草稿,並顯著提升您的創意生產力。立即探索,發現您的完美工具!

8 個工具
xix.ai
聊天機器人 最適合面試練習的 AI 對話訓練工具
最適合面試練習的 AI 對話訓練工具

2026 年最新、最受好評的 AI 面試對話訓練工具,盡在 XIX.AI!這份精心精選的清單收錄了多款功能強大、顛覆傳統的工具,這些工具均經過嚴格的實戰測試,能提供精準的回饋。 您將在此找到免費版與付費版的比較分析,以及詳細的排名榜單,助您挑選必試的選項,從而提升自信與技能。立即探索,發掘助您在面試中脫穎而出的完美工具!

12 個工具
xix.ai
設計與藝術 最適合進行創意實驗的 AI 風格轉移工具
最適合進行創意實驗的 AI 風格轉移工具

2026 年最新、最佳且評價最高的 AI 風格轉移工具,助您進行創意實驗!XIX.AI 精心精選了一系列強大且具革命性的必試工具,這些工具經實際測試與嚴格評比,能帶來卓越成果。這些頂尖解決方案能加速內容創作並開啟無盡的創意可能性,協助創作者顯著提升生產力。 立即探索,找出最適合您的工具,並從今天開始創作吧!

9 個工具
xix.ai
評論 (12)
0/500
NicholasAdams
NicholasAdams 2025-08-16 19:00:59

This reinforcement learning stuff is wild! AlphaGo beating chess champs? Mind blown 🤯. Makes me wonder how far AI can push human limits—scary but exciting!

GeorgeTaylor
GeorgeTaylor 2025-08-11 03:00:59

Mind-blowing how reinforcement learning led to AlphaGo's chess win! 🤯 Makes me wonder what other games AI will conquer next.

ArthurBrown
ArthurBrown 2025-04-22 06:39:03

The AI Scholars Awarded Turing Prize really blew my mind! The way they used reinforcement learning to make AlphaGo win at chess is just genius. It's like watching a sci-fi movie come to life. I wish I understood the tech better, but it's still super cool! 🤓

EdwardTaylor
EdwardTaylor 2025-04-21 12:00:52

AlphaGoのチェス勝利の背後にある技術でAI Scholarsがチューリング賞を受賞したのは驚きです!強化学習がAIをこれほどの高みに押し上げたのを見るのは魅力的です。ただ、時々技術的な内容が難しすぎることがありますが、それでも人間の創意工夫の証です。境界を押し広げ続けてください!🧠

WalterSanchez
WalterSanchez 2025-04-21 09:09:05

The AI Scholars winning the Turing Prize for the technique behind AlphaGo's chess victory is mind-blowing! It's fascinating to see how reinforcement learning has propelled AI to such heights. The only thing is, it's a bit too technical for me at times, but still, it's a testament to human ingenuity. Keep pushing the boundaries! 🧠

WillieJackson
WillieJackson 2025-04-20 17:42:21

¡Los académicos de IA que recibieron el Premio Turing por la técnica detrás de la victoria de AlphaGo en el ajedrez me dejaron asombrado! Usar el aprendizaje por refuerzo para ganar es genial. Me gustaría entender mejor la tecnología, pero aún así es muy cool! 🤓

OR