“智商:AI評估的有缺陷的措施”

在最近的一次新聞活動中,OpenAI的首席執行官Sam Altman分享了他對AI「智商」快速進步的看法。他提到:「非常粗略地說,我感覺——這不是科學上精確的,這只是一種直覺或精神上的回答——每年我們在智商上進步一個標準差。」Altman並不是唯一使用智商作為AI進步衡量標準的人;社群媒體影響者也常將AI模型進行智商測試並分享結果。
然而,許多專家認為,用智商來評估AI的能力不僅不夠充分,還具有誤導性。牛津大學專注於科技與監管的學者Sandra Wachter對TechCrunch表示:「使用我們評估人類的相同標準來描述能力或進展非常誘人,但這就像拿蘋果與橘子比較。」
在新聞發布會上,Altman似乎將智商等同於智能。然而,智商測試更多是關於特定類型智能的相對測量,而非絕對測量。它們通常被視為邏輯和抽象推理的良好指標,但在實踐智能——幫助解決實際問題的能力——方面則顯不足。此外,它們僅能提供某人能力的瞬間快照。
Wachter指出:「智商是用來測量人類能力的工具——本身就充滿爭議——基於科學家認為人類智能的樣貌。但你不能用相同的標準來描述AI的能力。汽車比人類跑得快,潛艇在潛水方面更出色。但這不意味著汽車或潛艇超越了人類智能。你將某個方面的表現等同於人類智能,而人類智能遠比這複雜得多。」
智商測試的起源與優生學有關,這是一種已被否定的通過選擇性育種改善人類的理論。要在這些測試中表現出色,你需要良好的工作記憶和對西方文化規範的熟悉,這可能引入偏見。華盛頓大學研究倫理AI的博士候選人Os Keyes認為,如果AI模型在智商測試中表現良好,這更多反映了測試的缺陷,而非模型的能力。Keyes說:「如果你的記憶力和耐心幾乎無限,這些測試很容易被操縱。智商測試是測量認知、意識和智能的極其有限方式,這一點在數位電腦發明之前我們就已知。」
AI在智商測試中可能具有不公平的優勢,因為模型擁有龐大的記憶和知識庫。它們常在公開的網頁數據上進行訓練,其中包含大量智商測試題目。倫敦國王學院專攻AI的研究員Mike Cook指出:「測試往往重複非常相似的模式——提高智商的幾乎萬無一失的方法就是練習智商測試,這正是每個模型實際上所做的。當我學習某事物時,我不會像AI這樣,以完美清晰的方式將其輸入我的大腦100萬次,也無法在無雜訊或信號損失的情況下處理它。」
Cook還指出,智商測試帶有固有的偏見,是為人類設計以評估一般問題解決能力的。它們不適合AI,因為AI以不同方式處理問題。他說:「烏鴉可能會使用工具從盒子中取出食物,但這不意味著它能進入哈佛讀書。當我解決數學問題時,我的大腦還要應對是否正確閱讀頁面上的文字、不去想回家路上要買的東西,或者房間裡現在是否太冷。換句話說,人類大腦在解決問題時——無論是智商測試還是其他問題——需要應對更多的事情,而且比AI得到的幫助少得多。」
AI Now研究所的首席AI科學家Heidy Khlaaf對TechCrunch表示,我們需要更好的方式來測試AI。她說:「在計算歷史中,我們從未將計算能力直接與人類能力相比,因為計算的本質意味著系統早已能完成超出人類能力的任務。直接將系統表現與人類能力比較是一個新近現象,且備受爭議,圍繞著不斷擴展且變動的AI系統評估基準的爭議。」
相關文章
華納音樂收購AI歸因初創公司Sureel AI
華納音樂集團(WMG)於週三確認,其正在收購Sureel AI,一家專注於人工智慧歸因的初創公司。Sureel的專有技術為音樂曲目生成“AI DNA”,將其分解為各個組成部分,以追蹤人工智慧模型如何利用這些元素。透過此次收購,WMG旨在增強其監控其藝術家和詞曲創作者的作品在人工智慧生成內容中被使用或用於訓練人工智慧模型的能力。“將Sureel整合到WMG中,增強了我們的保護、控制和變現能力,確保創意社羣保留對其智慧財產權、姓名、肖像、形象和聲音的控制權,”WMG執行長Robert Kync
亞馬遜推出“Alexa for Shopping”,同時將Rufus邊緣化
亞馬遜推出了“Alexa for Shopping”,將 Rufus 購物聊天機器人 Alexa+ 整合到應用程式、網站和 Echo Show 裝置中。該助手回答產品查詢、比較商品、跟蹤價格,並支援購物提醒。它還處理計劃中的購物操作和符合條件的自動購買。據該公司稱,“Alexa for Shopping”將 Rufus 的產品專業知識與 Alexa+ 的個性化助手上下文相結合。亞馬遜表示,Rufus 在 2025 年協助了超過 3 億客戶進行產品研究、比較和購買。GeekWire 報道稱,
微軟、Azure 與 AI 技術共同對抗加州野火風險
微軟投資於人工智慧驅動的野火偵測技術,其首席副總裁暨首席數據科學家胡安·拉維斯塔·費雷斯(Juan Lavista Ferres)針對減輕環境損害的策略進行了探討。根據美國國家航空暨太空總署(NASA)指出,氣候變遷影響地球上的每個人,其表現為氣溫上升、降雨模式改變以及海平面上升。NASA 指出,有確鑿證據顯示地球正以前所未有的速度變暖,而人類活動是主要驅動因素。隨著全球氣溫上升,野火構成的威脅日
相關專題推薦
評論 (48)
0/500
interesting perspective! always thought of AI as a super-fast learner, not something we could measure with something like IQ. sam’s analogy does make it relatable, but i agree—AI probably needs its own new rating system entirely. 🤔
Это точно! IQ — устаревший инструмент для оценки ИИ 🤖 Интеллект многогранен — творчество, эмоции, адаптация куда важнее сухих цифр. Интересно, какие метрики придут на смену?
¿IQ para medir IA? 😅 Qué idea más anticuada. Sam Altman tiene razón en que es una métrica limitada. Los humanos tenemos inteligencias múltiples, ¿por qué reducirlo todo a un número? Me pregunto si no deberíamos desarrollar nuevas formas de evaluar capacidades como creatividad o empatía en sistemas de IA. ¡Eso sí sería revolucionario!
A visão de Sam Altman sobre o crescimento do IQ da IA é intrigante, mas me parece um pouco vaga. É legal pensar que a IA está ficando mais inteligente a cada ano, mas como medimos isso? Ainda assim, é um conceito divertido para refletir tomando um café. ☕ Talvez eles devessem desenvolver uma métrica mais concreta? 🤔
サム・アルトマンのAIのIQ成長に関する見解は興味深いですが、私には少し曖昧に感じます。AIが毎年賢くなると思うのはクールですが、それをどう測るのでしょうか?それでも、コーヒーを飲みながら考える楽しいコンセプトですね。☕もっと具体的な指標を開発すべきかもしれませんね?🤔

在最近的一次新聞活動中,OpenAI的首席執行官Sam Altman分享了他對AI「智商」快速進步的看法。他提到:「非常粗略地說,我感覺——這不是科學上精確的,這只是一種直覺或精神上的回答——每年我們在智商上進步一個標準差。」Altman並不是唯一使用智商作為AI進步衡量標準的人;社群媒體影響者也常將AI模型進行智商測試並分享結果。
然而,許多專家認為,用智商來評估AI的能力不僅不夠充分,還具有誤導性。牛津大學專注於科技與監管的學者Sandra Wachter對TechCrunch表示:「使用我們評估人類的相同標準來描述能力或進展非常誘人,但這就像拿蘋果與橘子比較。」
在新聞發布會上,Altman似乎將智商等同於智能。然而,智商測試更多是關於特定類型智能的相對測量,而非絕對測量。它們通常被視為邏輯和抽象推理的良好指標,但在實踐智能——幫助解決實際問題的能力——方面則顯不足。此外,它們僅能提供某人能力的瞬間快照。
Wachter指出:「智商是用來測量人類能力的工具——本身就充滿爭議——基於科學家認為人類智能的樣貌。但你不能用相同的標準來描述AI的能力。汽車比人類跑得快,潛艇在潛水方面更出色。但這不意味著汽車或潛艇超越了人類智能。你將某個方面的表現等同於人類智能,而人類智能遠比這複雜得多。」
智商測試的起源與優生學有關,這是一種已被否定的通過選擇性育種改善人類的理論。要在這些測試中表現出色,你需要良好的工作記憶和對西方文化規範的熟悉,這可能引入偏見。華盛頓大學研究倫理AI的博士候選人Os Keyes認為,如果AI模型在智商測試中表現良好,這更多反映了測試的缺陷,而非模型的能力。Keyes說:「如果你的記憶力和耐心幾乎無限,這些測試很容易被操縱。智商測試是測量認知、意識和智能的極其有限方式,這一點在數位電腦發明之前我們就已知。」
AI在智商測試中可能具有不公平的優勢,因為模型擁有龐大的記憶和知識庫。它們常在公開的網頁數據上進行訓練,其中包含大量智商測試題目。倫敦國王學院專攻AI的研究員Mike Cook指出:「測試往往重複非常相似的模式——提高智商的幾乎萬無一失的方法就是練習智商測試,這正是每個模型實際上所做的。當我學習某事物時,我不會像AI這樣,以完美清晰的方式將其輸入我的大腦100萬次,也無法在無雜訊或信號損失的情況下處理它。」
Cook還指出,智商測試帶有固有的偏見,是為人類設計以評估一般問題解決能力的。它們不適合AI,因為AI以不同方式處理問題。他說:「烏鴉可能會使用工具從盒子中取出食物,但這不意味著它能進入哈佛讀書。當我解決數學問題時,我的大腦還要應對是否正確閱讀頁面上的文字、不去想回家路上要買的東西,或者房間裡現在是否太冷。換句話說,人類大腦在解決問題時——無論是智商測試還是其他問題——需要應對更多的事情,而且比AI得到的幫助少得多。」
AI Now研究所的首席AI科學家Heidy Khlaaf對TechCrunch表示,我們需要更好的方式來測試AI。她說:「在計算歷史中,我們從未將計算能力直接與人類能力相比,因為計算的本質意味著系統早已能完成超出人類能力的任務。直接將系統表現與人類能力比較是一個新近現象,且備受爭議,圍繞著不斷擴展且變動的AI系統評估基準的爭議。」
華納音樂收購AI歸因初創公司Sureel AI
華納音樂集團(WMG)於週三確認,其正在收購Sureel AI,一家專注於人工智慧歸因的初創公司。Sureel的專有技術為音樂曲目生成“AI DNA”,將其分解為各個組成部分,以追蹤人工智慧模型如何利用這些元素。透過此次收購,WMG旨在增強其監控其藝術家和詞曲創作者的作品在人工智慧生成內容中被使用或用於訓練人工智慧模型的能力。“將Sureel整合到WMG中,增強了我們的保護、控制和變現能力,確保創意社羣保留對其智慧財產權、姓名、肖像、形象和聲音的控制權,”WMG執行長Robert Kync
微軟、Azure 與 AI 技術共同對抗加州野火風險
微軟投資於人工智慧驅動的野火偵測技術,其首席副總裁暨首席數據科學家胡安·拉維斯塔·費雷斯(Juan Lavista Ferres)針對減輕環境損害的策略進行了探討。根據美國國家航空暨太空總署(NASA)指出,氣候變遷影響地球上的每個人,其表現為氣溫上升、降雨模式改變以及海平面上升。NASA 指出,有確鑿證據顯示地球正以前所未有的速度變暖,而人類活動是主要驅動因素。隨著全球氣溫上升,野火構成的威脅日
interesting perspective! always thought of AI as a super-fast learner, not something we could measure with something like IQ. sam’s analogy does make it relatable, but i agree—AI probably needs its own new rating system entirely. 🤔
Это точно! IQ — устаревший инструмент для оценки ИИ 🤖 Интеллект многогранен — творчество, эмоции, адаптация куда важнее сухих цифр. Интересно, какие метрики придут на смену?
¿IQ para medir IA? 😅 Qué idea más anticuada. Sam Altman tiene razón en que es una métrica limitada. Los humanos tenemos inteligencias múltiples, ¿por qué reducirlo todo a un número? Me pregunto si no deberíamos desarrollar nuevas formas de evaluar capacidades como creatividad o empatía en sistemas de IA. ¡Eso sí sería revolucionario!
A visão de Sam Altman sobre o crescimento do IQ da IA é intrigante, mas me parece um pouco vaga. É legal pensar que a IA está ficando mais inteligente a cada ano, mas como medimos isso? Ainda assim, é um conceito divertido para refletir tomando um café. ☕ Talvez eles devessem desenvolver uma métrica mais concreta? 🤔
サム・アルトマンのAIのIQ成長に関する見解は興味深いですが、私には少し曖昧に感じます。AIが毎年賢くなると思うのはクールですが、それをどう測るのでしょうか?それでも、コーヒーを飲みながら考える楽しいコンセプトですね。☕もっと具体的な指標を開発すべきかもしれませんね?🤔





首頁






