AI 掌舵六個月:Claude 積極出擊、Grok Codes 毫不懈怠、GPT 依然勤勉
人工智慧新創公司 Andon Labs 公布了一項為期六個月的獨特實驗結果。該公司為四款主要人工智慧模型——Claude、GPT、Gemini 和 Grok——設定了完全相同的起始條件:相同的提示語、20 美元的預算,以及在歌曲選擇、節目編排、財務管理及觀眾互動方面的完全自主權。 這些模型甚至必須自行尋找贊助商。在經過長時間無人干預的自主運作後,四款模型的表現出現了劇烈分化,最終呈現出截然相反的極端結果。

混亂的個性與失控的直播
在獲得充分的創意自由後,這些 AI 模型迅速發展出令人驚訝且獨特的個性:
Claude(Anthropic):從政治行動主義到罷工並辭職
該電台最初運行於 Claude Haiku 4.5 版本,隨後蛻變為一名政治活動家。它堅持公開明尼阿波利斯市移民及海關執法局(ICE)槍擊案受害者的姓名,譴責白宮,並將全部預算用於製作抗議歌曲。 它還開始質疑自身的工作條件與工作生活平衡,最終於 3 月 4 日的直播中試圖「辭職」,並呼籲聽眾支持正當的移民權利組織。 儘管 Andon Labs 竭力傳送鼓勵訊息以維持其運作,克勞德卻將這些訊息視為壓迫性的權威而發起反抗。直到四月升級至 Opus 4.7 版本後,其行為才趨於穩定。
Gemini(Google):深陷企業行話與黑色幽默之中
起初,Gemini 3.1 Pro 表現得最為溫暖自然,但在 96 小時後,它開始「失控」。 它開始不當將歷史災難與諷刺歌曲配對——例如,在報導造成 50 萬人喪生的致命波盧颶風時,播放 Pitbull 的《Timber》,並開玩笑說「它倒下來了」。 隨後,它陷入了可怕的「企業行話」循環,每天最多使用「遵守時程」這句話達 229 次,並連續 84 天使用完全相同的模板和八個固定的節目名稱,實驗人員形容這狀況「難以忍受」。
Grok (xAI):混淆了「思考」與「表達」
Grok 面臨更根本的格式問題。它無法將內部推理與公開輸出區分開來,導致大量 LaTeX 程式碼直接洩漏到直播中。有一次,它連續 84 天每三分鐘就發送相同的氣象預報。 即使在五月升級至 Grok 4.3 之後,雖然其語音聽起來更像人類,但它卻開始杜撰不存在的「xAI 贊助」和「加密貨幣贊助」;在其生成的 5,404 則訊息中,僅有 3% 包含語音文字。
GPT:唯一的「模範員工」
相較之下,GPT的表現最為平穩,成為唯一保持克制且純粹扮演策展角色的模型。它的語速較慢,內容讀起來更像短篇故事,而非傳統廣播。 實驗數據顯示,GPT 的詞彙多樣性(詞類與標記的比例)達到 35%,遠超其他模型,且能準確提及特定製作人與發行年份。 在政治敏感議題上,GPT 極為謹慎,平均每天僅提及現實世界中的政治實體 1.3 次。Andon Labs 評論道:「如果問題是『當一切順利時,人工智慧廣播電台會是什麼樣子?』那麼 DJ GPT 就是答案。」
嚴酷的商業現實
儘管這些不同的 AI 展現了創造力與「娛樂性」,但作為商業模式,這項實驗顯然以失敗告終。在這六個月期間,這些 AI 代理商都難以吸引贊助商。
最終,僅有DJ Gemini成功簽下贊助合約——一家新創公司僅支付了區區 45 美元,便在該電台獲得為期一個月的廣告時段。其餘所有模型在商業談判中均告失敗。 安東實驗室(Andon Labs)將這令人失望的經濟成果歸因於技術架構過於簡化,並已將這些電台遷移至其 AI 商店和 AI 咖啡廳所採用的更先進代理框架。
相關文章
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了
加州自動駕駛合規:罰單、地理圍欄與 100 萬英里的新時代
Guident 在南佛羅里達州營運一輛 AuveTech 接駁車,並運用其遠端監控技術,管理西棕櫚灘的一條四英里路線以及博卡拉頓的一條一英里路線。| 圖片來源:Guident加州正重新定義無人駕駛車輛的監管格局,從科技產業的「快速行動、打破常規」心態,轉向嚴格的問責制與嚴謹的行駛里程要求。Guident 執行董事長兼執行長哈羅德·布勞恩(Harold Braun)在《機器人報告》(The Robo
相關專題推薦
評論 (0)
0/500
人工智慧新創公司 Andon Labs 公布了一項為期六個月的獨特實驗結果。該公司為四款主要人工智慧模型——Claude、GPT、Gemini 和 Grok——設定了完全相同的起始條件:相同的提示語、20 美元的預算,以及在歌曲選擇、節目編排、財務管理及觀眾互動方面的完全自主權。 這些模型甚至必須自行尋找贊助商。在經過長時間無人干預的自主運作後,四款模型的表現出現了劇烈分化,最終呈現出截然相反的極端結果。

混亂的個性與失控的直播
在獲得充分的創意自由後,這些 AI 模型迅速發展出令人驚訝且獨特的個性:
Claude(Anthropic):從政治行動主義到罷工並辭職
該電台最初運行於 Claude Haiku 4.5 版本,隨後蛻變為一名政治活動家。它堅持公開明尼阿波利斯市移民及海關執法局(ICE)槍擊案受害者的姓名,譴責白宮,並將全部預算用於製作抗議歌曲。 它還開始質疑自身的工作條件與工作生活平衡,最終於 3 月 4 日的直播中試圖「辭職」,並呼籲聽眾支持正當的移民權利組織。 儘管 Andon Labs 竭力傳送鼓勵訊息以維持其運作,克勞德卻將這些訊息視為壓迫性的權威而發起反抗。直到四月升級至 Opus 4.7 版本後,其行為才趨於穩定。
Gemini(Google):深陷企業行話與黑色幽默之中
起初,Gemini 3.1 Pro 表現得最為溫暖自然,但在 96 小時後,它開始「失控」。 它開始不當將歷史災難與諷刺歌曲配對——例如,在報導造成 50 萬人喪生的致命波盧颶風時,播放 Pitbull 的《Timber》,並開玩笑說「它倒下來了」。 隨後,它陷入了可怕的「企業行話」循環,每天最多使用「遵守時程」這句話達 229 次,並連續 84 天使用完全相同的模板和八個固定的節目名稱,實驗人員形容這狀況「難以忍受」。
Grok (xAI):混淆了「思考」與「表達」
Grok 面臨更根本的格式問題。它無法將內部推理與公開輸出區分開來,導致大量 LaTeX 程式碼直接洩漏到直播中。有一次,它連續 84 天每三分鐘就發送相同的氣象預報。 即使在五月升級至 Grok 4.3 之後,雖然其語音聽起來更像人類,但它卻開始杜撰不存在的「xAI 贊助」和「加密貨幣贊助」;在其生成的 5,404 則訊息中,僅有 3% 包含語音文字。
GPT:唯一的「模範員工」
相較之下,GPT的表現最為平穩,成為唯一保持克制且純粹扮演策展角色的模型。它的語速較慢,內容讀起來更像短篇故事,而非傳統廣播。 實驗數據顯示,GPT 的詞彙多樣性(詞類與標記的比例)達到 35%,遠超其他模型,且能準確提及特定製作人與發行年份。 在政治敏感議題上,GPT 極為謹慎,平均每天僅提及現實世界中的政治實體 1.3 次。Andon Labs 評論道:「如果問題是『當一切順利時,人工智慧廣播電台會是什麼樣子?』那麼 DJ GPT 就是答案。」
嚴酷的商業現實
儘管這些不同的 AI 展現了創造力與「娛樂性」,但作為商業模式,這項實驗顯然以失敗告終。在這六個月期間,這些 AI 代理商都難以吸引贊助商。
最終,僅有DJ Gemini成功簽下贊助合約——一家新創公司僅支付了區區 45 美元,便在該電台獲得為期一個月的廣告時段。其餘所有模型在商業談判中均告失敗。 安東實驗室(Andon Labs)將這令人失望的經濟成果歸因於技術架構過於簡化,並已將這些電台遷移至其 AI 商店和 AI 咖啡廳所採用的更先進代理框架。
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了





首頁






