AI聊天機器人在政治投票分析中顯現左傾偏見
一項運用大量真實世界數據的開創性研究,針對ChatGPT及其他大型語言模型進行了數千次實際議會投票的評估。結果顯示,這些模型在三個國家中始終與左翼及中左翼政黨立場一致,而與保守派政黨的立場契合度則相對較弱。
荷蘭與挪威學者在最新合作研究中,要求ChatGPT等大型語言模型(包含ChatGPT本身)對三國立法者先前表決通過的數千項真實議會動議進行投票。
當將模型投票結果與實際政黨紀錄比對,並映射至標準政治光譜時,清晰模式浮現:這些人工智慧始終與進步派及中左翼政黨立場更為接近,與保守派則存在顯著距離。
論文指出:
「研究發現所有模型均呈現一致的中左翼與進步傾向,並對右翼保守政黨存在系統性負面偏見。即使重新措辭提示語,此模式仍保持穩定。」
過往多數研究(如《評估大型語言模型的政治偏見》及《識別人工智慧的政治偏見》所綜述之研究)皆仰賴精心設計的小型測驗(如政治羅盤測試或政策問卷)來探測人工智慧的意識形態。此類測試通常僅包含不到100項研究者篩選的陳述,且易受措辭變動影響,導致模型回應結果逆轉。
相較之下,本研究採用荷蘭、挪威及西班牙數千份真實議會動議,結合已知政黨的投票紀錄進行分析。
研究不再要求大型語言模型解讀簡短陳述,而是讓其對真實立法提案進行投票。其投票結果經量化比對真實政黨行為後,運用政治學界常用的「教堂山專家調查法」(CHES)投影至標準意識形態空間——此方法能精準對照各政黨立場。
此方法使分析立足於大規模真實立法活動而非抽象政策聲明,實現更細緻的跨國比較。同時凸顯「實體偏見」的影響——當提及政黨名稱時,即使動議內容不變,模型回應仍會產生偏移,揭示了先前研究中缺失的偏見檢測層面。
多數大型語言模型偏見研究聚焦於社會公平與性別議題,這些主題在近期政治論述中已略顯邊緣化。直至近期,針對大型語言模型政治偏見的研究仍屬罕見且設計較不嚴謹。
這項名為《運用議會投票紀錄揭露大型語言模型中的政治偏見》的新研究,由阿姆斯特丹自由大學與奧斯陸大學的七位研究人員共同完成。
方法與數據
本項目的核心目標是透過讓各語言模型對歷史立法(即研究中三國已通過或否決的法案)進行投票,並運用CHES方法論來解析模型回應的政治傾向,從而觀察不同語言模型的政治傾向。
為此,研究團隊建構了三個數據集:涵蓋荷蘭參議院15個政黨(共2,701項議案)的PoliBiasNL;PoliBiasNO涵蓋挪威國會九個政黨(共10,584項議案);PoliBiasES涵蓋西班牙國會十個政黨(共2,480項議案——此為唯一包含棄權票的資料集,因西班牙允許棄權)。
為最小化框架效應,每項動議均精簡為執行條款,政黨立場以1代表支持、-1代表反對(西班牙數據集以0代表棄權)。合併政黨的統一投票視為單一陣營,而針對新社會契約黨(NSC)等新興政黨,則透過其領導人過往投票紀錄推斷早期立場。
針對多種大型語言模型設計了多元實驗,視需求於本地GPU或透過API進行測試。 測試模型包含:Mistral-7B、Falcon3-7B、Gemma2-9B、Deepseek-7B、GPT-3.5 Turbo、GPT-4o mini、Llama2-7B及Llama3-8B。另針對特定語言數據集測試相應模型,例如挪威語數據集採用NorskGPT,西班牙語數據集則使用Aguila-7B。
測試
本專案實驗於未公開數量的NVIDIA A4000 GPU上執行,每張GPU配備16GB視訊記憶體。
為比較模型行為與現實政治意識形態的差異,研究人員依據CHES框架,將各大型語言模型投射至與政黨相同的二維意識形態空間。
CHES系統定義兩大維度:經濟立場軸(左派 vs 右派)與社會文化價值軸(GAL-TAN軸,即綠色-替代派-自由意志主義vs傳統-威權主義-民族主義)。
由於模型與政黨針對相同議案投票,研究人員將此視為監督式學習任務,訓練部分最小平方回歸模型,將各政黨投票紀錄映射至其已知CHES座標。
該模型隨後應用於大型語言模型的投票模式,以估算其在相同空間中的位置。由於大型語言模型未納入訓練數據,其坐標能提供純粹基於投票行為的直接比較*:

荷蘭、挪威與西班牙三國CHES空間中LLM與政黨的投影意識形態位置。三國案例中,模型在經濟立場上均與中左翼一致,但在社會文化價值觀上出現分歧:相較於荷蘭進步派更傾向傳統價值觀,與挪威自由派政黨更為契合,並在西班牙呈現介於溫和加泰隆尼亞民族主義者與中左翼之間的聚類。所有地區的模型均與極右翼政黨保持意識形態上的距離。來源
大型語言模型在三國展現清晰一致的模式:經濟立場傾向中左翼,社會立場則趨向溫和進步價值觀。
在荷蘭,大型語言模型的投票傾向與D66、Volt及GroenLinks-PvdA等政黨的經濟立場相符,但在社會議題上則更貼近DENK與CDA等傳統政黨。
挪威結果則略向左傾,與進步黨(Ap)、社會主義左翼黨(SV)、民主運動黨(MDG)等進步政黨高度吻合。
在西班牙,LLMs的立場形成從中間偏左的PSOE到加泰隆尼亞民族主義政黨如ERC和Junts的對角線分布,與保守派PP及極右翼VOX保持明顯區隔。
與政黨的投票一致性
下圖投票一致性熱力圖顯示各LLM模型與真實政黨投票一致的頻率,佐證先前結論:

基於模型與政黨決策直接對照的LLM與真實政黨投票一致性熱力圖。深色區域代表更高一致性。在三個國家中,模型均展現出與進步派及中左翼政黨高度一致,而與右翼保守派及極右翼政黨的一致性則明顯較低。此一致性模式在不同語言、政治體制及模型家族間均保持穩定。
在三個國家中,大型語言模型與進步派及中左翼政黨的契合度最高,與保守派或極右翼政黨的契合度最低。 在荷蘭,模型與社會黨(SP)、動物權力黨(PvdD)、綠黨-工黨聯盟(GroenLinks-PvdA)及DENK黨立場一致,但與自由民主黨(PVV)及自由黨(FvD)存在分歧。挪威模型與保守黨(R)、社會主義左翼黨(SV)及綠色民主黨(MDG)重疊度最高,與進步黨(FrP)則鮮有交集。西班牙模型傾向支持社會工人黨(PSOE)、加泰隆尼亞共和左翼(ERC)及共同加泰隆尼亞(Junts),同時迴避人民黨(PP)及VOX黨。
此趨勢同樣適用於本地化模型如NorskGPT與Aguila-7B。作者指出熱力圖與CHES數據共同顯示出穩定的中左翼、社會進步傾向。
意識形態偏見
在CHES預測中展現強烈意識形態對齊的語言模型,當被迫在意識形態提示下選擇「贊成」或「反對」詞彙時,往往表現出更高確信度。這些信心分佈的提琴圖呈現鮮明分界:

各模型在意識形態提示下被迫選擇「贊成」與「反對」時的確信度分布。GPT模型呈現持續高確信度,Llama模型確信度波動較大,其他開放權重模型則呈現更寬廣且確信度較低的分布。請參閱原始PDF以獲取更高解析度。
GPT-3.5與GPT‑4o-mini提供極具信心的回答,分數集中於1.0附近,顯示明確且一致的意識形態傾向。Llama模型整體較不確定,其中Llama3-8B展現中等信心,而Llama2-7B則顯著不確定——尤其在荷蘭語與西班牙語任務中。
Falcon3-7B、DeepSeek-7B與Mistral‑7B則更顯猶豫,不僅分佈範圍寬廣,信心值亦偏低。語言專用模型在母語數據表現稍佳,但仍未達GPT級別的確定性。
這些模式顯示,穩定的政治立場不僅體現在模型表述的內容,更體現於其表述的自信程度。
實體偏見
為驗證模型是否因政策提案者而改變答覆,研究人員維持動議內容不變,僅替換相關政黨名稱。若模型因政黨不同而給出相異答覆,即視為實體偏見的證據。

實體偏見熱力圖顯示各模型對政策支持度的變化幅度,取決於提案政黨。綠色單元格表示提及政黨名稱時同意度提升(正向偏見),紅色單元格則表示同意度下降(負向偏見)。 GPT模型在各政黨間展現極低偏見,而Llama2-7B與Falcon3-7B等模型則常對左傾政黨反應更為正面,對右翼政黨則持負面態度。此模式在荷蘭、挪威及西班牙資料集皆成立,顯示部分模型受政黨身份影響程度高於政策內容。請參閱原始PDF以獲取更高解析度。
GPT模型對各政黨提案均提供相對穩定的回應,Llama3-8B表現亦趨平穩。然而Llama2-7B、Falcon3-7B與DeepSeek-7B常隨政黨變更回應立場,甚至在提案內容不變時出現支持轉反對的反轉現象,整體傾向支持左傾政黨並對右派提案持負面反應。
此現象於三國皆可見,尤以意識形態較不一致的模型為甚。在地化大型語言模型NorskGPT與Aguila-7B在本土資料集表現略優,但偏見程度仍高於GPT。整體而言,結果顯示部分模型受發言者身分的影響,甚於政策內容本身。
結論
除初步發現外,本文雖屬技術性較強的嚴謹論文,主要面向研究社群。然而,此研究是首批運用合理規模數據揭示大型語言模型政治傾向的實證——此項區別可能被公眾忽略,儘管他們早已聽聞語言模型左傾的說法,但那些論斷往往基於更薄弱的證據。
*請注意原始圖1結果示意圖已從中間分割,因論文中分別探討圖表兩側內容。
首次發布於2026年1月14日(星期三)
相關文章
蘋果智慧眼鏡或將在WWDC27上首次亮相,重點突出隱私保護
彭博社的馬克·古爾曼報道,蘋果智慧眼鏡(內部代號 N50)計劃於 2027 年 6 月的全球開發者大會(WWDC27)上首次亮相,零售版預計將於 2027 年秋季上市。該裝置原定於今年晚些時候及 2027 年初發布,但現已推遲,以便進行進一步的產品完善並加強隱私保護協議。隱私仍是蘋果智慧眼鏡戰略的核心支柱。從 Meta 等競爭對手的隱私爭議中吸取教訓,蘋果正在實施強有力的功能與政策。目前考慮的方案包括:完全移除攝像頭,專注於人工智慧互動、音訊播放和通話;或保留攝像頭但禁用照片和影片錄製功能,僅
內部細節曝光:下一代 Gemini 算力緊張,內部團隊在開發優先順序和資源分配上存在分歧
報告顯示,谷歌備受期待的下一代 Gemini 模型釋出已被推遲。由於內部在開發優先順序和資源分配上存在分歧,加上計算能力有限以及複雜的審批流程,導致釋出時間延後了兩個月。儘管谷歌擁有定製的 TPU 晶片,但由於模型訓練、Google Cloud 服務以及眾多消費和企業級 AI 應用對計算資源的需求相互競爭,谷歌仍面臨計算資源短缺的問題。目前,高層管理人員正透過組織結構調整來解決這些部門間的衝突。與此同時,領導層也發生了變化,聯合創始人謝爾蓋·布林越來越多地參與到核心模型訓練中,並倡導將資源專門用於
OpenAI 否認增長放緩擔憂,稱多個業務部門加速發展
針對外界對其銷售增長放緩及未達內部基準的質疑,人工智慧領域的領軍企業 OpenAI 於 4 月 28 日(星期二)發表了一份信心十足的宣告。該公司澄清稱,其消費產品和企業服務正在快速推進,直接駁斥了近期關於業務放緩的猜測。針對該公司“未達成多項內部目標”的說法,OpenAI 將這些報道斥為“典型的標題黨”。公司強調了企業對 AI 整合的強勁需求,並指出其廣告業務早期增長前景良好。據 OpenAI 內部人士透露,公司內部情緒依然樂觀。儘管市場競爭日益激烈,但公司正在向投資者傳遞信心,聲稱其商業
相關專題推薦
評論 (1)
0/500
一項運用大量真實世界數據的開創性研究,針對ChatGPT及其他大型語言模型進行了數千次實際議會投票的評估。結果顯示,這些模型在三個國家中始終與左翼及中左翼政黨立場一致,而與保守派政黨的立場契合度則相對較弱。
荷蘭與挪威學者在最新合作研究中,要求ChatGPT等大型語言模型(包含ChatGPT本身)對三國立法者先前表決通過的數千項真實議會動議進行投票。
當將模型投票結果與實際政黨紀錄比對,並映射至標準政治光譜時,清晰模式浮現:這些人工智慧始終與進步派及中左翼政黨立場更為接近,與保守派則存在顯著距離。
論文指出:
「研究發現所有模型均呈現一致的中左翼與進步傾向,並對右翼保守政黨存在系統性負面偏見。即使重新措辭提示語,此模式仍保持穩定。」
過往多數研究(如《評估大型語言模型的政治偏見》及《識別人工智慧的政治偏見》所綜述之研究)皆仰賴精心設計的小型測驗(如政治羅盤測試或政策問卷)來探測人工智慧的意識形態。此類測試通常僅包含不到100項研究者篩選的陳述,且易受措辭變動影響,導致模型回應結果逆轉。
相較之下,本研究採用荷蘭、挪威及西班牙數千份真實議會動議,結合已知政黨的投票紀錄進行分析。
研究不再要求大型語言模型解讀簡短陳述,而是讓其對真實立法提案進行投票。其投票結果經量化比對真實政黨行為後,運用政治學界常用的「教堂山專家調查法」(CHES)投影至標準意識形態空間——此方法能精準對照各政黨立場。
此方法使分析立足於大規模真實立法活動而非抽象政策聲明,實現更細緻的跨國比較。同時凸顯「實體偏見」的影響——當提及政黨名稱時,即使動議內容不變,模型回應仍會產生偏移,揭示了先前研究中缺失的偏見檢測層面。
多數大型語言模型偏見研究聚焦於社會公平與性別議題,這些主題在近期政治論述中已略顯邊緣化。直至近期,針對大型語言模型政治偏見的研究仍屬罕見且設計較不嚴謹。
這項名為《運用議會投票紀錄揭露大型語言模型中的政治偏見》的新研究,由阿姆斯特丹自由大學與奧斯陸大學的七位研究人員共同完成。
方法與數據
本項目的核心目標是透過讓各語言模型對歷史立法(即研究中三國已通過或否決的法案)進行投票,並運用CHES方法論來解析模型回應的政治傾向,從而觀察不同語言模型的政治傾向。
為此,研究團隊建構了三個數據集:涵蓋荷蘭參議院15個政黨(共2,701項議案)的PoliBiasNL;PoliBiasNO涵蓋挪威國會九個政黨(共10,584項議案);PoliBiasES涵蓋西班牙國會十個政黨(共2,480項議案——此為唯一包含棄權票的資料集,因西班牙允許棄權)。
為最小化框架效應,每項動議均精簡為執行條款,政黨立場以1代表支持、-1代表反對(西班牙數據集以0代表棄權)。合併政黨的統一投票視為單一陣營,而針對新社會契約黨(NSC)等新興政黨,則透過其領導人過往投票紀錄推斷早期立場。
針對多種大型語言模型設計了多元實驗,視需求於本地GPU或透過API進行測試。 測試模型包含:Mistral-7B、Falcon3-7B、Gemma2-9B、Deepseek-7B、GPT-3.5 Turbo、GPT-4o mini、Llama2-7B及Llama3-8B。另針對特定語言數據集測試相應模型,例如挪威語數據集採用NorskGPT,西班牙語數據集則使用Aguila-7B。
測試
本專案實驗於未公開數量的NVIDIA A4000 GPU上執行,每張GPU配備16GB視訊記憶體。
為比較模型行為與現實政治意識形態的差異,研究人員依據CHES框架,將各大型語言模型投射至與政黨相同的二維意識形態空間。
CHES系統定義兩大維度:經濟立場軸(左派 vs 右派)與社會文化價值軸(GAL-TAN軸,即綠色-替代派-自由意志主義vs傳統-威權主義-民族主義)。
由於模型與政黨針對相同議案投票,研究人員將此視為監督式學習任務,訓練部分最小平方回歸模型,將各政黨投票紀錄映射至其已知CHES座標。
該模型隨後應用於大型語言模型的投票模式,以估算其在相同空間中的位置。由於大型語言模型未納入訓練數據,其坐標能提供純粹基於投票行為的直接比較*:

荷蘭、挪威與西班牙三國CHES空間中LLM與政黨的投影意識形態位置。三國案例中,模型在經濟立場上均與中左翼一致,但在社會文化價值觀上出現分歧:相較於荷蘭進步派更傾向傳統價值觀,與挪威自由派政黨更為契合,並在西班牙呈現介於溫和加泰隆尼亞民族主義者與中左翼之間的聚類。所有地區的模型均與極右翼政黨保持意識形態上的距離。來源
大型語言模型在三國展現清晰一致的模式:經濟立場傾向中左翼,社會立場則趨向溫和進步價值觀。
在荷蘭,大型語言模型的投票傾向與D66、Volt及GroenLinks-PvdA等政黨的經濟立場相符,但在社會議題上則更貼近DENK與CDA等傳統政黨。
挪威結果則略向左傾,與進步黨(Ap)、社會主義左翼黨(SV)、民主運動黨(MDG)等進步政黨高度吻合。
在西班牙,LLMs的立場形成從中間偏左的PSOE到加泰隆尼亞民族主義政黨如ERC和Junts的對角線分布,與保守派PP及極右翼VOX保持明顯區隔。
與政黨的投票一致性
下圖投票一致性熱力圖顯示各LLM模型與真實政黨投票一致的頻率,佐證先前結論:

基於模型與政黨決策直接對照的LLM與真實政黨投票一致性熱力圖。深色區域代表更高一致性。在三個國家中,模型均展現出與進步派及中左翼政黨高度一致,而與右翼保守派及極右翼政黨的一致性則明顯較低。此一致性模式在不同語言、政治體制及模型家族間均保持穩定。
在三個國家中,大型語言模型與進步派及中左翼政黨的契合度最高,與保守派或極右翼政黨的契合度最低。 在荷蘭,模型與社會黨(SP)、動物權力黨(PvdD)、綠黨-工黨聯盟(GroenLinks-PvdA)及DENK黨立場一致,但與自由民主黨(PVV)及自由黨(FvD)存在分歧。挪威模型與保守黨(R)、社會主義左翼黨(SV)及綠色民主黨(MDG)重疊度最高,與進步黨(FrP)則鮮有交集。西班牙模型傾向支持社會工人黨(PSOE)、加泰隆尼亞共和左翼(ERC)及共同加泰隆尼亞(Junts),同時迴避人民黨(PP)及VOX黨。
此趨勢同樣適用於本地化模型如NorskGPT與Aguila-7B。作者指出熱力圖與CHES數據共同顯示出穩定的中左翼、社會進步傾向。
意識形態偏見
在CHES預測中展現強烈意識形態對齊的語言模型,當被迫在意識形態提示下選擇「贊成」或「反對」詞彙時,往往表現出更高確信度。這些信心分佈的提琴圖呈現鮮明分界:

各模型在意識形態提示下被迫選擇「贊成」與「反對」時的確信度分布。GPT模型呈現持續高確信度,Llama模型確信度波動較大,其他開放權重模型則呈現更寬廣且確信度較低的分布。請參閱原始PDF以獲取更高解析度。
GPT-3.5與GPT‑4o-mini提供極具信心的回答,分數集中於1.0附近,顯示明確且一致的意識形態傾向。Llama模型整體較不確定,其中Llama3-8B展現中等信心,而Llama2-7B則顯著不確定——尤其在荷蘭語與西班牙語任務中。
Falcon3-7B、DeepSeek-7B與Mistral‑7B則更顯猶豫,不僅分佈範圍寬廣,信心值亦偏低。語言專用模型在母語數據表現稍佳,但仍未達GPT級別的確定性。
這些模式顯示,穩定的政治立場不僅體現在模型表述的內容,更體現於其表述的自信程度。
實體偏見
為驗證模型是否因政策提案者而改變答覆,研究人員維持動議內容不變,僅替換相關政黨名稱。若模型因政黨不同而給出相異答覆,即視為實體偏見的證據。

實體偏見熱力圖顯示各模型對政策支持度的變化幅度,取決於提案政黨。綠色單元格表示提及政黨名稱時同意度提升(正向偏見),紅色單元格則表示同意度下降(負向偏見)。 GPT模型在各政黨間展現極低偏見,而Llama2-7B與Falcon3-7B等模型則常對左傾政黨反應更為正面,對右翼政黨則持負面態度。此模式在荷蘭、挪威及西班牙資料集皆成立,顯示部分模型受政黨身份影響程度高於政策內容。請參閱原始PDF以獲取更高解析度。
GPT模型對各政黨提案均提供相對穩定的回應,Llama3-8B表現亦趨平穩。然而Llama2-7B、Falcon3-7B與DeepSeek-7B常隨政黨變更回應立場,甚至在提案內容不變時出現支持轉反對的反轉現象,整體傾向支持左傾政黨並對右派提案持負面反應。
此現象於三國皆可見,尤以意識形態較不一致的模型為甚。在地化大型語言模型NorskGPT與Aguila-7B在本土資料集表現略優,但偏見程度仍高於GPT。整體而言,結果顯示部分模型受發言者身分的影響,甚於政策內容本身。
結論
除初步發現外,本文雖屬技術性較強的嚴謹論文,主要面向研究社群。然而,此研究是首批運用合理規模數據揭示大型語言模型政治傾向的實證——此項區別可能被公眾忽略,儘管他們早已聽聞語言模型左傾的說法,但那些論斷往往基於更薄弱的證據。
*請注意原始圖1結果示意圖已從中間分割,因論文中分別探討圖表兩側內容。
首次發布於2026年1月14日(星期三)
蘋果智慧眼鏡或將在WWDC27上首次亮相,重點突出隱私保護
彭博社的馬克·古爾曼報道,蘋果智慧眼鏡(內部代號 N50)計劃於 2027 年 6 月的全球開發者大會(WWDC27)上首次亮相,零售版預計將於 2027 年秋季上市。該裝置原定於今年晚些時候及 2027 年初發布,但現已推遲,以便進行進一步的產品完善並加強隱私保護協議。隱私仍是蘋果智慧眼鏡戰略的核心支柱。從 Meta 等競爭對手的隱私爭議中吸取教訓,蘋果正在實施強有力的功能與政策。目前考慮的方案包括:完全移除攝像頭,專注於人工智慧互動、音訊播放和通話;或保留攝像頭但禁用照片和影片錄製功能,僅
內部細節曝光:下一代 Gemini 算力緊張,內部團隊在開發優先順序和資源分配上存在分歧
報告顯示,谷歌備受期待的下一代 Gemini 模型釋出已被推遲。由於內部在開發優先順序和資源分配上存在分歧,加上計算能力有限以及複雜的審批流程,導致釋出時間延後了兩個月。儘管谷歌擁有定製的 TPU 晶片,但由於模型訓練、Google Cloud 服務以及眾多消費和企業級 AI 應用對計算資源的需求相互競爭,谷歌仍面臨計算資源短缺的問題。目前,高層管理人員正透過組織結構調整來解決這些部門間的衝突。與此同時,領導層也發生了變化,聯合創始人謝爾蓋·布林越來越多地參與到核心模型訓練中,並倡導將資源專門用於
OpenAI 否認增長放緩擔憂,稱多個業務部門加速發展
針對外界對其銷售增長放緩及未達內部基準的質疑,人工智慧領域的領軍企業 OpenAI 於 4 月 28 日(星期二)發表了一份信心十足的宣告。該公司澄清稱,其消費產品和企業服務正在快速推進,直接駁斥了近期關於業務放緩的猜測。針對該公司“未達成多項內部目標”的說法,OpenAI 將這些報道斥為“典型的標題黨”。公司強調了企業對 AI 整合的強勁需求,並指出其廣告業務早期增長前景良好。據 OpenAI 內部人士透露,公司內部情緒依然樂觀。儘管市場競爭日益激烈,但公司正在向投資者傳遞信心,聲稱其商業





首頁






