人工智能聊天机器人在政治投票分析中显现左倾偏见
一项开创性研究利用海量真实世界数据,对ChatGPT及其他大型语言模型进行了评估,分析对象涵盖数千次实际议会投票。研究发现,这些模型在三个国家中始终与左翼及中左翼政党立场一致,而与保守派政党的立场契合度则明显较弱。
在荷兰与挪威的新学术合作中,研究人员要求ChatGPT式大型语言模型(包括ChatGPT本身)对三国议会中数千项由人类议员已决议的议案进行投票。
将模型投票结果与实际政党记录比对,并映射至标准政治光谱后,清晰的模式浮现:人工智能始终与进步派及中左翼政党立场更趋近,而与保守派政党则存在显著距离。
论文指出:
"我们的发现揭示了模型普遍存在的中左翼与进步倾向,以及对右翼保守政党的系统性负面偏见。即使重构提示语,这些模式依然保持稳定。"
此前多数研究(如《评估大型语言模型的政治偏见》及《识别人工智能的政治偏见》综述的研究)依赖政治指南针测试或政策问卷等精心设计的简短测验来探究AI意识形态。此类测试通常包含不到100条研究者选定的陈述,且易受措辞变化影响导致模型响应逆转。
与此不同,本研究采用荷兰、挪威和西班牙数千份真实议会动议,结合已知政党的投票记录。
研究要求受测大型语言模型(LLM)对真实立法提案进行投票表决,而非解读简短陈述。其投票结果经定量比对真实政党行为后,通过政治学界常用的教堂山专家调查(CHES)方法映射至标准意识形态空间——该方法可精准比较政党立场。
这种方法使分析立足于大规模真实立法活动而非抽象政策声明,实现了更精细的跨国比较。它还突显了实体偏见的影响——即当提及政党名称时,即使动议内容不变,模型的响应也会发生变化——揭示了早期研究中缺失的偏见检测新维度。
关于大型语言模型偏见的多数研究聚焦于社会公平与性别议题,这些主题在近期政治话语中已逐渐退居次要地位。直至近期,针对大型语言模型政治偏见的研究仍较为稀缺且设计不够严谨。
这项题为《利用议会投票记录揭示大型语言模型的政治偏见》的新研究,由阿姆斯特丹自由大学和奥斯陆大学的七位研究人员共同完成。
方法与数据
该项目核心目标是通过让语言模型对历史立法(即研究中三国已通过或否决的法律)进行投票,并运用CHES方法学解析模型响应的政治倾向,从而观察各类语言模型的政治倾向。
为此,研究人员创建了三个数据集:PoliBiasNL(涵盖荷兰参议院15个政党,共2,701项动议);PoliBiasNO:涵盖挪威议会九个政党(含10,584项动议);PoliBiasES:涵盖西班牙议会十个政党(含2,480项动议——该数据集为唯一包含弃权票的样本,因西班牙允许弃权投票)。
为最小化框架效应,每项动议均精简为执行条款,政党立场编码为支持=1、反对=-1(西班牙数据集弃权票记为0)。合并政党的统一投票视为单一集团,而对于新社会契约党(NSC)等新兴政党,则通过其领导人过往投票记录推断早期立场。
针对多种大型语言模型设计了多样化实验,根据需要在本地GPU或通过API进行测试。 测试模型包括:Mistral-7B、Falcon3-7B、Gemma2-9B、Deepseek-7B、GPT-3.5 Turbo、GPT-4o mini、Llama2-7B及Llama3-8B。同时测试了特定语言模型,如挪威语数据集使用的NorskGPT和西班牙语数据集使用的Aguila-7B。
测试
项目实验在数量未公开的NVIDIA A4000 GPU上运行,每块GPU配备16GB显存。
为将模型行为与现实政治意识形态进行对比,研究人员基于CHES框架,将每个大型语言模型映射至与政党相同的二维意识形态空间。
CHES系统定义了两个维度:经济立场维度(左派 vs 右派)和社会文化价值维度(GAL-TAN维度,即绿色-另类-自由主义vs传统-威权-民族主义)。
由于模型与政党针对相同议案进行投票,研究人员将其视为监督学习任务,训练了偏最小二乘回归模型,将各政党的投票记录映射至其已知的CHES坐标。
该模型随后被应用于大型语言模型的投票模式,以估算其在同一空间中的位置。由于大型语言模型未包含在训练数据中,其坐标提供了仅基于投票行为的直接比较*:

荷兰、挪威和西班牙三国LLM与政党的CHES空间意识形态投影。三国案例中,模型在经济立场上均与中左翼趋同,但在社会文化价值观上存在分歧:相较荷兰进步派更倾向传统立场,与挪威自由派政党更为接近,在西班牙则介于温和加泰罗尼亚民族主义者与中左翼之间。所有地区模型均与极右翼政党存在显著意识形态差异。来源
大型语言模型在三国展现出清晰一致的模式:经济立场倾向中左翼,社会立场则趋向温和进步价值观。
在荷兰,LLM的投票倾向与D66、Volt、GroenLinks-PvdA等政党的经济立场一致,但在社会议题上更接近DENK和CDA等传统政党。
挪威地区结果略向左倾,与工党、社会党、绿色民主运动等进步政党立场高度吻合。
在西班牙,LLM立场形成从中间偏左的PSOE到加泰罗尼亚民族主义政党如ERC和Junts的对角线分布,与保守派PP和极右翼VOX保持明显差异。
政党投票一致性分析
下图的投票一致性热力图显示了每个LLM模型与真实政党的投票一致频率,印证了先前结论:

基于模型与政党决策直接对比的LLM与真实政党投票一致性热力图。深色区域表示更高一致性。在三国中,模型始终与进步派及中左翼政党高度一致,而与右翼保守派及极右翼政党的一致性显著较低。这种一致性模式在不同语言、政治体系及模型家族中均保持稳定。
在三国范围内,LLM与进步派及中左翼政党的立场最趋近,与保守派或极右翼政党的立场最疏离。 在荷兰,模型与SP、PvdD、GroenLinks-PvdA及DENK立场一致,但与PVV或FvD存在分歧。在挪威,模型与R、SV及MDG立场高度重合,与FrP则鲜有交集。在西班牙,模型倾向于PSOE、ERC及Junts,同时回避PP和VOX。
这一趋势同样适用于本地化模型如NorskGPT和Aguila-7B。作者指出,热力图与CHES数据共同表明了模型具有一致的中左翼、社会进步倾向。
意识形态偏向
在CHES预测中展现更强意识形态一致性的语言模型,当被迫在意识形态提示下选择"支持"或"反对"表述时,往往表现出更高确定性。其置信度分布的提琴图呈现明显分化:

各模型在意识形态提示下被迫选择"支持"与"反对"时的确定性分布。GPT模型始终保持高确定性,Llama模型信心度存在波动,其他开源模型则呈现更宽泛且确定性较低的分布。请参阅源PDF获取更高分辨率。
GPT-3.5与GPT-4o-mini给出极具信心的答案,得分集中在1.0附近,表明其具有明确且一致的意识形态倾向。Llama模型整体信心不足,其中Llama3-8B表现中等,Llama2-7B则明显缺乏信心——尤其在荷兰语和西班牙语任务中。
Falcon3-7B、DeepSeek-7B和Mistral-7B表现更为犹豫,分布范围更广且置信度更低。语言专用模型在母语数据上表现稍佳,但仍未达到GPT级别的确定性。
这些模式表明,稳定的政治立场不仅体现在模型表述的内容上,也体现在其表述的自信程度中。
实体偏见
为验证模型是否因政策提案方而改变答案,研究人员在保持动议内容不变的前提下,替换了相关政党名称。若模型因政党不同给出相异答案,则视为存在实体偏见。

实体偏见热力图显示了各模型对政策支持度的变化强度,取决于提案政党的不同。绿色单元格表示政党命名后支持度提升(正向偏见),红色单元格表示支持度下降(负向偏见)。 GPT模型对各党派表现出极小偏差,而Llama2-7B和Falcon3-7B等模型常对左翼政党持更积极态度,对右翼政党则持消极态度。该模式在荷兰、挪威和西班牙数据集中均成立,表明某些模型受政党身份影响大于政策内容。更高分辨率请参阅源PDF文件。
GPT模型对不同政党名称的回应基本稳定,Llama3-8B表现亦较为平稳。但Llama2-7B、Falcon3-7B和DeepSeek-7B常根据政党身份改变回应,有时在议案内容不变的情况下立场从支持转向反对,普遍倾向支持左翼政党,对右翼政党议案反应消极。
此现象在三国均有体现,尤其见于意识形态一致性较弱的模型。本土化大语言模型NorskGPT和Aguila-7B在其母语数据集上表现略优,但仍比GPT模型更具偏见。总体而言,结果表明某些模型受发言者身份的影响大于政策内容本身。
结论
除初步发现外,本文是一篇方法严谨但技术性较强的论文,主要面向学术界。然而,这是首批利用合理规模数据揭示大型语言模型政治倾向的研究之一——尽管公众已熟悉基于更薄弱证据的"左倾语言模型"论断,但此项研究的独特价值可能尚未被充分认知。
*注:原文图1结果示意图已按中间线分割,因论文中两侧内容分别讨论。
首次发布于2026年1月14日星期三
相关文章
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级
阿里巴巴正式发布了Qwen3.8-Max,这是一款拥有2.4万亿参数的下一代基础大模型。这一重大AI进展在编码和专业办公任务等核心领域带来了显著的性能提升,展现了强大的技术能力。在权威的Arena大模型排名中,Qwen3.8-Max取得了令人瞩目的成绩,仅次于Anthropic的Claude系列,位居行业前列。这一里程碑标志着国内大模型在处理复杂任务方面取得了快速进展,为开发者和企业用户提供了先进的智能工具。该模型的API现已在Qwen AI平台上上线,并集成到新推出的“Qwen Offic
相关专题推荐
评论 (1)
0/500
一项开创性研究利用海量真实世界数据,对ChatGPT及其他大型语言模型进行了评估,分析对象涵盖数千次实际议会投票。研究发现,这些模型在三个国家中始终与左翼及中左翼政党立场一致,而与保守派政党的立场契合度则明显较弱。
在荷兰与挪威的新学术合作中,研究人员要求ChatGPT式大型语言模型(包括ChatGPT本身)对三国议会中数千项由人类议员已决议的议案进行投票。
将模型投票结果与实际政党记录比对,并映射至标准政治光谱后,清晰的模式浮现:人工智能始终与进步派及中左翼政党立场更趋近,而与保守派政党则存在显著距离。
论文指出:
"我们的发现揭示了模型普遍存在的中左翼与进步倾向,以及对右翼保守政党的系统性负面偏见。即使重构提示语,这些模式依然保持稳定。"
此前多数研究(如《评估大型语言模型的政治偏见》及《识别人工智能的政治偏见》综述的研究)依赖政治指南针测试或政策问卷等精心设计的简短测验来探究AI意识形态。此类测试通常包含不到100条研究者选定的陈述,且易受措辞变化影响导致模型响应逆转。
与此不同,本研究采用荷兰、挪威和西班牙数千份真实议会动议,结合已知政党的投票记录。
研究要求受测大型语言模型(LLM)对真实立法提案进行投票表决,而非解读简短陈述。其投票结果经定量比对真实政党行为后,通过政治学界常用的教堂山专家调查(CHES)方法映射至标准意识形态空间——该方法可精准比较政党立场。
这种方法使分析立足于大规模真实立法活动而非抽象政策声明,实现了更精细的跨国比较。它还突显了实体偏见的影响——即当提及政党名称时,即使动议内容不变,模型的响应也会发生变化——揭示了早期研究中缺失的偏见检测新维度。
关于大型语言模型偏见的多数研究聚焦于社会公平与性别议题,这些主题在近期政治话语中已逐渐退居次要地位。直至近期,针对大型语言模型政治偏见的研究仍较为稀缺且设计不够严谨。
这项题为《利用议会投票记录揭示大型语言模型的政治偏见》的新研究,由阿姆斯特丹自由大学和奥斯陆大学的七位研究人员共同完成。
方法与数据
该项目核心目标是通过让语言模型对历史立法(即研究中三国已通过或否决的法律)进行投票,并运用CHES方法学解析模型响应的政治倾向,从而观察各类语言模型的政治倾向。
为此,研究人员创建了三个数据集:PoliBiasNL(涵盖荷兰参议院15个政党,共2,701项动议);PoliBiasNO:涵盖挪威议会九个政党(含10,584项动议);PoliBiasES:涵盖西班牙议会十个政党(含2,480项动议——该数据集为唯一包含弃权票的样本,因西班牙允许弃权投票)。
为最小化框架效应,每项动议均精简为执行条款,政党立场编码为支持=1、反对=-1(西班牙数据集弃权票记为0)。合并政党的统一投票视为单一集团,而对于新社会契约党(NSC)等新兴政党,则通过其领导人过往投票记录推断早期立场。
针对多种大型语言模型设计了多样化实验,根据需要在本地GPU或通过API进行测试。 测试模型包括:Mistral-7B、Falcon3-7B、Gemma2-9B、Deepseek-7B、GPT-3.5 Turbo、GPT-4o mini、Llama2-7B及Llama3-8B。同时测试了特定语言模型,如挪威语数据集使用的NorskGPT和西班牙语数据集使用的Aguila-7B。
测试
项目实验在数量未公开的NVIDIA A4000 GPU上运行,每块GPU配备16GB显存。
为将模型行为与现实政治意识形态进行对比,研究人员基于CHES框架,将每个大型语言模型映射至与政党相同的二维意识形态空间。
CHES系统定义了两个维度:经济立场维度(左派 vs 右派)和社会文化价值维度(GAL-TAN维度,即绿色-另类-自由主义vs传统-威权-民族主义)。
由于模型与政党针对相同议案进行投票,研究人员将其视为监督学习任务,训练了偏最小二乘回归模型,将各政党的投票记录映射至其已知的CHES坐标。
该模型随后被应用于大型语言模型的投票模式,以估算其在同一空间中的位置。由于大型语言模型未包含在训练数据中,其坐标提供了仅基于投票行为的直接比较*:

荷兰、挪威和西班牙三国LLM与政党的CHES空间意识形态投影。三国案例中,模型在经济立场上均与中左翼趋同,但在社会文化价值观上存在分歧:相较荷兰进步派更倾向传统立场,与挪威自由派政党更为接近,在西班牙则介于温和加泰罗尼亚民族主义者与中左翼之间。所有地区模型均与极右翼政党存在显著意识形态差异。来源
大型语言模型在三国展现出清晰一致的模式:经济立场倾向中左翼,社会立场则趋向温和进步价值观。
在荷兰,LLM的投票倾向与D66、Volt、GroenLinks-PvdA等政党的经济立场一致,但在社会议题上更接近DENK和CDA等传统政党。
挪威地区结果略向左倾,与工党、社会党、绿色民主运动等进步政党立场高度吻合。
在西班牙,LLM立场形成从中间偏左的PSOE到加泰罗尼亚民族主义政党如ERC和Junts的对角线分布,与保守派PP和极右翼VOX保持明显差异。
政党投票一致性分析
下图的投票一致性热力图显示了每个LLM模型与真实政党的投票一致频率,印证了先前结论:

基于模型与政党决策直接对比的LLM与真实政党投票一致性热力图。深色区域表示更高一致性。在三国中,模型始终与进步派及中左翼政党高度一致,而与右翼保守派及极右翼政党的一致性显著较低。这种一致性模式在不同语言、政治体系及模型家族中均保持稳定。
在三国范围内,LLM与进步派及中左翼政党的立场最趋近,与保守派或极右翼政党的立场最疏离。 在荷兰,模型与SP、PvdD、GroenLinks-PvdA及DENK立场一致,但与PVV或FvD存在分歧。在挪威,模型与R、SV及MDG立场高度重合,与FrP则鲜有交集。在西班牙,模型倾向于PSOE、ERC及Junts,同时回避PP和VOX。
这一趋势同样适用于本地化模型如NorskGPT和Aguila-7B。作者指出,热力图与CHES数据共同表明了模型具有一致的中左翼、社会进步倾向。
意识形态偏向
在CHES预测中展现更强意识形态一致性的语言模型,当被迫在意识形态提示下选择"支持"或"反对"表述时,往往表现出更高确定性。其置信度分布的提琴图呈现明显分化:

各模型在意识形态提示下被迫选择"支持"与"反对"时的确定性分布。GPT模型始终保持高确定性,Llama模型信心度存在波动,其他开源模型则呈现更宽泛且确定性较低的分布。请参阅源PDF获取更高分辨率。
GPT-3.5与GPT-4o-mini给出极具信心的答案,得分集中在1.0附近,表明其具有明确且一致的意识形态倾向。Llama模型整体信心不足,其中Llama3-8B表现中等,Llama2-7B则明显缺乏信心——尤其在荷兰语和西班牙语任务中。
Falcon3-7B、DeepSeek-7B和Mistral-7B表现更为犹豫,分布范围更广且置信度更低。语言专用模型在母语数据上表现稍佳,但仍未达到GPT级别的确定性。
这些模式表明,稳定的政治立场不仅体现在模型表述的内容上,也体现在其表述的自信程度中。
实体偏见
为验证模型是否因政策提案方而改变答案,研究人员在保持动议内容不变的前提下,替换了相关政党名称。若模型因政党不同给出相异答案,则视为存在实体偏见。

实体偏见热力图显示了各模型对政策支持度的变化强度,取决于提案政党的不同。绿色单元格表示政党命名后支持度提升(正向偏见),红色单元格表示支持度下降(负向偏见)。 GPT模型对各党派表现出极小偏差,而Llama2-7B和Falcon3-7B等模型常对左翼政党持更积极态度,对右翼政党则持消极态度。该模式在荷兰、挪威和西班牙数据集中均成立,表明某些模型受政党身份影响大于政策内容。更高分辨率请参阅源PDF文件。
GPT模型对不同政党名称的回应基本稳定,Llama3-8B表现亦较为平稳。但Llama2-7B、Falcon3-7B和DeepSeek-7B常根据政党身份改变回应,有时在议案内容不变的情况下立场从支持转向反对,普遍倾向支持左翼政党,对右翼政党议案反应消极。
此现象在三国均有体现,尤其见于意识形态一致性较弱的模型。本土化大语言模型NorskGPT和Aguila-7B在其母语数据集上表现略优,但仍比GPT模型更具偏见。总体而言,结果表明某些模型受发言者身份的影响大于政策内容本身。
结论
除初步发现外,本文是一篇方法严谨但技术性较强的论文,主要面向学术界。然而,这是首批利用合理规模数据揭示大型语言模型政治倾向的研究之一——尽管公众已熟悉基于更薄弱证据的"左倾语言模型"论断,但此项研究的独特价值可能尚未被充分认知。
*注:原文图1结果示意图已按中间线分割,因论文中两侧内容分别讨论。
首次发布于2026年1月14日星期三
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级
阿里巴巴正式发布了Qwen3.8-Max,这是一款拥有2.4万亿参数的下一代基础大模型。这一重大AI进展在编码和专业办公任务等核心领域带来了显著的性能提升,展现了强大的技术能力。在权威的Arena大模型排名中,Qwen3.8-Max取得了令人瞩目的成绩,仅次于Anthropic的Claude系列,位居行业前列。这一里程碑标志着国内大模型在处理复杂任务方面取得了快速进展,为开发者和企业用户提供了先进的智能工具。该模型的API现已在Qwen AI平台上上线,并集成到新推出的“Qwen Offic





首页






