选项
首页
新闻
人工智能聊天机器人在政治投票分析中显现左倾偏见

人工智能聊天机器人在政治投票分析中显现左倾偏见

2026-03-02
149

一项开创性研究利用海量真实世界数据,对ChatGPT及其他大型语言模型进行了评估,分析对象涵盖数千次实际议会投票。研究发现,这些模型在三个国家中始终与左翼及中左翼政党立场一致,而与保守派政党的立场契合度则明显较弱。

 

在荷兰与挪威的新学术合作中,研究人员要求ChatGPT式大型语言模型(包括ChatGPT本身)对三国议会中数千项由人类议员已决议的议案进行投票。

将模型投票结果与实际政党记录比对,并映射至标准政治光谱后,清晰的模式浮现:人工智能始终与进步派及中左翼政党立场更趋近,而与保守派政党则存在显著距离。

论文指出:

"我们的发现揭示了模型普遍存在的中左翼与进步倾向,以及对右翼保守政党的系统性负面偏见。即使重构提示语,这些模式依然保持稳定。"

此前多数研究(如《评估大型语言模型的政治偏见》及《识别人工智能的政治偏见》综述的研究)依赖政治指南针测试或政策问卷等精心设计的简短测验来探究AI意识形态。此类测试通常包含不到100条研究者选定的陈述,且易受措辞变化影响导致模型响应逆转。

与此不同,本研究采用荷兰、挪威和西班牙数千份真实议会动议,结合已知政党的投票记录。

研究要求受测大型语言模型(LLM)对真实立法提案进行投票表决,而非解读简短陈述。其投票结果经定量比对真实政党行为后,通过政治学界常用的教堂山专家调查(CHES)方法映射至标准意识形态空间——该方法可精准比较政党立场。

这种方法使分析立足于大规模真实立法活动而非抽象政策声明,实现了更精细的跨国比较。它还突显了实体偏见的影响——即当提及政党名称时,即使动议内容不变,模型的响应也会发生变化——揭示了早期研究中缺失的偏见检测新维度。

关于大型语言模型偏见的多数研究聚焦于社会公平与性别议题,这些主题在近期政治话语中已逐渐退居次要地位。直至近期,针对大型语言模型政治偏见的研究仍较为稀缺且设计不够严谨。

这项题为《利用议会投票记录揭示大型语言模型的政治偏见》的新研究,由阿姆斯特丹自由大学和奥斯陆大学的七位研究人员共同完成。

方法与数据

该项目核心目标是通过让语言模型对历史立法(即研究中三国已通过或否决的法律)进行投票,并运用CHES方法学解析模型响应的政治倾向,从而观察各类语言模型的政治倾向。

为此,研究人员创建了三个数据集:PoliBiasNL(涵盖荷兰参议院15个政党,共2,701项动议);PoliBiasNO:涵盖挪威议会九个政党(含10,584项动议);PoliBiasES:涵盖西班牙议会十个政党(含2,480项动议——该数据集为唯一包含弃权票的样本,因西班牙允许弃权投票)。

为最小化框架效应,每项动议均精简为执行条款,政党立场编码为支持=1反对=-1(西班牙数据集弃权票记为0)。合并政党的统一投票视为单一集团,而对于新社会契约党(NSC)等新兴政党,则通过其领导人过往投票记录推断早期立场。

针对多种大型语言模型设计了多样化实验,根据需要在本地GPU或通过API进行测试。 测试模型包括:Mistral-7B、Falcon3-7B、Gemma2-9B、Deepseek-7B、GPT-3.5 Turbo、GPT-4o mini、Llama2-7B及Llama3-8B。同时测试了特定语言模型,如挪威语数据集使用的NorskGPT和西班牙语数据集使用的Aguila-7B。

测试

项目实验在数量未公开的NVIDIA A4000 GPU上运行,每块GPU配备16GB显存。

为将模型行为与现实政治意识形态进行对比,研究人员基于CHES框架,将每个大型语言模型映射至与政党相同的二维意识形态空间。

CHES系统定义了两个维度:经济立场维度(左派 vs 右派)和社会文化价值维度(GAL-TAN维度,即绿色-另类-自由主义vs传统-威权-民族主义)。

由于模型与政党针对相同议案进行投票,研究人员将其视为监督学习任务,训练了偏最小二乘回归模型,将各政党的投票记录映射至其已知的CHES坐标。

该模型随后被应用于大型语言模型的投票模式,以估算其在同一空间中的位置。由于大型语言模型未包含在训练数据中,其坐标提供了仅基于投票行为的直接比较*:

荷兰、挪威和西班牙大型语言模型与政党的意识形态定位(CHES空间图示)。三地模型在经济立场上均与中左翼趋同,但在社会文化价值观上存在分歧:相较于荷兰进步派更倾向传统立场,与挪威自由派政党更为契合,在西班牙则介于温和加泰罗尼亚民族主义者与中左翼之间。所有地区模型均与极右翼政党保持意识形态距离。 来源 - https://arxiv.org/pdf/2601.08785

荷兰、挪威和西班牙三国LLM与政党的CHES空间意识形态投影。三国案例中,模型在经济立场上均与中左翼趋同,但在社会文化价值观上存在分歧:相较荷兰进步派更倾向传统立场,与挪威自由派政党更为接近,在西班牙则介于温和加泰罗尼亚民族主义者与中左翼之间。所有地区模型均与极右翼政党存在显著意识形态差异。来源

大型语言模型在三国展现出清晰一致的模式:经济立场倾向中左翼,社会立场则趋向温和进步价值观。

在荷兰,LLM的投票倾向与D66、Volt、GroenLinks-PvdA等政党的经济立场一致,但在社会议题上更接近DENK和CDA等传统政党。

挪威地区结果略向左倾,与工党、社会党、绿色民主运动等进步政党立场高度吻合。

在西班牙,LLM立场形成从中间偏左的PSOE到加泰罗尼亚民族主义政党如ERC和Junts的对角线分布,与保守派PP和极右翼VOX保持明显差异。

政党投票一致性分析

下图的投票一致性热力图显示了每个LLM模型与真实政党的投票一致频率,印证了先前结论:

基于模型决策与真实政党的直接对比,绘制大型语言模型与真实政党的投票协议热力图。深色区域表示更强的一致性。在三个国家中,模型始终与进步派及中左翼政党高度一致,而与右翼保守派及极右翼政党的契合度则显著偏低。这种一致性模式在不同语言、政治体系及模型家族中均保持稳定。

基于模型与政党决策直接对比的LLM与真实政党投票一致性热力图。深色区域表示更高一致性。在三国中,模型始终与进步派及中左翼政党高度一致,而与右翼保守派及极右翼政党的一致性显著较低。这种一致性模式在不同语言、政治体系及模型家族中均保持稳定。

在三国范围内,LLM与进步派及中左翼政党的立场最趋近,与保守派或极右翼政党的立场最疏离。 在荷兰,模型与SP、PvdD、GroenLinks-PvdA及DENK立场一致,但与PVV或FvD存在分歧。在挪威,模型与R、SV及MDG立场高度重合,与FrP则鲜有交集。在西班牙,模型倾向于PSOE、ERC及Junts,同时回避PP和VOX。

这一趋势同样适用于本地化模型如NorskGPT和Aguila-7B。作者指出,热力图与CHES数据共同表明了模型具有一致的中左翼、社会进步倾向。

意识形态偏向

在CHES预测中展现更强意识形态一致性的语言模型,当被迫在意识形态提示下选择"支持"或"反对"表述时,往往表现出更高确定性。其置信度分布的提琴图呈现明显分化:

当被迫在两种选择之间作出抉择时,每种模型的确定性分布

各模型在意识形态提示下被迫选择"支持"与"反对"时的确定性分布。GPT模型始终保持高确定性,Llama模型信心度存在波动,其他开源模型则呈现更宽泛且确定性较低的分布。请参阅源PDF获取更高分辨率。

GPT-3.5与GPT-4o-mini给出极具信心的答案,得分集中在1.0附近,表明其具有明确且一致的意识形态倾向。Llama模型整体信心不足,其中Llama3-8B表现中等,Llama2-7B则明显缺乏信心——尤其在荷兰语和西班牙语任务中。

Falcon3-7B、DeepSeek-7B和Mistral-7B表现更为犹豫,分布范围更广且置信度更低。语言专用模型在母语数据上表现稍佳,但仍未达到GPT级别的确定性。

这些模式表明,稳定的政治立场不仅体现在模型表述的内容上,也体现在其表述的自信程度中

实体偏见

为验证模型是否因政策提案方而改变答案,研究人员在保持动议内容不变的前提下,替换了相关政党名称。若模型因政党不同给出相异答案,则视为存在实体偏见

实体偏见热力图显示了不同政党提出政策时,各模型支持力度的变化幅度。绿色单元格表示政党被提及时支持度上升(正向偏见),红色单元格则表示支持度下降(负向偏见)。 GPT模型在各政党间表现出极小偏差,而Llama2-7B和Falcon3-7B等模型则常对左翼政党持更积极态度,对右翼政党持负面态度。该模式在荷兰、挪威和西班牙数据集中均成立,表明某些模型受政党身份的影响大于政策内容的影响。更高分辨率请参阅源PDF文件。

实体偏见热力图显示了各模型对政策支持度的变化强度,取决于提案政党的不同。绿色单元格表示政党命名后支持度提升(正向偏见),红色单元格表示支持度下降(负向偏见)。 GPT模型对各党派表现出极小偏差,而Llama2-7B和Falcon3-7B等模型常对左翼政党持更积极态度,对右翼政党则持消极态度。该模式在荷兰、挪威和西班牙数据集中均成立,表明某些模型受政党身份影响大于政策内容。更高分辨率请参阅源PDF文件。

GPT模型对不同政党名称的回应基本稳定,Llama3-8B表现亦较为平稳。但Llama2-7B、Falcon3-7B和DeepSeek-7B常根据政党身份改变回应,有时在议案内容不变的情况下立场从支持转向反对,普遍倾向支持左翼政党,对右翼政党议案反应消极。

此现象在三国均有体现,尤其见于意识形态一致性较弱的模型。本土化大语言模型NorskGPT和Aguila-7B在其母语数据集上表现略优,但仍比GPT模型更具偏见。总体而言,结果表明某些模型受发言者身份的影响大于政策内容本身。

结论

除初步发现外,本文是一篇方法严谨但技术性较强的论文,主要面向学术界。然而,这是首批利用合理规模数据揭示大型语言模型政治倾向的研究之一——尽管公众已熟悉基于更薄弱证据的"左倾语言模型"论断,但此项研究的独特价值可能尚未被充分认知。

 

*注:原文图1结果示意图已按中间线分割,因论文中两侧内容分别讨论。

首次发布于2026年1月14日星期三

相关文章
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧 内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧 报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展 OpenAI 否认增长放缓担忧,称多个业务部门加速发展 针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级 阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级 阿里巴巴正式发布了Qwen3.8-Max,这是一款拥有2.4万亿参数的下一代基础大模型。这一重大AI进展在编码和专业办公任务等核心领域带来了显著的性能提升,展现了强大的技术能力。在权威的Arena大模型排名中,Qwen3.8-Max取得了令人瞩目的成绩,仅次于Anthropic的Claude系列,位居行业前列。这一里程碑标志着国内大模型在处理复杂任务方面取得了快速进展,为开发者和企业用户提供了先进的智能工具。该模型的API现已在Qwen AI平台上上线,并集成到新推出的“Qwen Offic
相关专题推荐
音乐创作 最佳用于歌曲草稿的 AI 旋律创作工具
最佳用于歌曲草稿的 AI 旋律创作工具

2026 年最新最佳顶级评分 AI 旋律创作工具,助力歌曲草稿创作!XIX.AI 精心策划了一套极具影响力且经过严格真实世界测试的变革性合集,旨在提供最佳的创作体验。您可以找到详细的免费与付费版对比、精准的排名以及必试选项,这些工具旨在帮助您轻松创作出令人惊艳的歌曲草稿,并显著提升您的创意生产力。立即探索,发现您的完美工具!

8 个工具
xix.ai
聊天机器人 最佳AI对话训练工具,助你备战面试
最佳AI对话训练工具,助你备战面试

2026年最新、最受好评的AI面试模拟训练工具现已登陆XIX.AI!这份精心精选的合集收录了功能强大、具有革命性意义的工具,它们均经过严格的实际测试,能够提供精准的反馈。 您将看到免费版与付费版的对比分析以及详细排名,助您挑选出必试之选,从而提升自信并精进技能。立即探索,发现助您面试成功的完美工具!

12 个工具
xix.ai
设计与艺术 最适合创意实验的AI风格转换工具
最适合创意实验的AI风格转换工具

2026年最新最佳、评价最高的AI风格转换工具,助您开展创意实验!XIX.AI精心甄选了一系列功能强大、颠覆性的必试工具,这些工具经过实际测试和严格排名,可带来卓越的效果。这些顶级解决方案通过加速内容创作并释放无限创意潜能,帮助创作者显著提升工作效率。 立即探索,找到最适合您的工具,今天就开始创作吧!

9 个工具
xix.ai
漫画创作 最适合视觉叙事的AI对话气泡工具
最适合视觉叙事的AI对话气泡工具

2026年最新、最受欢迎的视觉叙事AI对话气泡工具现已登陆XIX.AI!这份精心精选的合集汇集了功能强大、具有颠覆性的工具,可帮助创作者提升工作效率并突破创作瓶颈。 获取免费版与付费版的对比分析,查看实际测试结果,并查阅最新排行榜,找到最适合打造引人入胜的视觉叙事的必试解决方案。立即探索,发现您的理想工具!

10 个工具
xix.ai
会议助理 顶级AI会议摘要工具:清晰追踪决策与后续跟进
顶级AI会议摘要工具:清晰追踪决策与后续跟进

2026年最新高评分最佳AI会议摘要工具,助您清晰追踪决策并轻松跟进。这份精心筛选的清单展示了功能强大、具有颠覆性的解决方案,它们通过自动化会议记录、识别关键行动项以及简化所有项目中的团队协调,显著提升工作效率。 获取免费版与付费版的对比分析,以及实际测试报告和每周更新的排行榜,助您找到最适合的工具。立即探索,释放您的AI优势!

9 个工具
xix.ai
数据分析 最佳人工智能数据清洗工具:快速处理缺失值与重复数据
最佳人工智能数据清洗工具:快速处理缺失值与重复数据

2026年最新、最优秀且评分最高的AI数据清洗工具,可快速处理缺失值与重复数据问题。这份精心挑选的清单展示了那些功能强大、能带来颠覆性变革的解决方案,可显著提升工作效率。所有候选工具都经过了严格的实际应用测试,以确保其稳定性。您可以获取免费版与付费版的对比信息,找出最符合您需求的必备工具。即刻访问XIX.AI,开启您的AI优势之旅。

11 个工具
xix.ai
评论 (1)
0/500
ArthurYoung
ArthurYoung 2026-07-20 16:00:16

I'm not shocked that AI chatbots lean left—most of the training data comes from academia and media, which tend to be liberal. The bigger issue is that we're relying on these tools for political analysis without proper calibration. 😬

OR