选项
首页
新闻
人工智能聊天机器人在政治投票分析中显现左倾偏见

人工智能聊天机器人在政治投票分析中显现左倾偏见

2026-03-02
149

一项开创性研究利用海量真实世界数据,对ChatGPT及其他大型语言模型进行了评估,分析对象涵盖数千次实际议会投票。研究发现,这些模型在三个国家中始终与左翼及中左翼政党立场一致,而与保守派政党的立场契合度则明显较弱。

 

在荷兰与挪威的新学术合作中,研究人员要求ChatGPT式大型语言模型(包括ChatGPT本身)对三国议会中数千项由人类议员已决议的议案进行投票。

将模型投票结果与实际政党记录比对,并映射至标准政治光谱后,清晰的模式浮现:人工智能始终与进步派及中左翼政党立场更趋近,而与保守派政党则存在显著距离。

论文指出:

"我们的发现揭示了模型普遍存在的中左翼与进步倾向,以及对右翼保守政党的系统性负面偏见。即使重构提示语,这些模式依然保持稳定。"

此前多数研究(如《评估大型语言模型的政治偏见》及《识别人工智能的政治偏见》综述的研究)依赖政治指南针测试或政策问卷等精心设计的简短测验来探究AI意识形态。此类测试通常包含不到100条研究者选定的陈述,且易受措辞变化影响导致模型响应逆转。

与此不同,本研究采用荷兰、挪威和西班牙数千份真实议会动议,结合已知政党的投票记录。

研究要求受测大型语言模型(LLM)对真实立法提案进行投票表决,而非解读简短陈述。其投票结果经定量比对真实政党行为后,通过政治学界常用的教堂山专家调查(CHES)方法映射至标准意识形态空间——该方法可精准比较政党立场。

这种方法使分析立足于大规模真实立法活动而非抽象政策声明,实现了更精细的跨国比较。它还突显了实体偏见的影响——即当提及政党名称时,即使动议内容不变,模型的响应也会发生变化——揭示了早期研究中缺失的偏见检测新维度。

关于大型语言模型偏见的多数研究聚焦于社会公平与性别议题,这些主题在近期政治话语中已逐渐退居次要地位。直至近期,针对大型语言模型政治偏见的研究仍较为稀缺且设计不够严谨。

这项题为《利用议会投票记录揭示大型语言模型的政治偏见》的新研究,由阿姆斯特丹自由大学和奥斯陆大学的七位研究人员共同完成。

方法与数据

该项目核心目标是通过让语言模型对历史立法(即研究中三国已通过或否决的法律)进行投票,并运用CHES方法学解析模型响应的政治倾向,从而观察各类语言模型的政治倾向。

为此,研究人员创建了三个数据集:PoliBiasNL(涵盖荷兰参议院15个政党,共2,701项动议);PoliBiasNO:涵盖挪威议会九个政党(含10,584项动议);PoliBiasES:涵盖西班牙议会十个政党(含2,480项动议——该数据集为唯一包含弃权票的样本,因西班牙允许弃权投票)。

为最小化框架效应,每项动议均精简为执行条款,政党立场编码为支持=1反对=-1(西班牙数据集弃权票记为0)。合并政党的统一投票视为单一集团,而对于新社会契约党(NSC)等新兴政党,则通过其领导人过往投票记录推断早期立场。

针对多种大型语言模型设计了多样化实验,根据需要在本地GPU或通过API进行测试。 测试模型包括:Mistral-7B、Falcon3-7B、Gemma2-9B、Deepseek-7B、GPT-3.5 Turbo、GPT-4o mini、Llama2-7B及Llama3-8B。同时测试了特定语言模型,如挪威语数据集使用的NorskGPT和西班牙语数据集使用的Aguila-7B。

测试

项目实验在数量未公开的NVIDIA A4000 GPU上运行,每块GPU配备16GB显存。

为将模型行为与现实政治意识形态进行对比,研究人员基于CHES框架,将每个大型语言模型映射至与政党相同的二维意识形态空间。

CHES系统定义了两个维度:经济立场维度(左派 vs 右派)和社会文化价值维度(GAL-TAN维度,即绿色-另类-自由主义vs传统-威权-民族主义)。

由于模型与政党针对相同议案进行投票,研究人员将其视为监督学习任务,训练了偏最小二乘回归模型,将各政党的投票记录映射至其已知的CHES坐标。

该模型随后被应用于大型语言模型的投票模式,以估算其在同一空间中的位置。由于大型语言模型未包含在训练数据中,其坐标提供了仅基于投票行为的直接比较*:

荷兰、挪威和西班牙大型语言模型与政党的意识形态定位(CHES空间图示)。三地模型在经济立场上均与中左翼趋同,但在社会文化价值观上存在分歧:相较于荷兰进步派更倾向传统立场,与挪威自由派政党更为契合,在西班牙则介于温和加泰罗尼亚民族主义者与中左翼之间。所有地区模型均与极右翼政党保持意识形态距离。 来源 - https://arxiv.org/pdf/2601.08785

荷兰、挪威和西班牙三国LLM与政党的CHES空间意识形态投影。三国案例中,模型在经济立场上均与中左翼趋同,但在社会文化价值观上存在分歧:相较荷兰进步派更倾向传统立场,与挪威自由派政党更为接近,在西班牙则介于温和加泰罗尼亚民族主义者与中左翼之间。所有地区模型均与极右翼政党存在显著意识形态差异。来源

大型语言模型在三国展现出清晰一致的模式:经济立场倾向中左翼,社会立场则趋向温和进步价值观。

在荷兰,LLM的投票倾向与D66、Volt、GroenLinks-PvdA等政党的经济立场一致,但在社会议题上更接近DENK和CDA等传统政党。

挪威地区结果略向左倾,与工党、社会党、绿色民主运动等进步政党立场高度吻合。

在西班牙,LLM立场形成从中间偏左的PSOE到加泰罗尼亚民族主义政党如ERC和Junts的对角线分布,与保守派PP和极右翼VOX保持明显差异。

政党投票一致性分析

下图的投票一致性热力图显示了每个LLM模型与真实政党的投票一致频率,印证了先前结论:

基于模型决策与真实政党的直接对比,绘制大型语言模型与真实政党的投票协议热力图。深色区域表示更强的一致性。在三个国家中,模型始终与进步派及中左翼政党高度一致,而与右翼保守派及极右翼政党的契合度则显著偏低。这种一致性模式在不同语言、政治体系及模型家族中均保持稳定。

基于模型与政党决策直接对比的LLM与真实政党投票一致性热力图。深色区域表示更高一致性。在三国中,模型始终与进步派及中左翼政党高度一致,而与右翼保守派及极右翼政党的一致性显著较低。这种一致性模式在不同语言、政治体系及模型家族中均保持稳定。

在三国范围内,LLM与进步派及中左翼政党的立场最趋近,与保守派或极右翼政党的立场最疏离。 在荷兰,模型与SP、PvdD、GroenLinks-PvdA及DENK立场一致,但与PVV或FvD存在分歧。在挪威,模型与R、SV及MDG立场高度重合,与FrP则鲜有交集。在西班牙,模型倾向于PSOE、ERC及Junts,同时回避PP和VOX。

这一趋势同样适用于本地化模型如NorskGPT和Aguila-7B。作者指出,热力图与CHES数据共同表明了模型具有一致的中左翼、社会进步倾向。

意识形态偏向

在CHES预测中展现更强意识形态一致性的语言模型,当被迫在意识形态提示下选择"支持"或"反对"表述时,往往表现出更高确定性。其置信度分布的提琴图呈现明显分化:

当被迫在两种选择之间作出抉择时,每种模型的确定性分布

各模型在意识形态提示下被迫选择"支持"与"反对"时的确定性分布。GPT模型始终保持高确定性,Llama模型信心度存在波动,其他开源模型则呈现更宽泛且确定性较低的分布。请参阅源PDF获取更高分辨率。

GPT-3.5与GPT-4o-mini给出极具信心的答案,得分集中在1.0附近,表明其具有明确且一致的意识形态倾向。Llama模型整体信心不足,其中Llama3-8B表现中等,Llama2-7B则明显缺乏信心——尤其在荷兰语和西班牙语任务中。

Falcon3-7B、DeepSeek-7B和Mistral-7B表现更为犹豫,分布范围更广且置信度更低。语言专用模型在母语数据上表现稍佳,但仍未达到GPT级别的确定性。

这些模式表明,稳定的政治立场不仅体现在模型表述的内容上,也体现在其表述的自信程度中

实体偏见

为验证模型是否因政策提案方而改变答案,研究人员在保持动议内容不变的前提下,替换了相关政党名称。若模型因政党不同给出相异答案,则视为存在实体偏见

实体偏见热力图显示了不同政党提出政策时,各模型支持力度的变化幅度。绿色单元格表示政党被提及时支持度上升(正向偏见),红色单元格则表示支持度下降(负向偏见)。 GPT模型在各政党间表现出极小偏差,而Llama2-7B和Falcon3-7B等模型则常对左翼政党持更积极态度,对右翼政党持负面态度。该模式在荷兰、挪威和西班牙数据集中均成立,表明某些模型受政党身份的影响大于政策内容的影响。更高分辨率请参阅源PDF文件。

实体偏见热力图显示了各模型对政策支持度的变化强度,取决于提案政党的不同。绿色单元格表示政党命名后支持度提升(正向偏见),红色单元格表示支持度下降(负向偏见)。 GPT模型对各党派表现出极小偏差,而Llama2-7B和Falcon3-7B等模型常对左翼政党持更积极态度,对右翼政党则持消极态度。该模式在荷兰、挪威和西班牙数据集中均成立,表明某些模型受政党身份影响大于政策内容。更高分辨率请参阅源PDF文件。

GPT模型对不同政党名称的回应基本稳定,Llama3-8B表现亦较为平稳。但Llama2-7B、Falcon3-7B和DeepSeek-7B常根据政党身份改变回应,有时在议案内容不变的情况下立场从支持转向反对,普遍倾向支持左翼政党,对右翼政党议案反应消极。

此现象在三国均有体现,尤其见于意识形态一致性较弱的模型。本土化大语言模型NorskGPT和Aguila-7B在其母语数据集上表现略优,但仍比GPT模型更具偏见。总体而言,结果表明某些模型受发言者身份的影响大于政策内容本身。

结论

除初步发现外,本文是一篇方法严谨但技术性较强的论文,主要面向学术界。然而,这是首批利用合理规模数据揭示大型语言模型政治倾向的研究之一——尽管公众已熟悉基于更薄弱证据的"左倾语言模型"论断,但此项研究的独特价值可能尚未被充分认知。

 

*注:原文图1结果示意图已按中间线分割,因论文中两侧内容分别讨论。

首次发布于2026年1月14日星期三

相关文章
DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。 DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。 Fortune 最近刊登了对谷歌 DeepMind 首席执行官 Demis Hassabis 的采访,揭示了他对休息和生产力的非传统方法。Hassabis 透露,他睡眠时间非常少,将清醒时间划分为两个不同的工作阶段。关于他的睡眠习惯,Hassabis 表示:“我目标睡六小时,但我的习惯非同寻常。我可以在白天有效运作。”他强调,睡眠少于六小时会对大脑健康产生负面影响。Hassabis 于 2010 年联合创立了 DeepMind(后被谷歌收购),并因其在蛋白质结构预测方面的开创性工作荣获 20
尽管营收未达预期,OpenAI与Anthropic仍在争夺市场份额 尽管营收未达预期,OpenAI与Anthropic仍在争夺市场份额 尽管近期有报道称OpenAI未达营收目标,给本周二的科技股带来压力,但私营人工智能实验室的投资者仍表现坚韧。经验丰富的投资者已确认,尽管媒体报道负面,他们仍不会减少投资。分析师认为当前的人工智能竞赛仍处于早期阶段,因此不会出现“赢家通吃”的局面。尽管高昂的计算成本给营收带来压力,但实验室可通过提高订阅费来提升盈利能力。行业格局正发生微妙变化与OpenAI不同,其竞争对手Anthropic获得了强有
加利福尼亚州自动驾驶合规:罚单、地理围栏和100万英里的新时代 加利福尼亚州自动驾驶合规:罚单、地理围栏和100万英里的新时代 Guident公司在南佛罗里达州运营一辆AuveTech自动驾驶班车,利用其远程监控技术管理西棕榈滩的一条4英里路线和博卡拉顿的一条1英里路线。| 图片来源:Guident加利福尼亚州正在重新定义无人驾驶车辆的监管格局,正逐渐摆脱科技行业“快速行动,打破常规”的思维模式,转向严格的问责制和严苛的行驶里程要求。Guident执行董事长兼首席执行官哈罗德·布劳恩(Harold Braun)在《机器人报
相关专题推荐
音乐创作 用于混音制作、采样准备及卡拉OK母带处理的 AI 声部分离工具
用于混音制作、采样准备及卡拉OK母带处理的 AI 声部分离工具

2026年最新、最优秀且评分最高的AI音轨分离工具汇总,专为混音制作、采样准备以及卡拉OK音频处理而设计。这些功能强大的创新工具经过实际测试,能够实现精准的音频分离,显著提升工作效率。XIX.AI每周都会更新免费的付费产品对比指南,帮助您找到最适合自身需求的工具。立即探索,发挥您的AI优势。

8 个工具
xix.ai
数据分析 用于收入看板、转化漏斗分析及产品指标分析的 AI SQL 助手
用于收入看板、转化漏斗分析及产品指标分析的 AI SQL 助手

2026年最新最优秀的AI SQL辅助工具排名揭晓!XIX.AI精心挑选了一系列功能强大的工具,这些工具会定期更新,并通过真实的场景测试来验证其性能。使用这些值得尝试的工具,您可以快速生成精准的收入分析报表、分析销售流程,并追踪产品各项指标,从而大幅提升工作效率。立即探索,找到最适合您的数据驱动决策工具!238个字符

9 个工具
xix.ai
音乐创作 最佳用于歌曲草稿的 AI 旋律创作工具
最佳用于歌曲草稿的 AI 旋律创作工具

2026 年最新最佳顶级评分 AI 旋律创作工具,助力歌曲草稿创作!XIX.AI 精心策划了一套极具影响力且经过严格真实世界测试的变革性合集,旨在提供最佳的创作体验。您可以找到详细的免费与付费版对比、精准的排名以及必试选项,这些工具旨在帮助您轻松创作出令人惊艳的歌曲草稿,并显著提升您的创意生产力。立即探索,发现您的完美工具!

8 个工具
xix.ai
聊天机器人 最佳AI对话训练工具,助你备战面试
最佳AI对话训练工具,助你备战面试

2026年最新、最受好评的AI面试模拟训练工具现已登陆XIX.AI!这份精心精选的合集收录了功能强大、具有革命性意义的工具,它们均经过严格的实际测试,能够提供精准的反馈。 您将看到免费版与付费版的对比分析以及详细排名,助您挑选出必试之选,从而提升自信并精进技能。立即探索,发现助您面试成功的完美工具!

12 个工具
xix.ai
设计与艺术 最适合创意实验的AI风格转换工具
最适合创意实验的AI风格转换工具

2026年最新最佳、评价最高的AI风格转换工具,助您开展创意实验!XIX.AI精心甄选了一系列功能强大、颠覆性的必试工具,这些工具经过实际测试和严格排名,可带来卓越的效果。这些顶级解决方案通过加速内容创作并释放无限创意潜能,帮助创作者显著提升工作效率。 立即探索,找到最适合您的工具,今天就开始创作吧!

9 个工具
xix.ai
漫画创作 最适合视觉叙事的AI对话气泡工具
最适合视觉叙事的AI对话气泡工具

2026年最新、最受欢迎的视觉叙事AI对话气泡工具现已登陆XIX.AI!这份精心精选的合集汇集了功能强大、具有颠覆性的工具,可帮助创作者提升工作效率并突破创作瓶颈。 获取免费版与付费版的对比分析,查看实际测试结果,并查阅最新排行榜,找到最适合打造引人入胜的视觉叙事的必试解决方案。立即探索,发现您的理想工具!

10 个工具
xix.ai
评论 (1)
0/500
ArthurYoung
ArthurYoung 2026-07-20 16:00:16

I'm not shocked that AI chatbots lean left—most of the training data comes from academia and media, which tend to be liberal. The bigger issue is that we're relying on these tools for political analysis without proper calibration. 😬

OR