Epoch AI 对三款新的文本检测工具进行了评估,结果显示这些工具在处理类人文风文案时存在重大缺陷
Epoch AI的最新研究表明,传统的人工智能文本检测工具能够准确识别大多数标准的人工智能生成内容。然而,当大型语言模型刻意模仿特定作者的写作风格时,这些检测工具的准确率会显著下降,其中科学写作是检测难度最大的类别之一。
研究团队评估了三种广泛使用的AI文本检测工具:Pangram(3.3.2版)、GPTZero(2026-05-11-base)和Originality.ai(Turbo3.0.2)。 他们构建了一个测试数据集,包含495篇由人类原创撰写的文本,涵盖博客、小说和科学文本三大类别——所有文本均创作于2022年11月ChatGPT发布之前,以防止训练数据受到污染。

测试结果显示,对于典型的AI生成的文本,这三款检测工具的假阴性率均低至0.7%。 在识别人类撰写的内容时,Pangram和GPTZero实现了零误报,而Originality.ai则将19篇人类撰写的文本误判为AI生成,导致误报率达到3.8%。
该研究进一步让Claude Opus4.8、GPT-5.5和Gemini3.1Pro学习作者提供的五篇原创作品,并以相同风格生成新内容。 在通过这种方式生成的297篇文本中,约有13%逃过了检测工具的识别,其中Pangram的漏检率为10%,GPTZero为11%,Originality.ai为18%
科学写作被证明是这些检测工具最薄弱的环节。针对AI生成的学术文本,Pangram的漏检率为25%,Originality.ai为29%,GPTZero则为24%。 在某些模型组合中,检测性能甚至更差——Pangram未能检测出48%由Gemini生成的学术文本,而Originality.ai则漏检了39%由GPT-5.5生成的内容。
尽管采用了神经网络、文本可预测性分析和统计模式识别等不同的技术方法,这三款检测工具均表现出类似的局限性。该研究表明,随着大型语言模型在模仿人类写作风格方面日益娴熟,当前的AI文本检测技术在学术内容的真实性至关重要的场合(如教育和研究领域)中,仍然面临着巨大的挑战。
相关文章
OpenAI机器人项目主管凯特琳·卡利诺夫斯基因五角大楼合作项目辞职
OpenAI 机器人业务负责人凯特琳·卡利诺夫斯基(Caitlin Kalinowski)在该公司与国防部达成备受争议的合作伙伴关系后辞职。“这不是一个轻松的决定,”卡利诺夫斯基在社交媒体声明中解释道。“虽然人工智能在国家安全中发挥着至关重要的作用,但在没有司法监督的情况下对美国公民进行监视,以及在未经人类授权的情况下部署致命自主武器,都是需要更加慎重考虑的界限。”卡利诺夫斯基此前因领导 Meta 的增强现实眼镜部门而闻名,她于 2024 年 11 月加入 OpenAI。在辞职信中,她强调她
Spotify 通过与 Merlin 的合作扩展其 AI 混音与翻唱项目
Spotify 在第二季度财报电话会议上重申了推出一项全新 AI 驱动功能的计划,该功能允许粉丝在获得艺人明确授权的情况下,创作音乐翻唱和混音作品。独立版权合作伙伴 Merlin 已加入环球音乐集团(UMG)的此项倡议,从而将访问权限扩展至 Merlin 网络中的超过 30,000 家唱片公司,打造一个专注于艺人授权粉丝创作的平台。与备受争议的生成合成音轨的 AI 音乐工具不同,Spotify 联合首席执行官 Gustav Söderström 向投资者强调,该产品的核心在于“真实艺人,而非
长三角地区崛起为人工智能超级枢纽,汇聚超过100个大模型,包括DeepSeek和Qwen
长三角(嘉兴)Token运营中心已在浙江嘉兴正式启用,为企业客户提供大规模AI部署的综合解决方案。该中心官方网站的同时上线,标志着区域内AI算力与模型调度进入标准化新阶段。该平台具备五大核心能力:统一API网关、集中Token计费、集成账单结算、标准化政策抵扣以及统一安全审计。企业用户可通过平台访问超过100种主流大语言模型,包括DeepSeek和阿里通义千问。系统会根据具体任务需求自动选择最具成本效益的模型,在确保高性能的同时最小化Token消耗。依托强大的算力基础设施,嘉兴已建成四个容量
相关专题推荐
评论 (0)
0/500
Epoch AI的最新研究表明,传统的人工智能文本检测工具能够准确识别大多数标准的人工智能生成内容。然而,当大型语言模型刻意模仿特定作者的写作风格时,这些检测工具的准确率会显著下降,其中科学写作是检测难度最大的类别之一。
研究团队评估了三种广泛使用的AI文本检测工具:Pangram(3.3.2版)、GPTZero(2026-05-11-base)和Originality.ai(Turbo3.0.2)。 他们构建了一个测试数据集,包含495篇由人类原创撰写的文本,涵盖博客、小说和科学文本三大类别——所有文本均创作于2022年11月ChatGPT发布之前,以防止训练数据受到污染。

测试结果显示,对于典型的AI生成的文本,这三款检测工具的假阴性率均低至0.7%。 在识别人类撰写的内容时,Pangram和GPTZero实现了零误报,而Originality.ai则将19篇人类撰写的文本误判为AI生成,导致误报率达到3.8%。
该研究进一步让Claude Opus4.8、GPT-5.5和Gemini3.1Pro学习作者提供的五篇原创作品,并以相同风格生成新内容。 在通过这种方式生成的297篇文本中,约有13%逃过了检测工具的识别,其中Pangram的漏检率为10%,GPTZero为11%,Originality.ai为18%
科学写作被证明是这些检测工具最薄弱的环节。针对AI生成的学术文本,Pangram的漏检率为25%,Originality.ai为29%,GPTZero则为24%。 在某些模型组合中,检测性能甚至更差——Pangram未能检测出48%由Gemini生成的学术文本,而Originality.ai则漏检了39%由GPT-5.5生成的内容。
尽管采用了神经网络、文本可预测性分析和统计模式识别等不同的技术方法,这三款检测工具均表现出类似的局限性。该研究表明,随着大型语言模型在模仿人类写作风格方面日益娴熟,当前的AI文本检测技术在学术内容的真实性至关重要的场合(如教育和研究领域)中,仍然面临着巨大的挑战。
OpenAI机器人项目主管凯特琳·卡利诺夫斯基因五角大楼合作项目辞职
OpenAI 机器人业务负责人凯特琳·卡利诺夫斯基(Caitlin Kalinowski)在该公司与国防部达成备受争议的合作伙伴关系后辞职。“这不是一个轻松的决定,”卡利诺夫斯基在社交媒体声明中解释道。“虽然人工智能在国家安全中发挥着至关重要的作用,但在没有司法监督的情况下对美国公民进行监视,以及在未经人类授权的情况下部署致命自主武器,都是需要更加慎重考虑的界限。”卡利诺夫斯基此前因领导 Meta 的增强现实眼镜部门而闻名,她于 2024 年 11 月加入 OpenAI。在辞职信中,她强调她
Spotify 通过与 Merlin 的合作扩展其 AI 混音与翻唱项目
Spotify 在第二季度财报电话会议上重申了推出一项全新 AI 驱动功能的计划,该功能允许粉丝在获得艺人明确授权的情况下,创作音乐翻唱和混音作品。独立版权合作伙伴 Merlin 已加入环球音乐集团(UMG)的此项倡议,从而将访问权限扩展至 Merlin 网络中的超过 30,000 家唱片公司,打造一个专注于艺人授权粉丝创作的平台。与备受争议的生成合成音轨的 AI 音乐工具不同,Spotify 联合首席执行官 Gustav Söderström 向投资者强调,该产品的核心在于“真实艺人,而非
长三角地区崛起为人工智能超级枢纽,汇聚超过100个大模型,包括DeepSeek和Qwen
长三角(嘉兴)Token运营中心已在浙江嘉兴正式启用,为企业客户提供大规模AI部署的综合解决方案。该中心官方网站的同时上线,标志着区域内AI算力与模型调度进入标准化新阶段。该平台具备五大核心能力:统一API网关、集中Token计费、集成账单结算、标准化政策抵扣以及统一安全审计。企业用户可通过平台访问超过100种主流大语言模型,包括DeepSeek和阿里通义千问。系统会根据具体任务需求自动选择最具成本效益的模型,在确保高性能的同时最小化Token消耗。依托强大的算力基础设施,嘉兴已建成四个容量





首页






