独立测试显示主流AI文本检测器(包括Turnitin)在人类写作、机器生成、翻译、改写等混合文本上最高准确率不足80%,存在严重误报和漏报,尤其是翻译和改写文本。
当编辑收到一篇标注着"87% AI"的文本并决定不付款时,他试图用一个数字——也就是那个没有任何独立实验室能够在可接受的可靠性水平上复现的数字——来判定文本是否为 AI 生成。这是迄今为止最严格的独立测试的结果,正是基于这些测试,本文给出了相关评估;该测试日期为 2023 年,且在公开来源中未找到对当前版本检测器进行独立重复测试的情况。
由 Deborah Weber-Wulff 领导的研究团队对 14 款检测器进行了测试——其中包括 Turnitin 和 PlagiarismCheck——测试内容涵盖了人工撰写的论文、纯 AI 生成的内容、机器翻译和改写版本。结果:没有一款工具准确率超过 80%,仅有五款达到 70% 以上。六款检测器在人工文本上产生误报,十三款漏报了真实 AI 生成的内容。对于翻译和改写文本的检测效果最差——这恰恰是客户最常遇到的情况,因为他们在与使用外语资料或通过多轮迭代编辑草稿的自由撰稿人合作时,正面临这种局面(Weber-Wulff et al., arXiv)。
这并非孤立的缺陷。OpenAI 在推出自家文本分类器仅半年后就关闭了它:该工具仅在 26% 的情况下正确识别 AI 文本,而有 9% 的概率将人工文本误判为机器生成——这种现象在低于 1000 字符的短文本片段中尤为突出(TechCrunch)。Turnitin 作为学术检测领域更具权威性的参与者,也公开承认:其宣称的 1% 误报率在实际中约为 4%,且这些错误中超过半数与真实 AI 内容片段相邻——也就是说,系统混淆的是边界,而不仅仅是偶发性失误(Inside Higher Ed)。

斯坦福大学 James Zou 团队对七款流行检测器进行了测试,对象分别为以英语为母语的八年级学生作文和托福作文(由非母语者撰写)。对第一组,检测器几乎可以做到无误判;对第二组,超过一半的作业被误标为 AI 文本,其中一款工具的误报率甚至接近 98%。Zou 做出了严厉的结论:"We should be extremely careful about and maybe try to avoid using these detectors"——"我们应该极度谨慎,甚至可能应该尽量避免使用这些检测器"(ScienceDaily)。
这直接关系到俄语文本的商业验收:检测器惩罚的并非实际使用模型的行为,而是偏离统计训练语料库常规的风格——过于规范的语法、不寻常的句子结构、翻译痕迹。bQ Group 创始人 Dmitry Beskromny 描述的正是这种机制:他将过度正确的表述、完美的结构和缺乏真实作者声音列为可疑特征,但直言不讳地表示,优质的混合文本——人加 AI 编辑——实际上是无法区分的(Setters Media)。换言之,检测器同样容易捕获精心编辑过的神经网络输出和仅仅是文风不标准的作者写出的好文本——它无法区分两者。
这种混淆的代价不难用一个实例来呈现:一位 Habr 集体博客的作者仅仅因为文本格式——加粗和单行注释——就被指控使用了神经网络。社区对他关于格式是手动设置的论点完全无视。在帖子评论区,这损害了他的声誉;而在商业合同中,损失的就是报酬。
公平地说:检测器的开发商并未声称自己要扮演裁判角色。俄罗斯服务 eTXT 声称对俄语的识别准确率为 85–98%,价格为每千字符 1.30 卢布(最小订单 20000 字符),但明确表示这只是概率评估,不能替代人工核查(eTXT)。vc.ru 上的市场概述提到了 GPTZero、Originality.AI 和其他参与者的类似立场,并给出了一个粗略估计:对于俄语文本,最佳工具的准确率为 70–85%,而对于"纯"英语 AI 文本则达 85–95%;至于经过良好编辑并添加了个人经历的文本,检测器通常根本不会标记(vc.ru)。开发商的逻辑可以理解:如果负责任地使用这个信号——将其作为编辑历史和与作者对话等多个论据之一——它会降低错误风险而非制造风险。完全放弃这个工具则让客户失去了任何早期预警。
问题在于,实际上这种信号很少被负责任地使用。所有上述独立测试都指向这一点:准确率数字看起来像一个现成的决策依据,正是因为它只有一个而且看起来客观——而与执行者沟通则需要时间和社交尴尬。Setters Media 上的检测器市场领导者概述指出,即使是 Winston AI、Originality.ai 和 Copyleaks 这些声称准确率达 92–99.98% 的开发商也承认:绝对准确的检测器不存在,原则上也不可能存在。正是在这个差距中——文档中的"概率信号"与客户邮件中的"87%——确定是神经网络"——产生了不公平的付款拒绝。
还有一个相反的事实支持客户保持谨慎的态度:ReText.AI 对 2013 至 2025 年的 12,996 篇学位论文研究发现,带有 AI 特征文本的份额从 2022 年的 9.9% 上升到 2025 年的 42.3%(Habr / ReText.AI)。这是检测器开发商自己的研究,因此对绝对数字应与对待其他开发商声明一样谨慎——但趋势说明:完全忽视问题也不是出路。问题不在于"启用检测器与否",而在于"当它显示某些内容时该怎么办"。

务实的回答是:将决策点从检测器的数字转移到验收流程上:如果任务是可靠地判定 AI 文本,单一百分比是不够的,需要一个不会因一个错误数字而崩溃的流程。
请求版本历史。Google Docs 或 Word 中的版本显示文本是逐步撰写还是一次性插入的——这比任何统计风格分析都可靠。
检查来源和引用。模型编造事实和引用的频率比改变风格的频率更高;要求执行者展示文本所依据的材料——这是捕获真正问题的方法,而不是间接特征。
就内容进行简短访谈。花五分钟讨论文本中为什么选择了某个特定的论点或例子,这能区分真正理解材料的作者与只是简单复制了模型结论的人——无论模型是否为其提供了帮助。
如果想用检测器跑一下文本——至少使用两个不同的工具,并将它们之间的差异视为对话的信号,而不是计算平均值来做决定。Weber-Wulff 和她的合著者正是出于这个原因同时测试了 14 款服务:单一结果什么都无法证明,因为没有任何单一工具达到 80%——低于这个门槛,拒绝付款的决策在统计上都是无依据的。
也有训练自己的眼睛而非算法的方法:至少用同一个提示词将类似需求的 brief 通过几个不同的模型跑一次,亲眼看看通常被误认为"AI 特征"的典型表达方式。在单一输出中,段落节奏均匀看起来只是整洁的工作,而在连续五次回复中就能识别为模型的惯用手法。对于这种对比,不必为每个模型单独订阅:provod.ai 通过一个 API 提供模型目录访问,如果编辑工具已经支持 OpenAI 兼容协议,只需更换 base URL,无需重写集成。如果这种对比成为编辑部的常规工作而非一次性争议,这就变成了运营问题——多个员工的访问权限、以卢布计费和俄罗斯法人的结算文件,而非单个编辑的个人银行卡。
合同中与执行者的条款也值得重新表述:不是"文本不应包含检测器 X 版本的 AI 特征",而是"使用 AI 工具作为草稿或助手是可以接受的,但提交未经核实或事实不准确的文本是退回重做的理由"。这将两个不同的问题区分开来——是否使用了模型,以及文本是否被诚实地核实过——而这是检测器根本无法区分的。
对百分比片面信任的代价是具体可见的:执行者因为其写作风格对该算法的训练语料库来说"过于正确"而失去文本报酬,而文本实际上是自己写的。只要还没有任何独立测试显示出可以无条件信任这一决策的检测器,以上所述就是代价。
provod.ai — 在同一场景中连接 LLM 和媒体模型
让一个模型准备想法和提示词,另一个创建图像,第三个组装视频:统一的 API 简化了链路自动化和团队访问管理。
在一个目录中——面向文本和媒体的最新模型:来自 OpenAI 的 GPT、来自 Anthropic 的 Claude、来自 Google 的 Gemini、来自 xAI 的 Grok、DeepSeek、Qwen、GLM、Kimi 和 MiniMax;面向图像的 Nano Banana 2 Pro 和 GPT Image;面向视频的 Seedance、Kling、Veo 和 Google Omni 的最新版本。同样可用于 reasoning、搜索、文档、嵌入、音乐和音频的模型。
组合场景不会产生组合加价:每次调用均按相应模型的官方价格 1:1 计算。
自动化从想法到视频的路径:注册表单 · 模型价格 · 按 152-FZ 数据保护 · API 和集成
Weber-Wulff et al., "Testing of Detection Tools for AI-Generated Text", arXiv, 2023 年 7 月
Liang, Yuksekgonul, Mao, Wu, Zou, "GPT detectors are biased against non-native English writers", arXiv, 2023 年 4 月
ScienceDaily, "GPT detectors falsely accuse non-native English speakers of cheating", 2023 年 7 月
TechCrunch, "OpenAI scuttles AI-written text detector over 'low rate of accuracy'", 2023 年 7 月
Inside Higher Ed, "Turnitin's AI detector: higher-than-expected false positives", 2023 年 6 月
eTXT,AI 检测器官网页面
Habr,"Меня обвинили в том, что я — нейросеть",2025 年 12 月
Setters Media,"Признаки: человек или машина? Учимся отличать ИИ в текстах",2025 年 11 月
Habr / ReText.AI,对 13,000 篇学位论文的研究,2026 年 6 月
vc.ru,"Как проверить текст на ИИ: детекторы нейросети",2026 年