AI检测器依赖'文本可预测性'等粗糙代理指标,导致结构清晰的人类文章被误标,而非母语者的规范表达反而更易被标记。根本原因是模型训练目标就是消除人与AI的写作差异。
一款 AI 检测工具曾将美国宪法标记为机器撰写。这不是一个有趣的故障——它是一个问题的完整缩影,也是为什么"AI 检测器"更接近占星术而非科学的原因。
学校、招聘团队和编辑们正在使用一些工具,承诺能够区分人类写作和 AI 写作。以下是这项技术无法兑现这一承诺的原因。
检测器必须仅凭文本回答"这是人类还是模型写的?"但一个流畅的模型,其训练目标正是生成看起来像人类写作的文本——这就是它的全部目的。没有什么可靠的、内在的指纹可以将"AI 流利"与"人类流利"的文本分开,因为模型的构建正是为了消除这种差异。所以检测器只能依赖粗糙的代理指标,比如文本有多"可预测"或有多"流畅"。
这立即适得其反。清晰、结构良好的人类写作看起来"太可预测",会被标记为 AI。这就是为什么精心打磨的文档——以及著名的,如宪法这样的正式文本——会触发检测器。这也是为什么它们不成比例地误判非母语英语写作者,他们的更谨慎措辞在愚蠢的统计代理指标看来是"机器般的"。一个因为人们写作清晰就惩罚他们的工具,弊大于利。
即使一个检测器"99% 准确",在大规模使用时也是危险的。在 10,000 篇真正的人类论文上运行它,1% 的假阳性率意味着 100 名真正的学生被错误指控作弊。当假阳性的代价是某人的成绩、工作或声誉时,"通常正确"不是一个可以建立的标准。营销页面上自信的百分比隐藏了误差范围内的人类代价。理解一个指标悄悄藏在哪里,是我工作中应用于一切事情的一门学科。
假设一个检测器真的有效。任何想要逃避它的人都可以改写输出、用另一个模型处理,或编辑几句话——脆弱的信号就消失了。检测本质上是对抗性的:当它有效的那一刻,它就被轻易击败了,这就是为什么连构建这些模型的公司也悄悄淘汰了自己的检测工具,而不是为它们站台。
答案不是更好的检测器——而是放弃检测,转向溯源。不要在事后猜测文档的来源;而是在创建时通过签名元数据和内容凭证来建立它。在教育和招聘领域,持久的解决方案是流程而非监管:评估方式要重视思考和草稿,而不仅仅是一段机器也能产生的最终文本。我在 www.divyakush.com 写了更多关于这些 AI 信任问题的内容。
令人不安的真相是:如果你依赖 AI 检测器对真人做出重大决定,你就是在信任一个穿着白大褂的抛硬币。技术无法兑现它所承诺的,而那些自信满满的检测器是最危险的。
护栏:让 LLM 系统不失控——安全信任 AI 系统的更广泛问题。