作者运营多语言新闻站用AI生成了2万篇真实页面,发现AI写作存在「骨架趋同」问题:批量内容会呈现相似的开头节奏和结构,Google已针对性打击此类低价值内容。
在 Mastheads 成为一个产品之前,它是我的一个问题。我运营着自己的新闻网站组合——综合新闻、金融、生活方式、五种语言的本地版——在过去几年里,这些网站背后的引擎已经起草、检查、配图并发布了超过两万篇文章。不是演示。是真实页面,在真实域名上,由我署名负责。
这个数字是人们对我的真实问题的诚实答案,问题大致是"这东西站得住脚吗?"一篇文章什么都证明不了。任何人都能挑出一篇好的生成。真正决定你是否愿意在输出上署上真名的那些失败,只有在成千上万篇中才会显现。以下是我在两万篇中发现的。
所有内容都趋向于同一个框架。这是没有人警告过你的失败。第一篇文章看起来很棒。第四十篇文章看起来可疑地像第一篇:同样的开场策略,同样的段落节奏,同样的"综上所述"收尾。没有哪篇文章本身是差的。整体作品才是问题所在。读者能感觉到但说不出,而 Google 的大规模内容滥用政策正是针对这种形态:大量页面,少有增量价值,一个模子。
模型对不真实的事情非常自信。在大规模下,幻觉不是边缘情况——它是确定会发生的。如果每五十篇文章中有一篇编造了一个具体细节,那两万篇文章中就有四百个编造的细节。你不会通过抽查发现它们。要么每篇文章都进行验证,要么错误就会按计划发布。
图片的失败方式与文字不同。文字会优雅地降级,图片则会以荒谬的方式失败——错误的人、错误的地点、在一个具体的本地标题下放一张通用的库存照片。而真正造成金钱损失的失败是法律层面的,不是审美层面的:一张带有他人权利的爬取图片是一个任何数量的好文章都无法弥补的问题。
源材料会反咬你一口。当你的流水线读取开放网络时,开放网络偶尔会写回来——你从未选择的链接,从源文档偷偷进入你发布的页面。在大规模下,"偶尔"是一个持续的威胁,而不是一个趣闻。
沉默是最可怕的失败。出错的流水线没问题。默默发布平庸内容——或默默停止——的那个才会毁掉一个出版物。没有监督的更新频率只是更快地让自己出丑。
每一个失败都成为了一条设计规则,而这些规则最终构成了 Mastheads。
没有两篇文章共享同一个框架。每篇文章在落笔之前都会根据自己独特的种子 profile 来生成——长度目标、结构、开场策略、阅读水平。这种变化不是对模型的一个样式请求,而是由引擎强制执行的。这是整体作品与模板重复之间的区别。
每个声明都会在每次发布前对照源材料进行检查。文章从真实的、有引用来源的材料中写作,独立的质检门会在交付前验证这些声明。任何门都可以将任何文章拦下进行人工审核。没有东西会默默发布。
没有合适图片的文章不会发布。它会被搁置等待审核。渐变色或随机的库存照片永远不会填补这个空缺,网络来源的图片在权利风险被确认之前不能上线——是记录在案,不是假设备受无虞。
无法追溯到来源的链接会被剥离。在发布前,任何不是文章自身引用来源的出站链接都会被移除。开放网络在你页面的链接问题上没有投票权。
一切都留下痕迹。每篇文章都携带一份真实性追踪——它使用的来源、通过的检查、署名在其背后的编辑——而没有经过人工审核的 AI 内容携带欧盟 AI 法案透明度条款所要求的披露。Google 自 2023 年以来自己的指导就说过 AI 内容没问题,操纵性内容才是问题;这份追踪记录是你如何保持在正确一侧。
两万篇文章的真正发现不是一个小技巧。写作从来都不是困难的部分。模型可以按需写出合格的文章,而且已经这样做了多年。困难的部分是新闻编辑室在一个世纪前为作家们包裹的一切:核验、编辑、标准、问责制、有人用名字为其背书。规模并不会消除对这种结构的需求——规模恰恰是使这种结构变得不可或缺的原因,因为在大量面前每一个罕见失败都会变成可预知的。
这就是为什么 Mastheads 被构建为一个新闻编辑室,而不是一个文本生成器。两万篇文章不是产品。它们是学费。
最初发布于 Mastheads 博客。我是 Palash,创始人。很高兴在评论中回答任何问题。