8.0
热点
AI SCORE
技术实践2026-08-21 01:36
LLM 写作风格趋同根源:后训练 guardrails 收窄了表达空间
The Decoder#LLM#Post-training#AI写作
Editor brief · 编辑速览
技术博客分析指出 LLM 输出风格雷同的根本原因在于 post-training 安全 guardrails 过强压缩了表达范围,基座模型本身已有丰富多样性。对理解 LLM 局限和 RAG/微调方向有参考。
理论上,LLM 可以像人类一样写出多样化的文本,但实际上它们没有。AI 文本检测公司 Pangram 的 CTO Bradley Emi 在一篇博客文章中指出,后训练和安全护栏使得 LLM 的文本可以被检测出来。ChatGPT、Claude 或 Gemini 这样的系统会学习行为规则,以避免危险输出或审查某些政治言论。这急剧缩小了它们的表达范围,这种效应被称为"模式崩溃"(mode collapse)。
在"模式崩溃"中,语言模型固守一种偏好的表达方式(橙色曲线),而不是覆盖人类语言的全部范围(蓝色曲线)。而在"模式覆盖"中,模型将概率更均匀地分布在各种表达方式上。

Emi 表示,所谓的 base model,即后训练之前的原始模型,写出的文本更具多样性,因此 Pangram 的检测系统不会标记它们。同样的情况也适用于仅在海明威作品或特定 subreddit 文本上训练的窄领域微调模型,以及那些破碎的输出(如不连贯的文本)。不过,这只适用于没有水印的 AI 文本。水印很可能始终有效,即使 base model 的多样性更高。