用 Claude 生成自然文章的实战反思
分享利用 Claude 生成长篇易读内容的实验效果与局限,为做内容自动化的开发者提供参考。
分享利用 Claude 生成长篇易读内容的实验效果与局限,为做内容自动化的开发者提供参考。
我还录制了这篇文章的视频播客版本。播客更多是非正式的总结,而不是文章的逐字音频录制。
播客也是一个 Youtube 视频。
这是与播客配套的幻灯片。我通过 DALLE 3 生成了这些幻灯片图像。
在我的 API 课程部分关于如何在技术写作中使用 AI 时,你会注意到一个话题明显缺失:没有文章解释如何使用 AI 编写原创的、全长度的内容。这基本上是很多人希望 AI 能帮助的圣杯——生成新的写作和想法,而不仅仅是协助编辑或摘要任务。在这篇文章中,我将分享我尝试回答这个问题的经验:你能使用 AI 工具编写全长度的内容,特别是适合博客的文章吗?
在深入这个话题之前,你可能会想知道为什么我甚至要尝试。我完全有能力自己写句子,那我为什么要把这个角色交给非人类的实体呢?
我不太确定。有些组织预测技术写作可能在几年内会被自动化。例如,参见 Forrester 的 2023《生成式 AI 对工作的影响预测(美国)》。有一种感觉,如果我们不弄清楚如何利用 AI 工具,我们将被那些会利用的人所取代。所以我最近一直在实验 AI,试图了解 AI 擅长什么,不擅长什么。
由 LLM 驱动的 AI 最显著的特点是它们的写作能力——连贯地、毫不费力地、(有时)准确地构建句子。许多人使用 AI 来修复这里或那里有问题的句子或段落。为什么我们不能使用 AI 作为工具来编写全长度的内容,比如文章或个人散文呢?这是一个有效的问题,因为如果 AI 工具可以做一些写作任务,为什么不能做更多呢?
让我们首先看看关于如何与 AI 一起写作已经做了什么研究。很难超越关于 AI 写作工具的无尽营销文章,但这里有两篇引起我注意的文章。
在《导航参差不齐的技术边界:AI 对知识工作者生产力和质量影响的实地实验证据》中,Dell'Acqua 等人描述了波士顿咨询集团的顾问如何在他们的工作中使用 AI 工具,如 GPT-4。他们的"参差不齐的边界"比喻描述了使用 AI 执行任务的不均匀结果。对于 AI 能力范围内的任务,使用这些工具的顾问看到了生产力、速度和质量的显著提高。然而,对于对 AI 来说更具挑战性的任务,过度依赖 AI 的顾问表现更差。作者辩称——
……AI 的能力创造了一个"参差不齐的技术边界",其中一些任务很容易由 AI 完成,而其他任务,尽管在难度级别上看起来相似,但超出了 AI 当前的能力范围。对于 AI 能力边界内的 18 个现实咨询任务中的每一个,使用 AI 的顾问生产力显著提高(平均完成任务多了 12.2%,完成任务速度快了 25.1%),并产生了显著更高的质量结果(比对照组高 40% 以上)。
作者观察到"沿着人类-AI 整合谱系的两种明显的人类成功使用 AI 的模式"。成功的顾问——那些找到了有策略地仅在适当的地方整合 AI 的方法的人——被称为"半人马"(半人类,半马),因为他们在人类和 AI 之间进行了明智的委托。那些一直使用 AI 的人是"赛博格",因为他们是完全以机器为导向的。
总体而言,结果表明 AI 可以为那些知道如何使用它的人在某些任务上提高生产力,但用户需要判断何时不依赖 AI。因此,参差不齐的边界对于专家来说可能比对业余爱好者更容易导航。
在一个名为《Futurecrafting》的 Everyday AI 播客中,Brian Sykes 是一位经验丰富的创意专业人士,已经经营广告公司二十多年,他说要把 AI 视为人类创意的放大器,而不是替代品。他说,人的因素对于引导 AI 和塑造最终产品至关重要。
虽然我认为 Sykes 更多地关注广告设计而不是写作,但这个论点仍然适用。以下是播客:
在对话中给我印象最深的是从演员到导演的比喻。Sykes 解释了这个向导演工作上升的转变如下:
我认为随着生成式 AI 变得越来越普遍,创意专业人士将越来越多地承担导演的角色。当你在设计职业早期时,你想通过完全负责最终产品来打下你的标记。但随着你的进步,你变得负责指导你下面的其他人来创建满足客户需求的结果。所以生成式 AI 将允许创意专业人士即使在职业早期也能与之互动。他们仍然需要知识来获得他们想要的结果,就像使用任何工具一样。但越来越多地,我们将成为定义消息传递的导演,同时仍保留核心的人类因素。(注:我是在改述,因为这是一个播客。)
Sykes 说,采用 AI 工具类似于设计师从手工编码网站转向更自动化的工具(类似于 Dreamweaver 出现时发生的情况)。你不是在把自己从创建中移除,而是转向一个更具战略性、导演性的角色。
新工具的引入允许创意人员少关注低级执行,更多地关注高级愿景。作为导演,你关心整体的叙事形状、从一个场景到另一个场景的流动、观众体验等等。
这个想法吸引了我。你知道吗,在我在这个博客上发布任何文章之前,我已经重新阅读了这篇文章大约六次,试图修复和平滑语言?我经常把它粘贴到 Grammarly 中来捕捉明显的错误。但尽管使用了语法和风格检查器,我通常需要让内容静置一天,读过并编辑它,让它静置另一天,再编辑一次,让它静置另一天,再编辑一次,如此反复。最终,编辑变得越来越少,我鼓起勇气发布它。写作的这个方面是乏味的,不是让我感兴趣的。如果 AI 能让我专注于想法,同时处理所有的语言平滑和编辑,会怎样?如果我能把焦点放在潜在的故事而不是句子上,会怎样?
如果 AI 能处理将思想转化为句子的低级翻译,让我能够集中我的精神能量于洞察、想法和整体叙事形状,这可能是写作的一个很好的演变。
既然我已经探索了一些研究,让我分享我使用 AI 辅助写作的实验。我只使用这种 AI 辅助技术写了几篇文章。你可以在这里阅读这些文章来了解期望的内容:
(我写的一些最近的新闻文章也是 AI 辅助的,但只是摘要要点,所以我在这里没有包括它们。)
当使用 AI 工具生成原创写作时,我尝试使用这三种技术:
我的第一个技巧是在一开始就用大量信息启动 AI。这个技巧假设文章是信息性的而不是经历性的。像 Claude.ai 这样的工具允许巨大的输入上下文 — 最多 100,000 个 token,相当于一部小说的长度。基本上,如果你要写关于某个特定话题,你可以把十几篇或更多文章复制粘贴到一个文本文件中,然后粘贴到 Claude 里,这样 Claude 就能更了解你要写的话题。
在整个起稿过程中拥有 Claude 的百科全书式上下文是有帮助的。但 Claude 的长输入长度还有另一个好处:我可以在整个写作过程中保持上下文。Claude 能够整体理解我写的文章,而不仅仅是这里那里的孤立部分。我可以继续塑造和完善这篇文章,直到达到 100k token 的限制(大约 75,000 个词)。
我不是试图一次性生成整个博文,而是逐段指导 AI。每段初稿之后,我都会审查这段,确保 Claude 朝正确的方向前进,然后再继续。这种迭代合作让我能够利用 AI,同时保持对内容方向的控制。
当我逐段进行时,我就像一个导演指导戏剧的场景,给 AI 提供的原始材料注入风格和目的。与其陷入文字修饰的苦力工作,我更多地精力投入到塑造总体方向和叙事上。我的工作变成了导演,而不是演员。
大约 20 年前,我在纽约哥伦比亚大学获得了文学非虚构创意写作硕士学位。我最大的收获是,平衡观点与个人经历能产生引人入胜的内容。这种故事叙述和观点的混合是个人创意非虚构文学的主要技巧。
在文章中加入个人经历也掩饰了 AI 生成的材料。如果你只有纯说明性的内容,像维基百科文章一样,听起来会明显是机器生成的。但当你切换到"我"的模式,用个人经历叙述来补充说明,基本上在第一人称个人经历和第三人称说明之间交替,它有助于读者相信所有内容都是人类生成的,即使是 AI 写的部分。
是的,这可能就像魔术师的障眼法一样运作,但说明和经历之间的平衡也是构成引人入胜的个人随笔的要素。所以这是一个双赢的技巧。
足够的高层策略了。让我开始用逐步的方式描述这个过程。我将列出我目前正在遵循的 10 个步骤。
我的第一步是识别我想要使用的信息模式。所有的写作都遵循某些修辞形式,取决于上下文。例如,博文通常使用故事弧,学术论文遵循标准的 IMRaD 格式(引言 – 方法 – 结果 – 讨论),白皮书利用问题-解决方案模式,等等。
修辞从根本上说是关于将内容和语言适应于特定的目的、受众和情境。通过将内容放入正确的形式,它能更好地与读者产生共鸣。
例如,如果起草一个面向流程的主题,我可能会遵循这样的模式:
{引言} {前置条件} {要解决的问题} {有序步骤} {子步骤} {示例} {预期结果} {相关链接}
当起草更多创意内容,如博文(像这个一样)时,我使用的模式更像这样:
{钩子:解释相关性} {定义问题} {提出关键问题} {总结先前研究} {批评局限} {分享实验} {描述顿悟} {提出新视角}
首先,我使用轶事引入来建立相关性并吸引读者。然后,我描述要阐述的问题。我提出一个有趣的问题,想要回答。我调查关于该主题的先前尝试和学术思想。接下来,我记录自己试图解决问题的实验。我分享从经历中学到的顿悟和教训。最后,在完成这一旅程后,我得到了新的视角。
这个叙事弧 — 从提出关注,到记录其研究,到取得启示 — 模仿了英雄之旅的故事结构。与小说不同,中心人物不是主角,而是概念或问题本身。这种模式将抽象的想法转变为一篇令人信服的"文章",在蒙田的真正意义上 — 尝试一个想法,用一个论题做一次尝试。
第二步是创建大纲。我会勾勒出我想要涵盖的关键点和我想要传达的思想。这个粗略的大纲充当了文章的方向。我不会太执着于确切的点,因为我想在写作过程中留出更灵活的操作空间。
我用这样的提示开始 Claude 会话:
我明确 Claude 将充当作者,用易读、直白的风格阐述我的思想。这设定了期望,我们将迭代地一起工作,我掌控方向,而 Claude 生成原始文本。
提示: 避免在提示中使用"essay"一词。由于 Claude 的训练,这个关键词表示我可能是一个试图在学校作业上抄袭或作弊的学生。如果你使用这个触发词,Claude 可能会这样回应:
有趣的是,Claude 似乎可以代笔博文,但在论文写作上划了一条线。所以我使用"post"或"article"这个词来规避这个怪癖,并表明我的意图是为我的博客原创内容。建立了基本规则后,我继续段落。
现在我开始描述我的第一段。我看看 Claude 是否把语音和语调把握正确了。这可能需要几次更正来校准 Claude 的语言。
我从经验中学到了不要太用力推动 Claude 采用某个人格或文学做作(如假设文学纽约人作者的风格)。结果通常很糟糕,就像一个用同义词词典的八年级学生。
相反,我的目标是友善但信息丰富的风格,使用简单的语言和日常言语。幸运的是,这通常是 Claude 默认的语言风格。
一旦我校准了 Claude 的语言和响应,我就继续指导每一段。
我通过粗略的大纲逐段进行。我每次描述我想让 Claude 写的内容,然后看 Claude 是否表达了我想说的话。如果 Claude 开始变得冗长或构造长段落,我会让 Claude 知道要修复什么。或者,如果 Claude 遗漏了我告诉它要解释的想法,我会让 Claude 重写那些部分。
在转到下一段之前,我会读过每个 AI 起草的段落。这个审查允许我根据看到的实际写作而不仅仅是我最初的大纲来评估流畅性和方向。通常,随着段落的形成,文章会有机地从原始计划转变。逐段进行为我提供了根据现有文本中引起共鸣的内容灵活调整的空间。
在我看来,大纲只是一个起点,而不是要严格遵守的东西。发现的火花(可能导致我的大纲朝未规划的方向转变)通常是让写作令人兴奋的东西。这种方法将写作视为一个过程,而不仅仅是一次性创作。
可以把这种逐段处理的流程理解为敏捷软件开发。大多数产品团队会先开发某项软件功能(最小可行产品),然后将它展示给用户并收集反馈;接着继续开发更多功能,再展示给用户,吸收反馈,如此循环。定期检查能够让团队及时调整方向。这正是 Scrum 和 Kanban 等现代软件开发实践背后的核心理念。
逐段完成整篇文章,采用的也是同一种敏捷方法。我在每一步都有机会调整方向。这会对最终结果产生巨大的影响。基本上,当你尝试使用 AI 工具写作时,如果从瀑布式方法转向敏捷方法,最终结果将有天壤之别。
审阅每一个段落,就像导演逐场拍摄电影。导演不会只喊一声“开拍”,然后一镜到底地拍完整部电影,而是会在拍摄每个场景的过程中不断作出创造性决策。一部典型的两小时电影包含 40~60 个场景(根据 Quora 的说法)。在撰写 AI 辅助的文章时,我采用了类似的方法。
所有段落完成起草和审阅后,我会把它们汇编成完整的文章。我会将每个部分复制并粘贴到一个单独的 Google Doc 中。
我通常会手动安排各部分的顺序。如果我让 Claude 重写了多个段落,或者没有按照文章顺序完成某些部分,尤其需要这样做。
我会对整个草稿进行一轮编辑。从头到尾通读草稿,让我能够评估文章的整体行文是否流畅,叙事是否连贯。
当我能够看到全局时,可能会决定删减或重新安排大段内容,以改善文章结构。我会确保每个段落的核心内容都在逐步推进,最终形成一个连贯的观点和故事线。
进行到这里,我已经跨过了一个重要的里程碑——完成初稿。将那些未经整理的想法转化为初稿,是整个过程中最繁重的工作。接下来的工作会更加细致:微调语言、改善行文、填补缺漏,以及完善过渡。
这个阶段需要依靠我作为作者与生俱来的判断力。
很多地方的措辞并不恰当,因此我会使用自己偏好的表达方式重写。如果某个句子听起来像陈词滥调,我会将其删除或换一种说法。我会尽量精简和删去重复、冗长的内容。
发布较长的文章时,我喜欢添加一两张相关图片来分隔文本。大段密集的文字可能会让人望而生畏。DALL-E 3 等工具可以轻松生成 AI 艺术作品,用来说明文章中的关键观点。
例如,我会复制整个章节,然后让 Claude 为 AI 图像生成器提供一个提示词。Claude 会负责寻找能够呈现抽象概念的视觉意象。比如,对于一个讲述 AI 工具如何让你成为导演而不是演员的章节,Claude 可能会给出以下文本:
“一位导演在电影拍摄现场指导演员,同时查看剧本,代表人类对 AI 写作工具的监督。”
将其输入 DALLE3(ChatGPT Plus 的一个插件)后,它会生成 4 个各不相同的图像提示词:
一张宽幅照片:一位电影导演站在片场的摄像机后方,观察两名演员表演客厅场景。导演穿着牛仔裤和纽扣衬衫,头戴棒球帽,手持扩音器。摄影指导和吊杆麦克风操作员等剧组成员都在工作,整个场景洋溢着电影的魔力。
穿插一些由 AI 创作的艺术作品,可以增添视觉趣味,也让读者有喘息的空间。如今 AI 艺术创作如此触手可及,已经没有理由不至少添加一张图片来丰富文字内容。为了增加趣味,你甚至可以将 DALLE 的完整文本提示词直接用作图片说明。
和大多数写作项目一样,将内容搁置一两天,可以让潜意识中的异议逐渐浮现出来。在撰写有关 Diátaxis 的文章时,我曾加入一个章节,解释人们如何使用 API 的学术研究,以及系统式、机会式和混合式模式。这一点很重要,但一天之后,我删除了这个章节,因为我觉得这篇文章的目的更偏向于入门和解释,而这部分内容在没有深入论证的情况下,将文章带向了一个偏离主题太远的方向。
我几乎总是会将一篇文章搁置一两天后再发布。与内容保持一些距离之后获得的清晰判断极具价值。即使 AI 辅助的写作流程可能加快创作速度,我也不会匆忙发布。多留一些时间思考,我可能会重新审视文章中的某些决定。
这就是我采用的 AI 辅助写作流程。你可以在这里查看我为那两篇文章进行的 Claude 对话:
Diátaxis 文章:Claude 对话串 1、Claude 对话串 2
拥抱职业重新定义的文章:Claude 对话串
我觉得这两篇文章最终还算可以(谈不上优秀,但至少足够好)。有几个人表示,这些文章很有趣,也很有帮助。例如,关于 Diátaxis 的文章,有个人给我发邮件说:
特别有帮助的是,你不仅解释了它 [Diátaxis],还讨论了人们对它的一些主要(潜在)异议、创始人对这些异议的回应,以及它对 AI 的影响,还有随着 AI 在文档生态系统中日益普及,Diátaxis 如何能够很好地应用于“提示词场景”。
然而,我也收到另一位读者的来信,他的感受有所不同。他写道:
如果我说得越界了,请原谅;我一直将你视为思想领袖,同时也是一位难得的实用主义者。无论我具体从事过什么职业——从开发人员到业务分析师,从提案撰稿人到写作讲师,再到如今兼具这些身份的某种复合角色——我始终都在订阅你的动态。
但最近,总觉得有些地方……不太对劲。文章似乎不像以前那样精雕细琢,也不再那么“紧凑”。段落变得更长,也不那么“「Tom」凑”了——我以前用这个自创词来形容你那种不可思议的能力:用精心挑选且极其精练的文字,在一个段落中塞入大量有价值的内容。
最近让我产生这种强烈感受的,是你那篇关于 Diátaxis 的文章。尤其是摘要,看起来很像是“生成”的,而且没有包含那些散落在正文各处、我认为很关键的结论。不过仍然不错