教你识别 Claude 何时在编造答案的具体方法:语法正确不代表正确、自信不等于准确、需要建立校验直觉。极实用的 AI 工具使用指南。
答案干净整洁、格式正确、信心满满。你运行它。但这个配置标志并不存在。
响应中没有任何内容能告诉你哪些部分是确实的,哪些是填补的。语法是对的。解释很合理。这个标志有一个合理的名称和清晰的用途。只是它不存在。
这是一个校准问题,而不是信任问题。"别相信 AI"是无用的建议。它告诉你要怀疑一切,这等于什么都不怀疑,因为你实际上无法这样工作。你真正需要的是一种方法来区分答案的哪些部分是有根据的,哪些是填补的。有一些模式值得关注,一旦你知道它们,就很难遗漏。
这不是关于智力。这是关于经验。
有几年经验的工程师已经浪费过时间在一个不存在的函数上。他们曾在一个配置参数上浪费过一个下午,结果发现它属于另一个引擎。他们积累了一些"看起来对但实际不对"的记忆,这些记忆现在会自动激活。一种微妙的感觉让他们在运行前先检查这个。
初学者还没有经历过这样的下午。来自重复失败的模式识别不存在,因为失败还没有发生。一切都以相同的自信语气出现,没有过去的错误可以参考,就没有内部信号来区分有根据的答案和编造的答案。
这不是性格缺陷。这是缺乏经验,可以部分地用三个具体的事项来替代。
这些不是完美的。它们是最低标准,能捕捉常见情况。我会在最后明确说明它们遗漏了什么。
当答案包含精确的细节(特定的配置标志、特定的函数签名、精确的版本号)而没有说明这个细节来自哪里时,这是响应中风险最高的部分。
有根据的答案倾向于在模型不太确定的地方保持一般性,在更确定的地方变得具体。编造的答案往往到处都很具体,因为输出中没有可见的不确定性信号。真实的 Spark 配置参数和编造的参数看起来完全相同。
检查方法:如果一个细节具体到可以粘贴到代码中,那么在运行前要验证它在你的版本的实际文档中存在。不是检查逻辑是否合理。而是检查这个东西本身是否真实。
一个听起来正确、遵循命名约定、控制你所需内容的 Spark 配置标志。但它不存在。这就是 Sign 1。
这与 Sign 1 密切相关,但表现不同。
你问如何在 Snowflake 中做某件事。答案使用了一个函数,它完全做你需要的,具有干净的语法和合理的名称。你检查了 Snowflake 文档。这个函数不在那里。你进一步搜索。它存在于 BigQuery 中。
这个函数是真实的。这个功能是真实的。它只是属于一个不同的引擎。这比完全编造的函数更危险,因为它几乎能通过检查。你能找到它的文档,只是不是针对你的系统的。
检查方法:当函数不熟悉时,针对你的引擎的文档专门验证它,而不是进行一般的网络搜索。"这个函数是否存在"和"这个函数在 Snowflake 中是否存在"是不同的问题,只有第二个问题才重要。
这是最不明显的信号,也是最可靠的。
试试这个:问一个有特定约束的问题。得到一个答案。然后再问一次相同的问题,但移除约束。如果答案几乎没有改变,那说明约束实际上并没有被使用,这意味着模型可能产生了一个通用答案,并用你的细节包装了它。
例如:你要求为一个有 5 亿行且在日期列上有大量读取流量的表的分区策略。你得到了一个详细的答案。现在要求一个"大表"的分区策略。如果答案基本相同(相同的建议、相同的推理,只是没有你的数字),那么第一个答案不是由你的约束塑造的。它是一个通用答案,你的背景被加在了上面。
检查方法:对于任何重要的事情,移除一个关键约束并再次提问。如果答案保持不变,它首先可能就没有使用那个约束。
最强有力的反对意见不是"别相信 AI"。而是这样的:这些信号是经验法则,一个模型可以在不显示任何这些信号的情况下自信地出错。
那是真的。会有通过所有三个检查但仍然错误的答案。函数在你的版本中存在,当你移除背景时答案改变,具体细节是真实的,但逻辑仍然有微妙的缺陷。一个三点检查清单可以在它遗漏的确切情况中产生虚假信心。
这是一个真实的风险,这就是为什么表述很重要。这些是最低标准,而不是保证。它们捕捉常见的失败:不存在的函数、来自错误引擎的答案、装扮成具体建议的通用建议。它们不做的是确认其他一切都是正确的。通过所有三个检查的任何东西仍然需要你的判断。但任何未通过其中之一的东西可以在 30 秒内被发现,在它花费你一个下午之前。
目标不是消除每个坏答案。而是廉价地捕捉那些遵循某种模式的答案,这样你的实际思考时间就会用在那些不遵循模式的答案上。
三个信号。运行前检查。
没有来源的非常具体的细节。如果具体到可以粘贴到代码中,请验证它在你版本的文档中存在。
来自错误工具的函数。针对你的引擎专门检查,而不是进行一般搜索。
当移除背景时答案不改变。取出一个关键约束并再次提问。如果答案保持不变,它没有使用你的背景。
这些不会捕捉一切。它们捕捉遵循某种模式的失败,那些现在花费你最多时间的。
这是关于数据工程师 AI 实践系列的第 2 篇。接下来:数据工程中最被低估的 Prompt。
关于进一步的行动,你可以考虑屏蔽这个人和/或报告滥用。