大模型本质是预测下一个词的概率分布,没有事实数据库也无法验证真伪,合乎语法的幻觉和真实信息在表现形式上完全一致。使用LLM时必须对所有事实、数字、引用进行核实,而非选择性验证。
理解语言模型的工作原理,比选择某个具体服务更能节省成本。几乎所有昂贵的实施错误都源于一个误解:期望模型表现得像一本参考书,而它从根本上就截然不同。让我们用简单的术语拆解它的结构,以及这在实践中意味着什么。
语言模型在大量文本上进行训练,以预测下一个词最可能是什么。它所做的,只是以最合理的方式续写文本。它既没有事实数据库,也没有验证真理的机制。
这就解释了三个常被视为“缺陷”、但实际上是结构直接后果的特性。
对模型而言,合理性与真实性是同一属性。不存在的引用、捏造的链接、虚构的法律条款,看起来和真实的一样令人信服,因为它们是用相同的语言模式构建的。
实践要点:验证所有事实、数字、引用和链接。不是选择性地验证,而是所有会出现在你屏幕上的内容。自信的语气不是正确的标志。
模型保留的文本量有限。当讨论超过这个容量时,开头就不再被纳入考量——不是被“遗忘”,而是被简单地排除在外。
实践要点:切换主题时重复重要的输入;将长任务分解为独立的对话,并在每个对话开头附上简要总结。
模型知道它训练数据中包含的内容,之后的则一无所知。没有搜索或访问你文档的能力,它不知道昨天的新闻、当前的价格、法律的最新变更。
实践要点:对于任何会变化的事物,你需要么是搜索,要么是你的文件。向模型询问当前价格,就等于是在问去年的目录。
与常见做法相反,建议不要从比较模型开始。对于大多数应用场景,强模型之间的差异,不如定义良好的任务与定义糟糕的任务之间的差异那么显著。从任务开始,在任何可用的模型上测试它。
说到选择,三个实践标准比评分更有意义:
数据在哪里处理——决定什么内容根本可以发送过去。
许可证允许什么——尤其是对于商业产品。
你的用量成本是多少——价格差异很大,对于典型任务的质量差异往往可以忽略不计。
从简单到复杂的实施顺序详见分步计划。
模型会取代专家。它复制了专家回复的形式,但不承担任何责任。
模型会取代专家。它复制了专家回复的形式,但不承担任何责任。
它会在对话中“学习”你。在正常模式下,模型不会记住会话之间的对话。
它会在对话中“学习”你。在正常模式下,模型不会记住会话之间的对话。
更大的模型会解决任务定义的问题。模糊的请求在任何模型上都会得到模糊的回答。
更大的模型会解决任务定义的问题。模糊的请求在任何模型上都会得到模糊的回答。
它预测合理的续写,而不是验证真理。核查所有事实信息。
保留的文本量有限。重复输入,分解长任务。
不知道,除非它有搜索或你文档的访问权限:知识局限于训练日期。
从任务开始。选择时关注数据处理、许可和用量成本。
另见:AI 术语表、API 价格对比。
免责声明:本资料仅供参考,不构成技术或法律建议。模型能力、许可条款和价格可能发生变化——请向提供商核实。本资料由编辑团队使用神经网络工具编制,并已对照原始资料进行了核查。
原文(俄语):Большие языковые модели: как устроены и что из этого следует для бизнеса