AI 模型许可证解析:开源与商业边界
系统讲解开源模型许可证约束(如 Llama 2 的 700M 用户限制),帮助开发者理解模型选型和合规部署的法律边界。
系统讲解开源模型许可证约束(如 Llama 2 的 700M 用户限制),帮助开发者理解模型选型和合规部署的法律边界。
本文包含联盟营销链接。我们可能会从中赚取佣金,而你无需支付任何额外费用。完整披露。
2023 年 6 月,Meta 以自定义许可证发布了 Llama 2,允许将其用于商业用途,但附带一个条件:如果你的应用月活跃用户超过 7 亿,就必须获得 Meta 的明确许可。同月,OpenAI 的 GPT-4——一个至今仍未公开架构和训练细节的模型——继续占据各大排行榜前列,MMLU 得分超过 86%。这两种路径的差异不只是一种商业策略,更定义了 AI 模型许可中的根本性取舍。Llama 2、Mistral 和 Qwen 等开源模型具备透明、可定制的优势,但在原始基准测试性能方面往往落后于专有模型。GPT-4 和 Claude 3 等专有模型能够提供最先进的效果,却会将用户锁定在 API 定价体系和不透明的决策机制之中。本文将通过可验证的数据和具体示例,拆解每种许可模式在成本、性能、法律约束及实际使用场景中的现实影响。
在 AI 领域,“开源”这个概念比传统软件中的定义更加微妙。所谓开源 AI 模型,通常是指公开发布模型权重,并附带一份许可证,用于规范模型的使用、修改和再分发。例如,Meta 的 Llama 2 使用 Llama Community License,允许商业使用,但会限制某些拥有大量用户的应用,并禁止用于军事或监控场景。相比之下,Mistral AI 的 Mistral 7B 采用 Apache 2.0 发布——这是一种宽松许可证,几乎允许不受限制地使用,包括再许可。在专有模型一侧,OpenAI 的 GPT-4、Anthropic 的 Claude 3 和 Google 的 Gemini Ultra 都属于封闭系统:你只能通过 API 使用它们,模型权重从不对外公开。你无法对完整模型进行 fine-tune、检查它的训练数据,也无法在自己的硬件上运行它。
参数量的差异凸显了两者之间的鸿沟。Llama 2 提供 7B、13B 和 70B 三种参数规模。GPT-4 的参数量并未得到官方披露,但第三方分析——例如 2023 年的 SemiAnalysis 报告——估计,采用 mixture-of-experts 架构的 GPT-4 可能拥有 1.7 万亿至 1.8 万亿个参数。这种规模差异会直接转化为性能差异,同时也意味着成本差异。据估算,训练 Llama 2 70B 在 A100-80GB 硬件上消耗了 170 万 GPU 小时,成本约为 200 万至 300 万美元。据信,GPT-4 的训练算力消耗约为 1 亿 GPU 小时,这意味着训练成本超过 1 亿美元。这些数字至关重要,因为它们不仅决定了谁有能力训练模型,也决定了谁有能力运行模型。
开源模型与专有模型之间的成本差距十分明显,但并不能简单概括为“免费与付费”的比较。开源模型可以免费下载,但运行它们需要硬件。要以全精度运行 Llama 2 70B 的推理,至少需要两块 A100-80GB GPU,每块的零售价约为 15,000 至 20,000 美元。在 AWS 或 Lambda Labs 等供应商处租用这套云端 GPU 配置,每小时大约需要 3 至 5 美元。相比之下,截至 2024 年 5 月,GPT-4 API 每 1,000 个 prompt token 收费 0.03 美元,每 1,000 个 completion token 收费 0.06 美元。对于一次典型的聊天机器人会话,如果输入 500 个 token、输出 200 个 token,每次会话的成本约为 0.027 美元。如果每天提供 10,000 次会话,成本就是每天 270 美元,即每月约 8,100 美元。在云端 GPU 上自行运行 Llama 2 70B 实例来承载相同的请求量,计算成本约为每月 1,500 至 2,000 美元,但这还没有计入工程投入、扩缩容和延迟优化的成本。
备受好评的在线隐私与安全 VPN。服务器速度快如闪电。
训练成本的差距更加悬殊。借助 LoRA 等参数高效技术,只用一块 RTX 4090(24GB VRAM,约 1,600 美元),就可以在自定义数据集上 fine-tune Llama 2 7B 这样的开源模型。GPT-4 无法进行 fine-tune;你只能使用 few-shot prompting,或者 fine-tune GPT-3.5 Turbo,后者每 1,000 个训练 token 收费 0.008 美元。对于包含 100,000 个样本、每个样本平均 500 个 token 的数据集,fine-tune GPT-3.5 Turbo 的成本约为 400 美元。但得到的模型仍被锁定在 OpenAI 的基础设施中——你无法将其导出,也不能离线运行。选择开源还是专有模型,往往归结为前期硬件投入与持续 API 费用之间的取舍,而盈亏平衡点会随着请求量和延迟要求发生变化。
基准测试得分是双方最显眼的竞争阵地,但解读这些分数时必须谨慎。在 Massive Multitask Language Understanding(MMLU)基准测试中,GPT-4 在首次发布时(2023 年 3 月)取得了 86.4% 的得分,Llama 2 70B 则为 68.9%。两者之间 17.5 个百分点的差距,在当时看来似乎难以逾越。然而,后续开源模型已经大幅缩小了这一差距。Mistral 于 2023 年 12 月发布的 Mixtral 8x7B,在 MMLU 上取得了 70.6% 的得分,与 GPT-3.5 的性能相当。阿里巴巴的 Qwen 72B 达到了 73.6%。2024 年 4 月,Meta 发布 Llama 3 8B 和 70B,其中 70B 版本在 MMLU 上取得 82.0% 的得分,仅落后 GPT-4 4.4 个百分点。在 HumanEval 等编程基准测试中,情况也很类似:GPT-4 的 pass@1 达到 67.0%,而 Llama 2 70B 只有 29.9%。但 Code Llama 34B(68.2%)和 DeepSeek Coder 33B(72.0%)等专门面向编程的开源模型,如今在代码生成任务上已经超过 GPT-4。
公司新闻稿并不总会告诉你,基准测试结果经常经过精心挑选,或者是在不同条件下测得的。GPT-4 的 MMLU 得分 86.4% 来自 5-shot 评估;一些开源模型在 fine-tune 后报告了更高的数字,但使用的是不同的数据划分。开源社区也更倾向于关注通用基准测试,而专有模型可能更擅长一些细腻复杂的任务,例如总结长文档,或者在多轮对话中保持一致性。Stanford CRFM 在 2023 年的一项研究发现,与 GPT-4 相比,Llama 2 等开源模型在处理分布外 prompt 时,性能会下降 15% 至 20%。因此,尽管原始分数正在逐渐接近,但在许多生产环境中,专有模型在可靠性和稳健性方面仍然占优。
最终决策通常取决于三个因素:数据敏感性、定制需求和规模。对于受 HIPAA 法规约束的医疗健康应用,开源模型通常是唯一可行的选择,因为患者数据不会离开组织自己的基础设施。O’Reilly 在 2023 年进行的一项调查发现,70% 的企业 AI 从业者将数据隐私列为选择开源模型的主要原因。定制能力是另一个重要驱动力。如果你需要一个能够理解公司内部术语,或者能以特定语气生成回答的模型,那么在自己的数据上 fine-tune Llama 2 7B 等开源模型既直接又划算。专有模型只能通过 fine-tune 提供有限的定制能力,例如 GPT-3.5 Turbo,而且不允许你修改模型的核心行为。
另一方面,对于要求在通用知识任务上达到绝对最佳性能的应用——例如需要准确回答各种问题的面向客户的聊天机器人——专有模型仍占据优势。GPT-4 拥有广泛的知识,在处理含义模糊的查询时也更加可靠,因此对于高风险的客户交互而言是更稳妥的选择。同样,如果你没有足够的工程资源来搭建和维护 GPU 基础设施,使用 API 会简单得多。对于用户规模较小的初创公司,GPT-4 或 Claude 3 的按量付费模式可以避免前期资本支出。代价则是供应商锁定:如果 OpenAI 调整价格或使用条款,你的应用就会受到影响。A16Z 在 2024 年的一项分析指出,每月 API 调用支出超过 10,000 美元的公司,应当认真考虑迁移到开源模型,以控制成本并减少依赖。
AI 领域的开源标签并非只有一种形式。Apache 2.0 许可证——Mistral 7B、BLOOM 和 Falcon 40B 均采用该许可证——允许商业使用、修改和再分发,而且不要求衍生作品必须开源。MIT 许可证被一些规模较小的模型采用,它甚至更加宽松。相比之下,Llama Community License 包含一些条款,会限制模型在特定类别中的使用,例如军事、监控和高风险应用;如果月活跃用户超过 7 亿,还需要进行报告。这是 Meta 在推动广泛采用的同时,刻意保留一定控制权的做法。有些许可证还会施加“copyleft”要求:RAIL(Responsible AI License)强制用户共享与安全相关的修改。OpenAI 等公司的专有 EULA 则禁止逆向工程、训练竞争性模型,而且往往会限制未经事先批准的 API 调用量。
这些法律差异会带来现实后果。2023 年,一家使用 Llama 2 开发心理健康聊天机器人的初创公司,必须确认其应用不会落入 Meta 许可证定义的“高风险”类别,因为这种分类可能触发额外的合规要求。相反,一家公司如果使用 Apache 2.0 许可的 Mistral 7B,则可以自由地将该模型嵌入商业产品,无需承担任何报告义务。整体趋势正在朝着限制更多的开源许可证发展:Meta 于 2024 年 4 月发布的 Llama 3 使用了类似的社区许可证,并更新了可接受使用政策。与此同时,Google 于 2024 年 2 月发布的 Gemma 模型采用自定义许可证,允许商业使用,但禁止将模型作为竞争性 AI 平台的一部分进行分发。对于评估是否采用某个模型的法务团队而言,理解这些细节至关重要。
截至 2024 年年中,Hugging Face 上的开放权重模型数量已超过 50 万,而 2022 年只有大约 10 万个。推动这场爆发式增长的既有学术机构,也有科技巨头。在过去 12 个月里,Meta、Mistral、Google 和阿里巴巴都发布了具有竞争力的开放模型。这一趋势仍在加速:2024 年 3 月,Databricks 发布了 DBRX,这是一个拥有 132B 参数的 mixture-of-experts 模型,在 MMLU 上取得 73.7% 的得分,足以与 GPT-3.5 竞争。预计将于 2025 年开始执行的 EU AI Act,很可能会区别对待开源模型与专有模型:如果开源模型采用宽松许可证发布,可能会免除某些透明度义务。这种监管上的不对称,可能会进一步让竞争格局向开源倾斜。
然而,训练算力方面的差距仍是一道结构性壁垒。尽管量化和剪枝技术正在降低开源模型的推理成本——例如 4-bit 量化可以将内存需求降低 75%——但训练 Llama 3 70B 这样的模型仍然需要数百万美元。大多数组织会选择 fine-tune 预训练的开源模型,而不是从头开始训练。未来的市场很可能会一分为二:开源模型将主导专业化、隐私敏感和注重成本的应用,而专有模型则会继续在通用、高风险和快速演进的任务上保持领先。到 2025 年,开源模型很可能会在大多数标准基准测试上追平 GPT-4,但专有模型领域也会推出规模更大的模型——如 GPT-5、Gemini Ultra 2——进一步拓展能力边界。
有三点结论尤为突出。第一,对于
日本民间传说怪物:完整的 Yokai 指南与起源(mythicalarchives)
日本民间传说怪物:完整的 Yokai 指南与起源(mythicalarchives)
为你的企业 Fine-Tune 开源模型:分步指南(aiinactionhub)
为你的企业 Fine-Tune 开源模型:分步指南(aiinactionhub)
2026 年最适合编程的开源自托管 LLM(aidiscoverydigest)
2026 年最适合编程的开源自托管 LLM(aidiscoverydigest)
最初发布于 clearainews.com
如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。