作者建议个人开发者通常不需要从零预训练,而是从开源基座模型通过后训练构建专家。推荐Apple Silicon上用MLX的LoRA/QLoRA,并强调写清楚任务定义和评估标准再开始。
当有人问如何训练自己的 LLM 时,他们通常不需要价值数百万美元的预训练。他们想要的是一个有用的专家系统,能够在受控硬件上构建、评估和运行。
实际上,这意味着从一个开源基础模型出发,通过后训练让它学会一个有边界的Behavior。
预训练是在大规模 GPU 集群上基于海量语料库构建基础模型。这不是个人开发者或小团队的主流路径。
微调(Fine-tuning)则是将已有模型适配到一个明确的任务上:文件操作、SQL 规范、工具调用风格,或其他某个窄领域技能。在 Apple Silicon 上,通过 MLX 使用 LoRA 或 QLoRA 通常是实际的起点。
如果某个指南声称笔记本就能从零训练一个前沿通用模型,我会把它当作营销而非工程计划。
在选择训练方法之前,我先记下任务、输入输出契约、基线模型、路由边界和拒绝Behavior。"让模型更聪明"是不够可衡量的。
目标应该描述:专家何时被允许运行,以及什么样的证据会让你拒绝它。
在生成或清洗训练数据之前,我会预留出最终的评估样本。否则测试集可能泄露到训练过程中,产生一个看似很高、但无法支撑上线决策的分数。
未修改的基线和候选模型在相同的关卡上对比测试。我将目标质量、退步、延迟、内存和包完整性分开追踪,这样平均分就不会掩盖关键失败。
LoRA 修改一小部分适配器权重,同时保持基础模型冻结。QLoRA 将这个方法应用到量化的基础模型上,可以进一步降低内存压力。
全量权重训练对于小模型可能有意义,但这不是我在单台机器上的默认选择。方法必须同时适配训练硬件和预期运行时。
一个有价值的产出包含的不仅是权重。我希望有:基础模型、适配器或融合包、分词器、量化方式、运行时需求、数据和评估的修订版本、已知局限,以及预期的路由策略。
一个 PostTrainLLM 文件操作专家将其硬门从 58% 提升到 100%,同时其域外广度从 59.6% 下降到 42.3%。这是一个真实的改进,也是一个真实的退步。正确的做法是将其路由为专家,而不是称它为一个更好的通用模型。
完整的 Mac 本地工作流见 https://posttrainllm.com/how-to-train-your-own-llm,评估产出和局限与训练路径一同保留。