提出小语言模型专精化的工程标准:先与基线模型在可衡量指标上对比确立收益,再决定用LoRA/QLoRA还是蒸馏,避免堆叠方法。
一个小语言模型专家不需要在所有方面都超越前沿模型。它只需要在某个明确的目标上击败选定的基线、保持在回归和运行时限制内,并在任务超出其能力范围时进行路由。
这是一个比把每一个窄向改进都称为更聪明模型更有用的标准。
好的专家目标具有可重复的输入、客观的输出、具有代表性的数据,以及留在本地的运行时理由。
工具选择、结构化提取、文件操作、SQL 生成、格式化以及有界意图路由都是可衡量的。"成为一个更好的助手"并没有定义一个可衡量的目标。
在训练之前,我会在冻结的评估集上运行未修改的基线模型。基线应该包括按分片划分的准确率、无效输出、延迟、内存,以及在可用时的弃权或路由行为。
没有基线的专家没有可证明的收益。
当 prompting 或 constrained decoding 能解决问题时,它们应该首先被使用。当行为必须被学习时,LoRA 或 QLoRA 才有意义。当更强的 teacher 模型产生经过审查的目标行为时,蒸馏可以提供帮助。
在失败真正需要之前,我不会堆叠方法。
候选模型可以在其目标上改进,同时在通用工作上回归。它需要一个明确的路由器或置信边界,而这个边界需要有自己的评估。
运行时应该只为专家已证明胜任的任务选择专家。被路由的请求应该被报告为已路由,而不是作为新的通用默认值。
一个可用的包包括:基础身份、adapter 或融合产物、分词器和 prompt 契约、路由规则、运行时需求、许可证信息、评估报告、已知的回归以及可复现的配置。
缺失的延迟或内存信息仍然会缺失。
我使用的 outcomes 是:
失败的尝试应该保持可用,因为它们解释了下一个实验,并防止相同的配方在没有证据的情况下被重复。
PostTrainLLM 围绕这个目标到报告的循环组织。其公开的文件操作专家展示了强劲的目标收益,同时披露了广度回归和路由约束。
完整的专家工作流程见 https://posttrainllm.com/build-small-language-model-specialist。