微调会导致模型遗忘原有知识,实质是权重调整时新知识覆盖旧模式,而非真正的学习过程,需在专用化和通用能力间做权衡。
灾难性遗忘是神经网络中的一个现象。
模型学习一个新任务。
新知识覆盖旧知识。
模型遗忘之前的任务。
模型变得专业化。
它失去了通用知识。
它变得不再多才多艺。
我们称之为"Bug"。但它其实是一个特性。模型正在为新任务做优化。
模型并非在遗忘,而是在重新排序优先级。
灾难性遗忘的发生源于神经网络的学习方式。
模型的权重针对新任务进行了调整。
这些调整覆盖了旧的模式。
旧知识丢失了。
模型的容量有限。
它无法存储所有知识。
根本原因不是容量,是训练。模型一次只在一个任务上训练。
如果模型同时在多个任务上训练,它就不会遗忘。
灾难性遗忘有真实的后果。
通用知识丧失:
模型的知识面变窄。
它无法回答常识性问题。
它变得没那么有用了。
模型变得不那么鲁棒。
它在分布外输入上会失败。
模型需要持续重新训练。
维护成本很高。
还很耗时。
后果被夸大了。对很多应用来说,专业化比通用性更重要。
医学诊断模型不需要会写诗。
灾难性遗忘可以被缓解。
添加对权重变化的惩罚。
这可以防止覆盖。
在训练时回放旧数据。
这可以强化旧知识。
同时在多个任务上训练。
这可以防止专业化。
解决方案并不完美。它们减少了遗忘,但没有消除它。
专业化与通用性之间的权衡是根本性的。
LoRA 可以帮助防止灾难性遗忘。
LoRA 添加新参数。
基础模型被冻结。
新参数在新任务上训练。
基础模型保持不变。
旧知识被保留。
新知识被添加。
LoRA 不是银弹。它减少了遗忘,但没有消除它。
基础模型被冻结了。但新参数仍然可能产生干扰。
微调的未来不确定。
近期(1-3 年):
技术会改进。
遗忘会减少。
模型会变得更鲁棒。
中期(3-7 年):
微调将自动化。
遗忘将被最小化。
模型将更多才多艺。
长期(7-10 年):
微调将过时。
模型将持续学习。
遗忘将成为历史。
未来不是微调,是元学习。模型将学会学习。
它们将适应新任务而不遗忘旧任务。
你是 AI 的使用者。你需要意识到风险。
谨慎微调:
意识到风险。
使用正则化和复习策略。
监控模型的性能。
LoRA 减少了遗忘。
它是更好的替代方案。
考虑权衡:
专业化 vs. 通用性。
选择正确的平衡点。
最后一次微调不是一笔交易,是一个选择。
你问:"我应该微调这个模型吗?"AI 说:"视情况而定。"你意识到:选择无关乎技术,而关乎权衡。
如果你必须在遗忘通用知识的专业模型和不够准确的全能模型之间选择,你会选哪个?为什么?