Google 发布 T5Gemma,提供多种规格的开源编码解码器模型,可用于 seq2seq 任务。
在快速发展的大语言模型(LLM)领域,关注的焦点主要集中在仅解码器(decoder-only)架构上。虽然这些模型在广泛的生成任务中展现了令人印象深刻的能力,但经典的编码器-解码器(encoder-decoder)架构,如 T5(The Text-to-Text Transfer Transformer),仍然是许多真实应用的热门选择。由于具有高推理效率、设计灵活性和更丰富的编码器表示以理解输入,编码器-解码器模型通常在摘要、翻译、问答等任务中表现出色。然而,强大的编码器-解码器架构相对而言受关注甚少。
今天,我们重新审视这一架构,介绍 T5Gemma——一个新的编码器-解码器 LLM 集合,通过一种称为"适配"(adaptation)的技术将预训练的仅解码器模型转换为编码器-解码器架构而开发。T5Gemma 基于 Gemma 2 框架,包括适配的 Gemma 2 2B 和 9B 模型,以及一组新训练的 T5 规模模型(Small、Base、Large 和 XL)。我们很高兴向社区发布预训练和指令调优的 T5Gemma 模型,以解锁研究和开发的新机遇。
在 T5Gemma 中,我们提出以下问题:我们能否基于预训练的仅解码器模型构建顶级编码器-解码器模型?我们通过探索一种称为模型适配的技术来回答这个问题。核心思想是使用已预训练的仅解码器模型的权重初始化编码器-解码器模型的参数,然后通过 UL2 或基于 PrefixLM 的预训练进一步适配它们。
这种适配方法具有高度灵活性,允许对模型大小进行创意组合。例如,我们可以将大型编码器与小型解码器配对(例如 9B 编码器与 2B 解码器),以创建"不平衡"模型。这允许我们为特定任务微调质量-效率权衡,例如摘要,在这些任务中深入理解输入比生成输出的复杂性更为关键。
在我们的实验中,T5Gemma 模型相比仅解码器的 Gemma 对应版本取得可比或更好的性能,几乎在多个基准测试上占据质量-推理效率帕累托边界,如衡量学习表示质量的 SuperGLUE。
这一性能优势不仅是理论上的,它也转化为实际的质量和速度优势。在衡量 GSM8K(数学推理)的实际延迟时,T5Gemma 提供了明确的优势。例如,T5Gemma 9B-9B 比 Gemma 2 9B 取得更高的准确率,但延迟相似。更令人印象深刻的是,T5Gemma 9B-2B 相比 2B-2B 模型提供了显著的准确率提升,但其延迟几乎与小得多的 Gemma 2 2B 模型相同。最终,这些实验展示了编码器-解码器适配提供了一种灵活、强大的方式来平衡质量和推理速度。
是的,T5Gemma 在指令调优前后都展现了有前景的能力。
在预训练后,T5Gemma 在需要推理的复杂任务上取得令人印象深刻的提升。例如,T5Gemma 9B-9B 在 GSM8K(数学推理)上比原始 Gemma 2 9B 模型高 9 多分,在 DROP(阅读理解)上高 4 分。这一模式表明,编码器-解码器架构在通过适配初始化时,有潜力创建更强大、性能更好的基础模型。
预训练带来的这些基础改进为指令调优后更大幅度的提升奠定了基础。例如,比较 Gemma 2 IT 和 T5Gemma IT,性能差距在全面显著扩大。T5Gemma 2B-2B IT 的 MMLU 分数相比 Gemma 2 2B 提升近 12 分,其 GSM8K 分数从 58.0% 增加到 70.7%。适配后的架构不仅可能提供更好的起点,而且对指令调优的响应更有效,最终导致一个实质上更强大和更有用的最终模型。
我们很兴奋地推出这种通过从预训练仅解码器 LLM(如 Gemma 2)适配来构建强大、通用编码器-解码器模型的新方法。为了帮助加速进一步的研究并允许社区在这项工作基础上发展,我们很兴奋地发布一套我们的 T5Gemma 检查点。此次发布包括:
多种大小:T5 规模模型(Small、Base、Large 和 XL)的检查点、基于 Gemma 2 的模型(2B 和 9B),以及介于 T5 Large 和 T5 XL 之间的额外模型。
多个变体:预训练和指令调优模型。
灵活配置:强大高效的不平衡 9B-2B 检查点,以探索编码器和解码器大小之间的权衡。
不同的训练目标:使用 PrefixLM 或 UL2 目标训练的模型,以提供最先进的生成性能或表示质量。
我们希望这些检查点将为调查模型架构、效率和性能提供宝贵的资源。
我们迫不及待地想看到你用 T5Gemma 构建的内容。请查看以下链接了解更多信息:
通过阅读论文了解这个项目背后的研究。
下载模型:在 Hugging Face 和 Kaggle 上查找模型权重。
使用 Colab notebook 探索模型能力或为你自己的用例微调它们。
在 Vertex AI 上使用模型运行推理。