补充了非英语 LLM 生态的开源项目,技术可参考但主要面向德语市场,适用范围相对有限。
作者:Björn Plüster,2023 年 9 月 28 日
我们荣幸推出 LeoLM(Linguistically Enhanced Open Language Model),首个全面的德语基础语言模型套件,与 HessianAI 在其新超级计算机 42 上合作训练!基于 Llama-2 构建,在大规模高质量德语文本语料库上训练,我们呈现 LeoLM-7B 和 13B,LeoLM-70B 即将推出,并随附一系列德语和双语对话模型。
认识 LeoLM,首个基于 Llama-2 构建的开放且商业可用的德语基础语言模型。我们的模型通过在大量高质量德语和主要是区域特定文本语料库上的持续预训练,将 Llama-2 的能力扩展到德语。得益于 HessianAI 新超级计算机 42 上的计算拨款,我们在 Llama-2 社区许可证下发布两个训练有 8k 上下文长度的基础模型,LeoLM/leo-hessianai-7b 和 LeoLM/leo-hessianai-13b(70b 也即将推出!👀)。此外,我们构建了用于对标德语语言模型能力的评估集,以标准化模型对比,类似于广泛采用的英文评估集,如 lm-harness-eval 或 LLM-Foundry 提供的那样。通过此次发布,LAION 和 Hessian.AI 将显著增强德语开源和商业 LLM 研究,促进新机遇并加速广泛采用。
在 HuggingFace Spaces 上试试 LeoLM/leo-hessianai-7b-chat 和 LeoLM/leo-hessianai-13b-chat!
自 2023 年 1 月原始 Llama Foundation Models 发布以来,开源和学术研究社区在开发日益强大的语言模型方面经历了快速加速。过去几周的进展已将最强大的基于 Llama-2 的模型拉近到与 OpenAI 基于 GPT-3.5 的 ChatGPT 竞争的距离,在某些情况下甚至接近更强大的 GPT-4。然而,一个值得注意的限制仍然存在:这些突破性进展的绝大多数仍局限于英文领域。这个限制主要源于大型开源模型主要在单语英文数据上训练。虽然已有一些关于二语言或多语言微调的研究,但大多数得到的模型能力受限,并受到英文数据中固有的美国中心偏见的影响。
我们寻求通过应用当今许多最先进的技术来开发真正能干的、本地化的和双语 LLM,以德语为例缓解这些问题。为此,我们呈现 LeoLM(Linguistically Enhanced Open Language Model),一套基于 Llama-2 的德语基础模型,以及一系列伴随的微调。此外,我们呈现 GermanBench,最相关的英文基准的集合翻译成德语,使我们能够彻底评估 LeoLM 的能力。
Llama-2 模型在 2 万亿个主要为英文的文本令牌上预训练。为了增强它们在德语中的熟练度,我们采用了第二阶段预训练方法。我们用 Llama-2 权重初始化 LeoLMs,并继续在包含 650 亿个令牌的大型德语文本语料库上训练模型,该语料库由故意过滤和去重的网络文本构建,来自 OSCAR-2301 语料库。这种方法的一个重要方面是减轻遗忘或丧失先前学习的知识或能力。我们遵循 Gupta et al. (2023) 的发现来选择超参数,以最小化遗忘风险。此外,我们遵循 Together 的工作,采用线性 RoPE 缩放和 Flash Attention 2 来提高训练效率并将上下文长度加倍至 8k 令牌。见图 1 了解所有训练超参数的概览。
关于什么是好的对话/指令微调数据集存在许多争议,引发了大量不同的、成功的方法的开发。我们从这种多样性中获得灵感,为了将类似的能力带到德语,我们使用 OpenAI 的 gpt-3.5-turbo API 将一系列高质量指令数据集翻译成德语。使用 gpt-3.5-turbo 确保提示和响应之间的上下文保持完整,复杂的指令(可能包含代码、方程或格式化数据)被准确翻译。建立在社区发现之上,我们选择了多种数据集来翻译和用于训练我们的对话模型。翻译后的数据集为:
OpenPlatypus -> OpenSchnabeltier
OpenAssistant OASST1 -> OpenAssistant-DE
此外,我们使用 FreedomIntelligence/evol-instruct-deutsch 和 FreedomIntelligence/alpaca-gpt4-deutsch,来自 MultilingualSIFT 项目。感谢作者分享他们的数据!为了便于双语使用,我们还在这些翻译数据集和其原始英文对应部分的组合上训练模型。
最后,为了弥补早期测试中发现的创意写作和韵律方面的弱点,我们策划了另外两个数据集:
GPT4 Poems:关于不同主题由 GPT4 编写的德语诗歌集
GPT4 Songs:由 GPT4 编写的德语歌曲和后续分析的集合。
评估 LLMs 的能力,特别是对话模型,很复杂,最佳方法仍有争议。基于多选择并通过模型对数概率评估的 Benchmark(如开放 LLM 排行榜中的)是目前一种流行的方法。另一种方法使用 GPT-4 自动评估响应,如 AlpacaEval 或 MT-Bench。这种方法更面向对话模型,因为它考虑了模型在真实任务中响应的质量。为了尽可能可比,我们直接将一组英文基准翻译成德语。我们在我们的 HF Organization 中发布这些数据集,并在 GitHub 上有更详细的文档,你可以在此处找到相应的 lm-evaluation-harness fork,在此处找到 FastEval fork。
在图 3 中,你可以看到 LeoLM 与基础 Llama-2 模型在一系列基准上的对比,包括英文版本(蓝色)和我们翻译的版本(绿色)。我们的训练提高了德语任务的基准分数,同时轻微降低了英文任务的分数。值得注意的是,德语基准分数的平均增长远远超过英文基准性能的平均下降,表明我们的方法能够学习新语言而不忘记先前学到的知识。为什么德语分数仍然低于英文的原因是个开放问题,但可能部分归因于翻译过程中的质量下降。
以下表格显示了我们翻译版本的 MT-Bench 上的结果。MT-Bench 是一个 Benchmark,使用 GPT-4 作为评判者评估对多回合表现的评估,包括来自多个类别的精选 80 个问题集。在这里,GPT-4 根据响应的感知有用性、相关性、准确性、深度、创意性和细节水平在 1-10 的范围内评估提示。单语 leo-hessianai-13b-chat 模型整体表现最好,甚至在"人文"主题中接近 GPT-3.5。它在数学和编码中的表现明显较差,这在某种程度上是预期的,因为 Llama-2 模型在没有非常明确微调的情况下在这些方面本身不足。双语模型在某些类别(如数学和推理)中的表现略低于单语对应模型,而在编码和提取中超越。
有关更详细的评估,敬请期待我们的论文!
Benchmark 往往很抽象。要更好地感受 LeoLM 的能力,请查看我们的演示并自己试试:LeoLM/leo-hessianai-7b-chat 和更大的兄弟 LeoLM/leo-hessianai-13b-chat。或者,你可以使用 🤗Transformers 自己运行模型。在模型卡上找到关于如何设置它的更多信息。
我们的研究有几个关键贡献:
我们发布了一套具有宽松许可证的德语基础语言模型。
我们将针对基础和对话模型的彻底和多方面的评估方法转移到德语。
我们证明了大规模持续预训练即使对于数据饱和的模型(如 Llama-2)也是可能的,而不会显著遗忘或丧失先前的能力。
我们呈现了一套多样化的指令/对话微调数据集,从英文翻译成德语,作为德国开源 LLM 研究社区的基础。
总的来说,LeoLM 模型套件是预训练模型语言获取的概念验证。此外,它呈现为首个符合当今标准的开放德语基础模型。我们在 LAION 希望启动德国开源研究社区,以减少对 OpenAI 等封闭来源商业来源的依赖。祝你使用 LeoLM 开心!
该项目由 Björn Plüster 主导,在 Christoph Schuhmann (LAION)、Patrick Schramowski (LAION, Hessian.AI, DFKI) 和 Jenia Jitsev (LAION, Juelich Supercomputing Center, Helmholtz Research Center Juelich) 的支持、指导和监督下进行。我们要感谢 hessian.AI 的伙伴们,特别是 Wolfgang Stille、Kristian Kersting、Florian Kieser 和 Patrick Diem,感谢他们通过黑森人工智能创新实验室(由黑森数字战略和创新部资助)和黑森人工智能服务中心(由联邦教育和研究部 (BMBF) 资助)提供的慷慨计算赞助,以及他们在整个训练过程中的支持!也要特别感谢来自汉堡大学的 Jae Hee Lee、Open-Assistant 的 Andreas Köpf 以及 LAION 的社区成员提供的有用反馈。也特别感谢黑森人工智能创新实验室、人工智能服务中心 hessian.AISC 和德国人工智能中心 (DFKI)。
此外,我们要明确感谢我们用于微调的数据集的创建者:OpenAssistant、FreedomIntelligence、garage-bAInd、WizardLM 和 Instruction-Tuning-with-GPT-4。
Open-Source 在人工智能研究中扮演重要角色,因为它促进了协作、创新和对技术的访问。以下是 open-source 在人工智能研究中特别重要的一些原因:
协作: 通过 open-source,研究者可以在项目上协作工作,交换想法和相互学习。这促进了研究者之间的合作,可以导致人工智能研究中更快速和更高效的进步。
透明度: Open-source 在人工智能研究中实现了透明度和可重复性。研究者可以看到、重现和改进他人的代码和方法,这便于结果验证和潜在弱点的识别。
技术访问: Open-source 使人工智能技术和工具对更广泛的受众可访问。这使较小的研究机构和个人能够访问他们可能无法获得的人工智能工具。由此,创新和研究也可以在传统中心之外得到促进。
创新: Open-source 通过为实验和新想法提供空间来促进人工智能研究中的创新。由于代码是开放的和对所有人都可访问的,研究者可以将其适应他们的具体需求并开发新的人工智能工具和技术。
学习: Open-source 使研究者能够相互学习。通过共享代码和方法,研究者可以从他人的经验中学习并改进自己的研究项目。
总之,open-source 是人工智能研究的一个重要方面,因为它促进了协作、透明度、技术访问、创新和学习。这使人工智能研究更有效率、更创新且更容易为更广泛的研究者和机构所获得。