Viking 7B:AMD训练的北欧语言开源模型
7B参数开源模型专针对北欧语言优化,可本地部署。但地域针对性强,全球受众有限。
7B参数开源模型专针对北欧语言优化,可本地部署。但地域针对性强,全球受众有限。
图尔库大学的 TurkuNLP 研究团队、HPLT 与欧洲最大的私营 AI 实验室 Silo AI 携手发布首个覆盖所有北欧语言的多语言大型语言模型(LLM)。Viking 7B 是一款业界领先的开源模型,能够感知当地价值观与文化,也进一步证明了该团队在训练面向低资源语言的高性能 LLM 方面所采用的创新方法。这是迈向覆盖所有欧洲语言的顶尖 LLM 系列过程中的一个重要里程碑。
继语言模型 Poro 训练完成以及 Viking 首个 checkpoint 发布之后,Silo AI 与图尔库大学 TurkuNLP 现正式发布拥有完整 7B 参数的 Viking 版本。同时,我们还发布了 Viking 13B 和 Viking 33B 模型的更多 checkpoint。除了北欧语言,Viking 还覆盖英语和编程语言。评估结果显示,它在所有北欧语言上的表现均达到业界领先水平,同时没有牺牲英语性能。
Viking 沿用了与 Poro 相同的训练方法:专注于低资源语言,同时不牺牲英语性能;在此基础上,它进一步加入了丹麦语、芬兰语、挪威语、冰岛语、瑞典语以及编程语言。该模型系列还采用了更新后的架构,并提供多种模型规模。
基于 Silo AI 推动 LLM 民主化普及、促进欧洲语言多样性的战略,此次与 TurkuNLP 的合作采用了多语言 LLM 领域的最新进展。与大多数其他 LLM 不同,我们将低资源语言的性能放在优先位置,而不是把它们当作事后的补充。团队一直致力于确定能够实现这一目标的最佳训练方法和架构。这既包括适合预训练的最优模型架构,也包括其他训练与数据采样方法,例如在训练过程中设置低资源语言数据的最佳复用频率,以及引入高资源语言与低资源语言之间经过翻译的配对文本。这些策略中有多项依赖跨语言信号来增强模型对语言之间联系的理解。事实证明,这对于在不牺牲英语性能的前提下,让低资源语言获得更出色的表现至关重要。
Silo AI 与 TurkuNLP 致力于开发不仅在语言性能和包容性方面表现卓越,而且能够适应当地价值观与文化的模型。这种敏感性可以确保相关技术进步在数字通信中发挥连接作用,而不是制造隔阂。它将增强欧洲的数字基础设施,从而加快 LLM 驱动型产品与应用的普及。进一步而言,这将推动欧洲各行业、各类使用场景的创新,强化欧洲大陆的技术生态系统。
为了进一步彰显数字主权,Viking 使用 EuroHPC 超级计算机 LUMI 进行训练,最多动用了 4096 块 AMD MI-250X GPU。LUMI 不仅是欧洲性能最强、全球性能排名第五的超级计算机,还是全球 Top 500 超级计算机中环保程度排名第三的超级计算机。LUMI 消耗的电力 100% 来自水力发电,其产生的废热将满足所在城市卡亚尼约 20% 的区域供暖需求。
借助专门为在 AMD 平台上训练模型而构建的软件层,Silo AI 与 TurkuNLP 在使用 AMD 进行大规模训练方面拥有无可比拟的经验。他们已经通过弱扩展和强扩展实验,证明其有关吞吐量扩展的理论预测能够在实践中实现。作为 AMD GPU 上具有开创性意义的项目之一,该项目展示了如何在基于 AMD 的 LUMI 上获得良好吞吐量:使用团队的开源训练框架训练模型,并同时调用最多 4096 块 MI-250X GPU。
截至目前,Viking 7B 的训练进度已达到 100%,13B 达到 85%,33B 达到 65%。通过常见 benchmark,我们可以看到 Viking 优于其他开放模型(例如 Falcon、GPT-SW3、Llama、Mistral、MPT 等)的证据。结果表明,与其他开放模型相比,Viking 在低资源语言上的表现达到了业界领先水平,同时没有牺牲英语和编程语言方面的性能。在最新一轮评估中,我们使用了大量相关指标对 Viking 进行 benchmark 测试,其中包括翻译后的测试、MMLU、Arc-C、HellaSwag 等。虽然翻译后的测试得到了广泛使用——例如用于证明 Mistral Large 的多语言能力——并能提供具有参考价值的证据,但它们无法完整反映语言模型的多语言推理能力。另一项指标 perplexity 也进一步佐证了 Viking 的性能。总体而言,Viking 不仅展现了理解和生成北欧语言的能力,也凸显了它在处理和预测语言序列方面的效率。这种双重优势既表明训练多语言模型的这套方法切实可行,也体现了 Viking 在应对多语言复杂性方面的技术优势。
以下汇总了 Viking 模型系列的主要特性。该系列覆盖英语、芬兰语、瑞典语、挪威语、丹麦语、冰岛语以及代码。有关模型架构、数据和其他技术信息的透明披露,请参阅官方 model card(Viking 7B、Viking 13B、Viking 33B)。
研究 checkpoint: Silo AI 与 TurkuNLP 承诺在整个训练过程中持续发布 checkpoint,确保模型训练过程透明可见。
模型架构: Viking 采用与 Llama 2 类似的架构,包含 flash attention、rotary embeddings 和 grouped query attention,并支持 4k 序列长度。
模型规模: 7B、13B 和 33B 参数。
多语言能力: 这些模型专为处理英语和北欧语言而设计,同时熟悉多种编程语言。此外,它们还能在英语与北欧语言之间进行基础翻译。
数据集: 该模型系列使用包含 2 万亿个 token 的数据集进行训练,其中涵盖丹麦语、英语、芬兰语、冰岛语、挪威语、瑞典语以及多种编程语言。
开源: 该模型系列采用 Apache 2.0 License 免费开放,可用于商业和研究用途。
训练硬件: 我们的模型使用位于芬兰的 LUMI 超级计算机进行训练,最多动用了 4096 块 AMD MI250X GPU。
Poro 研究 checkpoint 的目标用户是学术界和工业界的研究人员。如果没有经过进一步训练、fine-tuning 和测试,这些 checkpoint 并不适合直接部署到生产使用场景中。如需进一步了解 Silo AI 基于 SaaS 的定制 LLM,欢迎了解 SiloGen 平台。
我们谨向 LUMI/EuroHPC 超级计算机的运营方致谢,感谢他们提供计算资源和技术支持,其中包括 AMD、HPE,以及芬兰科学信息技术中心 CSC。TurkuNLP 的研究人员获得了欧盟 Horizon Europe 研究与创新计划 High Performance Language Technologies(HPLT)项目的资助,资助协议编号为 101070350。