ETH Zurich 和 EPFL 联合发布基于公共基础设施的开源 LLM,为程序员提供新的模型选择。
人工智能
创新与产业
ETH Zurich 和 EPFL 将发布一款基于公共基础设施开发的大型语言模型(LLM)。这款新 LLM 在 Swiss National Supercomputing Centre(CSCS)的“Alps”超级计算机上完成训练,是开源 AI 和卓越多语言能力发展历程中的一个重要里程碑。
mode_comment 评论数
2025 年夏末,一款由公共机构开发的大型语言模型(LLM)将正式发布。该模型由 EPFL、ETH Zurich 和 Swiss National Supercomputing Centre(CSCS)的研究人员共同打造。
这款 LLM 将完全开放。此举旨在推动模型得到广泛采用,并促进科学、社会和产业领域的创新。
该模型的一大特色,是支持超过 1,000 种语言的多语言能力。
本周早些时候,约 50 个致力于开源 LLM 和可信 AI 的全球领先项目及组织齐聚日内瓦,参加 International Open-Source LLM Builders Summit。本次活动由 EPFL 和 ETH Zurich 的 AI 中心主办,标志着构建一个充满活力、协作紧密的国际开放基础模型生态迈出了重要一步。开放 LLM 正日益被视为商业系统的可靠替代方案,而后者大多由美国或中国的企业闭门开发。
峰会参与者提前了解了这款即将发布的、完全开放且由公共机构开发的 LLM。该模型由 EPFL、ETH Zurich 及瑞士其他高校的研究人员与 CSCS 工程师密切合作,共同打造。目前模型正处于最终测试阶段,发布后可依据开放许可证下载。该模型重点关注透明度、多语言性能和广泛的可访问性。
该模型将完全开放:源代码和权重将公开提供,训练数据也将保持透明且可复现,从而支持科学、政府、教育和私营部门采用。这种方式旨在同时促进创新和问责。
“完全开放的模型能够支持高度可信的应用,也是推进 AI 风险与机遇研究的必要条件。透明的流程还有助于满足监管合规要求。”ETH AI Center 研究科学家 Imanol Schlag 表示。他正与 EPFL AI Center 的教职人员 Antoine Bosselut 教授和 Martin Jaggi 教授共同领导这项工作。
该模型的一大特色,是能够处理超过 1,000 种语言。“从一开始,我们就特别重视让模型具备大规模多语言能力。”Antoine Bosselut 表示。
基础模型使用一个涵盖超过 1,500 种语言的大型文本数据集进行训练,其中约 60% 为英语内容,40% 为非英语内容,同时还包含代码和数学数据。由于训练内容覆盖了各种语言和文化,最终得到的模型具备极高的全球适用性。
该模型将发布两个规模的版本,分别拥有 80 亿和 700 亿参数,以满足广泛的用户需求。700 亿参数版本将跻身全球最强大的完全开放模型之列。参数数量反映了模型学习和生成复杂回答的能力。
模型使用超过 15 万亿个高质量训练 token(表示一个单词或单词一部分的单位)完成训练,从而实现了较高的可靠性、稳健的语言理解能力,并能够适用于多种使用场景。
这款 LLM 的开发充分考虑了瑞士数据保护法、瑞士版权法,以及 EU AI Act 规定的透明度义务。在近期的一项外部页面研究中,项目负责人证明:对于大多数日常任务和通用知识获取场景,在采集数据时尊重网站拒绝网络爬取的设置,几乎不会造成性能下降。
该模型在位于卢加诺 CSCS 的“Alps”超级计算机上完成训练。“Alps”是全球最先进的 AI 平台之一,配备超过 10,000 颗 NVIDIA Grace Hopper Superchips。该系统的规模和架构,使研究人员能够使用 100% 碳中和电力高效训练模型。
“Alps”能够成功落地,很大程度上得益于与 NVDIA 和 HPE/Cray 长达 15 年以上的合作。这一合作伙伴关系对塑造“Alps”的能力发挥了关键作用,确保其能够满足大规模 AI 工作负载的严苛要求,包括复杂 LLM 的预训练。
“只有依靠我们对‘Alps’的战略投资,训练这款模型才成为可能。这是一台专为 AI 打造的超级计算机。”CSCS 主任、ETH Zurich 教授 Thomas Schulthess 表示,“我们与 NVIDIA 和 HPE 长期以来的合作,充分体现了公共研究机构与行业领导者如何通过共同努力推动主权基础设施建设、促进开放创新——其意义不仅限于瑞士,也惠及全球的科学界和社会。”
今年夏末,这款 LLM 将依据 Apache 2.0 License 发布。配套文档将详细介绍模型架构、训练方法和使用指南,以支持透明复用和后续开发。
“作为来自公共机构的科学家,我们希望推动开放模型的发展,并让各类组织能够以这些模型为基础,构建自己的应用。”Antoine Bosselut 表示。
“商业模型是在闭门环境中开发的,而我们选择完全开放。我们希望这种方式能够推动瑞士、整个欧洲以及跨国合作中的创新。此外,这也是吸引和培养顶尖人才的关键因素。”EPFL 教授 Martin Jaggi 表示。
Swiss AI Initiative 于 2023 年 12 月由 EPFL 和 ETH Zurich 发起,得到了瑞士各地 10 多家学术机构的支持。目前已有超过 800 名研究人员参与,并且每年可使用 CSCS“Alps”超级计算机提供的超过 2,000 万 GPU 小时。它是目前全球规模最大的、专注于 AI 基础模型的开放科学与开源项目。
在 2025 年至 2028 年期间,Swiss AI Initiative 将获得 ETH Board 的资金支持。ETH Board 是 ETH Domain(ETH、EPFL、PSI、WSL、Empa、Eawag)的战略管理和监督机构。
Swiss AI Initiative 由 ETH AI Center 和 EPFL AI Center 的研究人员领导。这两个中心同时也是 ELLIS(European Laboratory for Learning and Intelligent Systems)的地区分支机构。ELLIS 是一个覆盖整个欧洲的 AI 网络,重点关注可信 AI 的基础研究、技术创新,以及欧洲开放社会中的社会影响。
Swiss National Supercomputing Centre(CSCS)是 LUMI Consortium 的成员和合作伙伴,使瑞士科学家能够使用位于芬兰卡亚尼的领先基础设施。这与 CSCS 的战略一致:通过跨国合作,利用水力发电和冷却资源充足的地区,横向扩展未来规模大得多的极大规模计算基础设施,从而推动 AI 研究与创新,确保其具备全球相关性并产生区域影响。
本文英文版的先前版本曾使用模型“流利掌握超过 1,000 种语言”的表述。现已将这一说法改为“具备相应能力”,以准确反映该模型有意使用超过 1,000 种语言的数据进行了训练,并在其中许多传统上未被 AI 系统充分支持的语言上展现出更强的能力。2025 年 7 月 22 日
订阅 Newsletter
创新与产业
人工智能
计算机与信息技术