Apertus 70B:瑞士完全开源 LLM 正式发布
ETH、EPFL 和 CSCS 联合发布 70B 参数的完全开源模型,强调透明性和本地可部署。为需要自主控制或微调的开发者提供高质量的选择。
ETH、EPFL 和 CSCS 联合发布 70B 参数的完全开源模型,强调透明性和本地可部署。为需要自主控制或微调的开发者提供高质量的选择。
Apertus 是一款拥有 70B 和 8B 参数规模的语言模型,旨在突破完全开放、多语言、透明模型的边界。该模型支持 1000 多种语言和长上下文,仅使用完全合规且开放的训练数据,性能可媲美闭门训练的模型。
该模型采用仅解码器(decoder-only)Transformer 架构,使用由 Web、代码和数学数据组成的分阶段课程,在 15T tokens 上完成预训练。模型采用全新的 xIELU 激活函数,并使用 AdEMAMix 优化器从零开始训练。后训练阶段包括监督微调,以及通过 QRPO 进行对齐。
完全开放的模型:开放权重 + 开放数据 + 完整训练细节,包括全部数据和训练方法。
大规模多语言:原生支持 1811 种语言。
合规:Apertus 在训练过程中尊重数据所有者的退出(opt-out)意愿,即使是追溯提出的退出请求也不例外,同时避免记忆训练数据。
更多详情请参阅我们的技术报告。
Apertus 的建模代码已在 transformers v4.56.0 及更高版本中提供,因此请务必升级 transformers 版本。你也可以使用最新版 vLLM 加载该模型,vLLM 使用 transformers 作为后端。
pip install -U transformers
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "swiss-ai/Apertus-70B-2509"
device = "cuda" # for GPU usage or "cpu" for CPU usage
# load the tokenizer and the model
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
model_name,
).to(device)
# prepare the model input
prompt = "Give me a brief explanation of gravity in simple terms."
messages_think = [
{"role": "user", "content": prompt}
]
text = tokenizer.apply_chat_template(
messages_think,
tokenize=False,
add_generation_prompt=True,
)
model_inputs = tokenizer([text], return_tensors="pt").to(model.device)
# Generate the output
generated_ids = model.generate(**model_inputs, max_new_tokens=32768)
# Get and decode the output
output_ids = generated_ids[0][len(model_inputs.input_ids[0]) :]
print(tokenizer.decode(output_ids, skip_special_tokens=True))
我们建议在采样参数中设置 temperature=0.8 和 top_p=0.9。
Apertus 默认支持最长 65,536 tokens 的上下文长度。
最新版本的 Transformers、vLLM 和 SGLang 均直接支持模型部署;此外,还可通过 MLX 在设备端运行。
Apertus 模型在通用语言理解任务上的性能(%),与其他预训练模型进行比较,数值越高越好。
Apertus 技术报告第 5 节提供了更多基准评估结果,包括预训练和后训练阶段评估、覆盖约 100 种语言的多语言评估,以及长上下文评估。
架构:Transformer decoder
预训练 tokens:15T
训练框架:Megatron-LM
训练过程中使用的所有要素均已公开提供。
训练数据重建脚本:github.com/swiss-ai/pretrain-data
训练过程中的中间 checkpoints 可在该仓库的不同分支中获取。
Apertus 可以生成涵盖各种主题的文本,但生成内容未必始终事实准确、逻辑一致,也可能包含训练数据中存在的偏见。这些模型应被用作辅助工具,而不是权威的信息来源。用户应始终核实重要信息,并对所有生成内容进行审慎评估。
Apertus_EU_Public_Summary.pdf
Apertus_EU_Code_of_Practice.pdf
如需请求移除个人身份信息(PII)或受版权保护的内容,请联系相应的数据集所有者,或直接联系我们:
llm-privacy-requests@swiss-ai.org
llm-copyright-requests@swiss-ai.org
目前尚未提供输出过滤器。
请定期查看此网站,以获取可用于 Apertus LLM 输出之上的过滤器。该过滤器会反映向我们——Apertus LLM 的开发者——提出并已得到处理的数据保护删除请求。它可以帮助你移除模型输出中包含的个人数据。我们强烈建议每六个月从该网站下载并应用一次输出过滤器。
如需联系我们,请发送电子邮件至 llm-requests@swiss-ai.org。
@misc{swissai2025apertus,
title={{Apertus: Democratizing Open and Compliant LLMs for Global Language Environments}},
author={Alejandro Hernández-Cano and Alexander Hägele and Allen Hao Huang and Angelika Romanou and Antoni-Joan Solergibert and Barna Pasztor and Bettina Messmer and Dhia Garbaya and Eduard Frank Ďurech and Ido Hakimi and Juan García Giraldo and Mete Ismayilzada and Negar Foroutan and Skander Moalla and Tiancheng Chen and Vinko Sabolčec and Yixuan Xu and Michael Aerni and Badr AlKhamissi and Ines Altemir Marinas and Mohammad Hossein Amani and Matin Ansaripour and Ilia Badanin and Harold Benoit and Emanuela Boros and Nicholas Browning and Fabian Bösch and Maximilian Böther and Niklas Canova and Camille Challier and Clement Charmillot and Jonathan Coles and Jan Deriu and Arnout Devos and Lukas Drescher and Daniil Dzenhaliou and Maud Ehrmann and Dongyang Fan and Simin Fan and Silin Gao and Miguel Gila and María Grandury and Diba Hashemi and Alexander Hoyle and Jiaming Jiang and Mark Klein and Andrei Kucharavy and Anastasiia Kucherenko and Frederike Lübeck and Roman Machacek and Theofilos Manitaras and Andreas Marfurt and Kyle Matoba and Simon Matrenok and Henrique Mendoncça and Fawzi Roberto Mohamed and Syrielle Montariol and Luca Mouchel and Sven Najem-Meyer and Jingwei Ni and Gennaro Oliva and Matteo Pagliardini and Elia Palme and Andrei Panferov and Léo Paoletti and Marco Passerini and Ivan Pavlov and Auguste Poiroux and Kaustubh Ponkshe and Nathan Ranchin and Javi Rando and Mathieu Sauser and Jakhongir Saydaliev and Muhammad Ali Sayfiddinov and Marian Schneider and Stefano Schuppli and Marco Scialanga and Andrei Semenov and Kumar Shridhar and Raghav Singhal and Anna Sotnikova and Alexander Sternfeld and Ayush Kumar Tarun and Paul Teiletche and Jannis Vamvas and Xiaozhe Yao and Hao Zhao Alexander Ilic and Ana Klimovic and Andreas Krause and Caglar Gulcehre and David Rosenthal and Elliott Ash and Florian Tramèr and Joost VandeVondele and Livio Veraldi and Martin Rajman and Thomas Schulthess and Torsten Hoefler and Antoine Bosselut and Martin Jaggi and Imanol Schlag},
year={2025},
howpublished={\url{https://arxiv.org/abs/2509.14233}}
}
swiss-ai/Apertus-70B-2509 的模型树
使用 swiss-ai/Apertus-70B-2509 的 Spaces:2 个
包含 swiss-ai/Apertus-70B-2509 的 Collection
与 swiss-ai/Apertus-70B-2509 相关的论文