Allen AI 开源大语言模型及全部训练数据和细节,程序员可自行部署、微调和研究。
随着世界竞相部署有效且安全的AI模型,对开源大语言模型(LLM)的需求已经爆炸式增长。开源和闭源AI模型的大规模采用意味着AI能力的发展已经超越了我们理解其创建方式的能力。发布OLMo框架将为行业提供一个机会来理解AI模型内部的工作原理。
今天,艾伦人工智能研究所(Ai2)发布了OLMo 7B,这是一个真正开源、最先进的大语言模型,同时公开了预训练数据和训练代码。这使研究人员和开发者能够使用最好的开源模型来共同推进语言模型科学的发展。
"开源基础模型在推动生成式AI创新和发展浪潮中至关重要,"Meta首席AI科学家Yann LeCun表示。"开源社区所带来的充满活力的生态是建设AI未来最快速、最有效的方式。"
OLMo和该框架旨在帮助研究人员训练和实验大语言模型。这些资源可在Hugging Face和GitHub上直接下载。这项工作得以实现,部分源于与哈佛大学自然与人工智能研究Kempner研究所的合作,以及包括AMD、CSC(Lumi超级计算机)、华盛顿大学Paul G. Allen计算机科学与工程学院和Databricks等合作伙伴的支持。
该框架包含一整套完全开源的AI开发工具,包括:
完整的预训练数据:该模型基于Ai2的Dolma数据集构建,该数据集包含一个包含三万亿个token的开源语料库用于语言模型预训练,还包括生成训练数据的代码。
训练代码和模型权重:OLMo框架包含四个7B规模模型变体的完整模型权重,每个都至少训练到2T个token。还提供了推理代码、训练指标和训练日志。
评估:我们发布了开发中使用的评估套件,包含每个模型500+个检查点,涵盖训练过程中每1000步的评估,以及Catwalk项目下的评估代码。
"我很高兴能让OLMo进入AI研究人员手中,"微软首席科学官、Ai2科学顾问委员会创始成员Eric Horvitz表示。"这一新贡献延续了Allen AI提供有价值的开源模型、工具和数据的传统,这些已在全球AI社区中激发了众多进步。"
通过让OLMo及其训练数据完全向公众开放,Ai2在协力构建世界上最好的开源语言模型方面迈出了一大步。在接下来的几个月里,Ai2将继续迭代OLMo,并将推出不同规模、模态、数据集和能力的OLMo系列产品。
"许多当今的语言模型发布时透明度有限。没有获取训练数据的权限,研究人员无法科学地理解模型如何工作。这相当于没有临床试验的药物发现,或者没有望远镜研究太阳系,"OLMo项目负责人、Ai2自然语言处理研究高级主任、华盛顿大学Allen学院教授Hanna Hajishirzi表示。"通过我们的新框架,研究人员终于能够研究LLM的科学原理,这对构建下一代安全可信的AI至关重要。"
通过OLMo,AI研究人员和开发者将体验到:
更高精度:充分了解模型背后的训练数据,研究人员能够工作得更快,不再需要依赖对模型性能的定性假设,而是能够进行科学验证。
更低碳排:目前一次训练运行产生的碳排放相当于美国九户家庭一年的排放量。通过开放完整的训练和评估生态系统,能够大幅减少开发冗余,这对AI的碳去商业化至关重要。
持久成果:将模型和数据集保持在开放状态而非隐藏在API后面,使研究人员能够从以前的模型和工作中学习和构建。
"通过OLMo,开源真正意味着'开源',所有AI研究社区成员都能获得模型创建的所有方面,包括训练代码、评估方法、数据等,"OLMo项目负责人、Ai2自然语言处理研究高级主任、华盛顿大学Allen学院教授Noah Smith表示。"AI曾经是一个以活跃研究社区为中心的开放领域,但随着模型规模扩大、成本上升并开始演变成商业产品,AI工作开始在幕后进行。通过OLMo,我们希望扭转这一趋势,为研究社区赋能,使其能够聚集在一起,以科学的方式更好地理解和参与语言模型,从而开发出更负责任的AI技术,造福所有人。"
"凭借Ai2在自然语言处理领域的深厚专业知识,结合AMD高性能计算引擎,在由AMD EPYC™ CPU和AMD Instinct™加速器驱动的LUMI超级计算机上开发的OLMo模型提供了一个独特的机会,真正扩展AI实验和创新,以前所未有的方式推进该行业的发展。这个新的开源框架将为全球AI研究社区提供可信赖的资源和一个平台,让他们能够为语言模型做出贡献并直接开展工作。" - AMD高级主任、AI解决方案部Ian Ferreria
"我们很高兴能够通过提供LUMI超级计算机的计算能力和我们的专业知识为这一重要举措做出贡献。LUMI等公共超级计算机在开放和透明AI的基础设施中发挥了至关重要的作用。" -CSC科学技术主任Dr. Pekka Manninen
芬兰的LUMI超级计算机由CSC主办,由欧洲高性能计算联合企业和10个欧洲国家所有。LUMI是欧洲最快的超级计算机,以完全零碳排运营而闻名,在支持开发OLMo所需的预训练工作中发挥了关键作用。
"Databricks很高兴能与艾伦人工智能研究所合作发布他们的OLMo开源模型和框架。OLMo为什么叫'开源'树立了标准。学术界、工业界和更广泛的社区都将从访问不仅是模型,还有所有训练细节(包括数据、代码和中间检查点)中获得巨大收益。我特别感到自豪的是,这个模型是在Databricks的Mosaic AI模型训练平台上开发的。与所有伟大的开源发布一样,现在这些工件和工具已掌握在社区手中,最好的时刻还在前面。" - Databricks首席科学家(神经网络)Jonathan Frankle
开始使用OLMo技术博客
欲了解更多关于OLMo框架和艾伦人工智能研究所的信息,请访问此处。
订阅以接收关于Ai2最新新闻的每月更新。