Open Assistant:开源 LLM 民主化倡议
社区驱动的开源项目提供免费高质量聊天 LLM,让程序员摆脱商业模型依赖,改变工具生态
社区驱动的开源项目提供免费高质量聊天 LLM,让程序员摆脱商业模型依赖,改变工具生态
Open Assistant 是一个旨在让每个人都能访问优秀的基于聊天的大语言模型的项目。
我们相信,通过这样做,我们将在语言创新中掀起一场革命。正如 stable-diffusion 帮助世界以新的方式创作艺术和图像一样,我们希望 Open Assistant 能够通过改进语言本身来帮助改善世界。
聊天前端现已上线。登录并开始聊天吧!请在与助手聊天时,用赞或踩的反应来评价助手的回复。
数据收集前端现已上线。登录并开始接任务吧!我们希望收集高质量的数据。通过提交、排序和标注模型提示和响应,你将直接帮助改进 Open Assistant 的能力。
除非你参与开发过程,否则无需在本地运行该项目。上述网站链接将带你到公共网站,你可以在那里使用数据收集应用和聊天。
如果你想在本地运行数据收集应用进行开发,可以使用 Docker 来设置运行 Open Assistant 所需的整个堆栈,包括网站、后端和相关的依赖服务。
要启动演示,在仓库根目录中运行此命令(如有问题,请查看此 FAQ):
docker compose --profile ci up --build --attach-dependencies
注意:在配备 M1 芯片的 MacOS 上运行时,必须使用:DB_PLATFORM=linux/x86_64 docker compose ...
然后,导航到 http://localhost:3000(启动可能需要一些时间),与网站交互。
注意:如果构建过程出现问题,请前往 FAQ 并查看有关 Docker 的条目。
注意:通过电子邮件登录时,导航到 http://localhost:1080 获取魔法登录链接。
注意:如果你想在标准化开发环境("devcontainer")中使用本地 vscode 或通过 GitHub Codespaces 使用网页浏览器运行此项目,可以使用提供的 .devcontainer 文件夹。
除非你参与开发过程,否则无需在本地运行该项目。上述网站链接将带你到公共网站,你可以在那里使用数据收集应用和聊天。
还要注意,本地设置仅用于开发,不应作为本地聊天机器人使用,除非你知道自己在做什么。
如果你确实知道自己在做什么,请查看 inference 文件夹来启动推理系统,或除了上述命令中的 --profile ci 外,还查看 --profile inference。
我们不会止步于复制 ChatGPT。我们想要构建未来的助手,不仅能够编写电子邮件和求职信,还能完成有意义的工作、使用 API、动态研究信息等等,并且具有可被任何人个性化和扩展的能力。我们希望以开放和可访问的方式来实现这一点,这意味着我们不仅必须构建一个伟大的助手,还要使其足够小巧和高效,能够在消费级硬件上运行。
收集高质量的人类生成的指令-完成样本(提示 + 响应),目标 >50k。我们设计了一个众包流程来收集和审查提示。我们不希望在泛滥的、有毒的、垃圾的、无用的或包含个人信息的数据上进行训练。我们将有一个排行榜来激励社区、显示进度和最活跃的用户。最高贡献者将获得赠品。
对于每个收集到的提示,我们将抽样多个完成。同一提示的完成将随机展示给用户,让他们从最佳到最差进行排序。同样,这应该众包进行,例如我们需要处理不可靠的、可能恶意的用户。必须收集至少来自独立用户的多票投票来衡量整体一致性。收集到的排序数据将用于训练一个奖励模型。
然后进行基于提示和奖励模型的 RLHF 训练阶段。
然后我们可以采用产生的模型并继续进行下一次迭代的第 2 步完成抽样。
所有开源项目都始于像你这样的人。开源是这样一种信念:如果我们协作,我们可以一起将我们的知识和技术赠予世界,造福人类。
查看我们的贡献指南来开始吧。