开源图像生成模型支持本地 GPU 运行
开源模型可在个人显卡上运行,降低使用成本和部署难度,与 DALL-E 形成开源替代方案
开源模型可在个人显卡上运行,降低使用成本和部署难度,与 DALL-E 形成开源替代方案
更新于 2022 年 8 月 21 日:
Stable Diffusion 现在已经可以通过 Web 界面使用。登录后,你可以像使用 DALL-E 2 一样,通过文本 prompt 生成图像,并使用多个附加选项进行微调。与 DALL-E 2 类似,它对 prompt 也有限制,例如不能生成色情或暴力图像。
可以在本地或云端运行的 Stable Diffusion 模型将不再设有这些限制。该模型预计将在未来几天内发布到 Github。
你可以免费试用基于 Web 的 Stable Diffusion。花费不到 12 美元,即可购买大约 1000 次 prompt。实际可用的 prompt 次数取决于计算的复杂度以及图像的分辨率。
点击此处前往 Dreamstudio,即 Stable Diffusion 的 Web 界面。
原文发布于 2022 年 8 月 14 日:
OpenAI 的 DALL-E 2 迎来了免费的竞争对手。其背后是一场 AI 开源运动以及初创公司 Stability AI。
自 2021 年初以来,能够根据文本描述生成图像的人工智能技术一直在快速发展。当时,OpenAI 凭借 DALL-E 1 和 CLIP 展示了令人印象深刻的成果。此后一年里,开源社区利用 CLIP 开发了大量替代项目。到了 2022 年,OpenAI 发布了令人惊艳的 DALL-E 2,Google 展示了 Imagen 和 Parti,Midjourney 的用户规模达到数百万,Craiyon 生成的 AI 图像则席卷了社交媒体。
初创公司 Stability AI 现已宣布发布 Stable Diffusion。这是另一个类似 DALL-E 2 的系统,初期将通过 Discord 服务器,逐步向新的研究人员及其他群体开放。
测试阶段结束后,Stable Diffusion 将免费发布——代码和训练好的模型都将以开源形式公开。此外还会推出带有 Web 界面的托管版本,供用户测试该系统。
Stable Diffusion 是 Stability AI、RunwayML、LMU Munich、EleutherAI 和 LAION 的研究人员合作完成的成果。研究团体 EleutherAI 因 GPT-J-6B、GPT-NeoX-20B 等开源语言模型而闻名,同时也在开展多模态模型研究。
非营利组织 LAION(Large-scale Artificial Intelligence Open Network,大规模人工智能开放网络)通过开源的 LAION 5B 数据集提供了训练数据。团队在初期测试阶段结合人工反馈对其进行筛选,最终创建出 LAION-Aesthetics 训练数据集。
Runway 的 Patrick Esser 和 LMU Munich 的 Robin Rombach 负责领导该项目,项目建立在他们此前于 Heidelberg University 的 CompVis 小组所开展的工作之上。他们在那里创造了得到广泛使用的 VQGAN 和 Latent Diffusion。后者结合 OpenAI 与 Google Brain 的研究成果,成为 Stable Diffusion 的基础。
“爵士机器人。”作者:TheRealBissy#StableDiffusion #AIArt #AIArtwork @StableDiffusion pic.twitter.com/V6hBWZUuM9
Stability AI 成立于 2020 年,背后的支持者是数学家兼计算机科学家 Emad Mostaque。他曾在多家对冲基金担任分析师数年,之后转向公共事业。2019 年,他协助创立了 Symmitree,这个项目旨在降低弱势群体使用智能手机和互联网的成本。
Mostaque 希望通过 Stability AI 和自己的私人财富,推动 AI 开源研究社区的发展。例如,他的初创公司此前曾支持创建“LAION 5B”数据集。为了训练 Stable Diffusion 模型,Stability AI 提供了配备 4000 块 Nvidia A100 GPU 的服务器。
“除了我们的 75 名员工,没有任何人拥有投票权——没有亿万富翁、大型基金、政府,也没有任何其他能够控制公司或我们所支持社区的主体。我们完全独立。”Mostaque 对 TechCrunch 表示,“我们计划利用自己的算力,加速开源基础 AI 的发展。”
目前,Stable Diffusion 的测试正在进行中,新增测试资格正分批发放。从 Twitter 等平台上展示的结果来看,一个真正的 DALL-E 2 竞争对手正在这里诞生。
Stable Diffusion 比 Midjourney 更加灵活,但分辨率低于 DALL-E 2。|图片:Github
与 DALL-E 2 不同,Stable Diffusion 可以生成知名人物以及 OpenAI 在 DALL-E 2 中禁止生成的其他主题。Midjourney 或 Pixelz.ai 等系统同样能够做到这一点,但在 Stable Diffusion 所展现出的高度多样性下,它们无法达到与之相当的质量——而且其他系统没有一个是开源的。
事实证明,如果固定初始化噪声,并在 prompt 的条件向量之间进行 slerp,#stablediffusion 就能在不同文本 prompt 之间实现非常出色的插值效果:pic.twitter.com/lWOoETYVZ3
Stable Diffusion 预计已经可以在一块拥有 5.1 GB VRAM 的显卡上运行——这让一项此前只能通过云服务使用的 AI 技术得以在边缘设备上运行。因此,没有 GPU 服务器使用权限的研究人员和其他感兴趣的人,也能借助 Stable Diffusion 对现代生成式 AI 模型展开实验。据称,该模型还可以在搭载 Apple M1 芯片的 MacBook 上运行。不过,在这里生成图像需要几分钟,而不是几秒钟。
OpenAI 的 DALL-E 2 迎来了由开源社区和初创公司 Stability AI 主导的开源竞争对手。|图片:Github
Stability AI 本身也希望支持企业训练自己的 Stable Diffusion 变体。多模态模型由此开始沿着大型语言模型此前走过的道路发展:从单一供应商,转向通过开源广泛提供大量替代方案。
Runway 已经开始研究由 Stable Diffusion 实现的文本到视频编辑技术。
#stablediffusion 文本生成图像的 checkpoints 现已开放申请,可用于研究目的:https://t.co/7SFUVKoUdl
我们正在开发限制更加宽松的版本以及 inpainting checkpoints。
Soon™ 将登陆 @runwayml,用于文本到视频编辑 pic.twitter.com/7XVKydxTeD
当然,随着模型开放访问,并且能够在广泛普及的 GPU 上运行,其被滥用的可能性也会大幅增加。
“总有一部分人就是令人不快,而且行为怪异,但这就是人性。”Mostaque 表示,“事实上,我们相信这项技术将得到普及,而许多 AI 爱好者不信任社会,所持的那种家长式且略显居高临下的态度是错误的。”
不过,Mostaque 强调,免费开放也能让社区开发相应的应对措施。
“我们正在采取重大的安全措施,其中包括开发尖端工具,帮助降低模型发布和我们自有服务中可能出现的潜在危害。随着数十万人基于这个模型进行开发,我们相信它带来的净收益将极其可观;当数十亿人使用这项技术时,其危害也将得到抵消。”
你可以在 Stable Diffusion 的 Github 上了解更多信息。在 Stable Diffusion 的 subreddit 中,可以找到许多展示其图像生成能力的示例。可在此处报名参与 Stable Diffusion 的 beta 测试。
注意:文章中指向在线商店的链接可能是所谓的 affiliate links。如果你通过此类链接购买商品,MIXED 将从供应商处获得佣金。你支付的价格不会因此发生变化。