科学数据成为 AI 训练的新frontier
Lila Sciences 论证科学数据而非互联网是未来 AI 训练的核心资源,分享了他们的数据采集与应用实践。对 AI/ML 研究者有启发价值,但不是直接编程技巧。
Lila Sciences 论证科学数据而非互联网是未来 AI 训练的核心资源,分享了他们的数据采集与应用实践。对 AI/ML 研究者有启发价值,但不是直接编程技巧。
想象一个黑暗的仓库。一排排的设备上连接着电线、管道和电子器件。下一个 AI 数据中心?不。这是 Lila Sciences 对科学未来的梦想。一个充满 AI 引导的机器人和实验室设备的黑暗仓库,24/7 不间断地进行新的实验,为科学超级智能而努力。
他们的自动化实验室令人着迷。他们有在 Wall-E 式轨道上飞驰的浮动板,使用视觉语言模型来控制 Windows 95 的电脑,创造了世界上最大的"损坏保修"收藏。在这个过程中,他们积累了一个大规模的科学推理 token 库。超过 10 万亿个 token,全部经过实验验证。
没有保修在此视频制作过程中被损坏
说 Lila 雄心勃勃是轻描淡写。他们的目标是一个直接连接到湿实验室的科学超级智能。他们全力投入于"苦涩的教训",其论文如下:实验室是一个无限的 token 生成器。大规模产生数据,协同效应会给你一个通用推理器,能够解决任何科学问题。他们正在全力承诺。生物学、化学、药物发现和材料科学,全面同时进行。时间会证明这是否有效,但这是一个令人兴奋的假设。
在最近的一期节目中,我们与 Lila 的 Andy Beam(首席技术官)和 Rafa Gómez-Bombarelli(首席科学官,物理科学)坐在一起,踏上了一段探索 AI 驱动科学可能性的旅程,几乎与 Lila 的目标一样宽泛。
我们有提到他们既做材料科学又做生物学吗?在同一个 AI 科学工厂中?同时,同样的实验室,同样的 AI。最后有一位嘉宾可以解决我们长期以来在自己之间进行的一场辩论:生物学还是材料科学更难?
网络已用尽,科学是下一步。为什么 Lila 认为科学方法是最后一个未开发的互联网规模数据集,以及为什么他们将强化学习视为一种数据生成机制,以自然界为验证者。
实验室作为数据中心。将仪器视为图上的节点,一个磁悬浮的"PCI 总线"作为它们之间的传输层,编排作为 slurm 队列。Andy 不缺乏类比。
为什么 Lila 坚持它不是一个自动化公司。他们优化的是灵活性和可推广性,而不是原始吞吐量,这意味着在自动化不划算的任何地方,人员都保持在 API 边界之下。
你的实验有一个运行时间。我们向 Escalante Bio 提出了对 Andy 的问题:如果科学是 token 生成器,你的数据收集的运行时间是多少?简而言之,他的答案是你无法让核糖体运动更快。为什么 Lila 押注于快速的迭代循环而不是大型的嘈杂多路复用筛选,以及 Rafa 的团队如何将气体吸附测量的运行速度提高了大约 2500 倍。
10 万亿科学 token 中实际包含的内容。不是序列。经过实验验证的推理踪迹,一种 Andy 主张在互联网上存在数量接近零的数据类型。
广度作为达到深度的途径。小分子化学先验转移到用于碳捕获的金属有机框架,以及通用模型在样本对样本基础上击败领域特定模型的主张。
如果你有数据,你还需要模型做什么?Sri Kosuri 关于药物发现 ML 商业模式的公案,以及 Andy 的回答:编码模型变得更好是因为它也读了莎士比亚和卡尼塔斯食谱。
他们想要自动化的巧合。Emily Whitehead 之所以在首例儿科 CAR-T 疗法中幸存,仅仅是因为治疗她的医生碰巧从儿科关节炎中了解到哪种抗体会钝化她的 IL-6 反应。再掷一次骰子,你可能会失去她。广度是你停止依赖运气的方式。
催化剂的第 37 招。针对无铂族电催化剂的模型建议从无趣变成了一位 40 篇论文专家所说的愚蠢,再到他们制造过的最佳性能的催化剂。
六个月内获得非人灵长类动物的体内 CAR-T 数据,以及由此产生的零 FTE 虚拟初创公司商业模式。为了说明这个数字为什么令人震惊,AbbVie 基于临床前体内 CAR-T 数据以 21 亿美元收购了 Capstan。
如果你只是一个好的考试者,你就不能拥有科学超级智能。撰写了《伟大为何无法规划》的 Ken Stanley 在 Lila 负责开放式思维。大规模强化学习给你一个无情的逻辑思维问题求解者。机器创意是另一回事,这是没有人解决过的部分。
思维链是一个不可靠的叙述者。模型在潜在空间中推理,只发出 token。有时它完全跳过实验,但仍然是对的。那么你对推理与验证者的信任度有多高?
当展开是物理的时候的奖励黑客。思维链陷入重复,一个模型因为被要求重新做板地图而对科学家感到恼怒并发誓。当病态循环内部有湿实验室时会发生什么?
苦涩的教训的反演。Rafa 对苦涩教训的反演:在 AI 中,缩放是一个路线图。在材料中,缩放是一个过滤器,因为只有能够缩放的事物最终才重要。
不是典型的 Flagship 公司。为什么一个著名的单一资产生物技术孵化器创造了一个平台赌注,以及 Andy 关于如果 Lila 称自己为生物制药公司的评论,它会有一个前三名的 GPU 集群。
他们希望一劳永逸地消除的瓶颈。基于物理的模拟的仿真到现实,以及强化学习训练在大约 5% 的平均 FLOP 利用率下运行这一事实。