图形化工具支持批量 prompt 优化和对比测试,无需编码快速迭代 LLM 方案。
ChainForge 是一个开源的可视化编程环境,用于 prompt engineering、LLM 评估与实验。借助 ChainForge,你几乎不需要编写代码,就能评估 prompt 和文本生成模型的稳健性。其功能包括:
同时查询多个 LLM,快速、高效地测试 prompt 的各种思路与变体;也可以使用不同参数设置查询同一个 LLM。
比较不同 prompt 排列组合、不同模型以及不同模型参数设置下的响应质量,从而为你的使用场景选择最佳的 prompt 和模型。
使用代码或基于 LLM 的评分器设置评估指标,并自动绘制不同 prompt、prompt 参数、模型或模型设置下的结果。
基于不同模板参数和聊天模型,同时进行多轮对话。你可以将聊天消息模板化,并检查和评估聊天对话中每一轮的输出。
ChainForge 正在积极开发中,目前以开放测试版的形式提供。
pip install chainforge
chainforge serve
使用 Chrome、Firefox、Edge 或 Brave 浏览器打开 localhost:8000。有关安装的更多详细信息,例如如何将 API keys 设置为环境变量,请参阅 Getting Started。
你也可以访问 chainforge.ai/play,在线试用 ChainForge。
Web 版本的功能有限,但包含一项名为 Share Button 的神奇功能:
通过 Share,你可以将自己的 LLM 实验以链接形式发送给其他人。只需点击 Share,即可为你的 LLM 实验生成一个唯一的 Web 链接,并将其复制到剪贴板。例如,这里有一个尝试让 LLM 泄露 secret key 的实验。
ChainForge 兼容 Google Chrome 和 Mozilla Firefox。你需要为希望使用的 LLM 准备相应的 API key。我们不会存储你的 API keys——无论是在 cookie、localStorage 还是服务器中。正因如此,每次加载 ChainForge 时,你都必须重新设置 API keys。如果不想为此操心,我们建议在本地安装 ChainForge,并将 API keys 设置为环境变量。
ChainForge 由 Ian Arawjo 在哈佛 HCI 小组 Variation Lab 担任博士后研究员期间创建。他目前担任该项目的首席开发者和维护者。项目合作者包括博士生 Priyan Vaithilingam 和 Chelse Swoopes、本科生 Sean Yang,以及教师 Elena Glassman 和 Martin Wattenberg。其中,Chelse 编写了项目文档,并协助开展了用户研究;Sean Yang 则率先开发了新的 Generate、Replace & Extend 生成式 AI 功能。
如果你将 ChainForge 用于研究,或者基于其源代码进行开发,我们希望你在所有相关出版物中引用我们的 arXiv 预印本。请使用以下 BibTeX:
@misc{arawjo2023chainforge,
title={ChainForge: A Visual Toolkit for Prompt Engineering and LLM Hypothesis Testing},
author={Ian Arawjo and Chelse Swoopes and Priyan Vaithilingam and Martin Wattenberg and Elena Glassman},
year={2023},
eprint={2309.09128},
archivePrefix={arXiv},
primaryClass={cs.HC}
}