ClickHouse 收购 Langfuse、Mintlify 让 Helicone 维护模式、Braintrust 独立融资,LLM 观测平台格局正在快速收敛,团队选择时需评估厂商长期存活能力。

在 2026 年 1 月中旬到 2 月底的五周内,当工程团队选择 LLM 可观测性技术栈时最常权衡的三家公司,都在这一时期从根本上发生了改变。ClickHouse 以 4 亿美元 C 轮融资收购了 Langfuse。Mintlify 收购了 Helicone 并将其置于维护模式——不再有新功能,只有安全补丁。而 Braintrust 完成了 8000 万美元 B 轮融资并保持独立,更加坚定地走"评估优先"的纯技术路线。
如果你现在正在这三者中做选择,这不是琐事,而是真实的决策。Langfuse、Helicone 和 Braintrust 的功能清单已经趋同到这种程度——在一个周二的下午比较文档时,你很难区分它们——三者都能追踪 LLM 调用、都能运行评估、都支持 OpenTelemetry span 接入。真正不同的是,这三者中谁仍然有一支团队,其工作就是持续开发你即将接入生产环境的这个东西,而这几乎是所有撰写"顶级 LLM 可观测性工具"榜单的人都不会去核实的事情。
这篇文章比较的是每个平台当下的能力,但更重要的是,你实际买入的是一家什么样的公司,能支撑你未来两年的发展。
为什么这个比较现在很重要
LLM 可观测性从"锦上添花"变成"告诉你 AI 智能体悄悄开始幻觉退款金额的东西",是在 2025 年,因为更多团队从 demo 转向生产级 AI 智能体——这些 AI 智能体调用工具、检索文档、每个请求链式调用多个模型。Datadog 或 New Relic 这样的传统 APM 工具是为异常和延迟百分位数设计的,而不是为"模型返回了语法正确但事实错误的 JSON"设计的。这个 gap 催生了一个完整的产品类别——追踪 LLM 调用、打分输出、在上线前捕获回归——而 Langfuse、Helicone 和 Braintrust 成为其中采用最广的三个名字。
然后,在一个季度内,这个类别的竞争格局就重新洗牌了。今天做选择的团队不仅仅是在比较价格表,他们在赌谁在 2027 年仍在积极迭代。这确实是一个不同于"哪个仪表盘有更多图表类型"的问题,而这正是本文试图真正回答的问题,而不是蜻蜓点水。
还有一个结构性的原因解释为什么这个特定类别会吸引收购而非永远独立:LLM 可观测性本质上是一个穿着开发者工具 UI 外衣的数据基础设施问题。AI 智能体 trace 是大型的、深度嵌套的(单个请求可以产生数十个子 span,跨越检索、工具调用和子 AI 智能体跳转),并且需要既快速写入又能灵活查询以进行评估。这正是 ClickHouse 等分析型数据库公司所擅长的 workload 配置文件,这就是为什么"一个 LLM 可观测性初创公司被它所构建的数据库收购"不是孤例——更像是这个市场一直会呈现的形态。
每个平台实际做什么
Langfuse 起步是一个开源的(MIT 许可核心)LLM 工程平台:追踪、带版本控制的提示词管理、LLM-as-a-judge 和基于代码的评估器、数据集管理,以及用真实数据迭代提示词的 playground。它提供 Python 和 JS/TS 的类型化 SDK,原生集成 LangChain、LlamaIndex、OpenAI SDK 和 LiteLLM,并接受来自其他任何工具的 OpenTelemetry span。部署方式非常灵活——Langfuse Cloud、五分钟 Docker Compose 安装、VM、通过 Helm 部署 Kubernetes,或 AWS/Azure/GCP 的 Terraform 模块。截至 2026 年中,它约有 32,900 个 GitHub star,收购时 ClickHouse 引用了每月超过 26,000 次 SDK 安装、6,000+ 次 Docker 拉取,以及 Fortune 50 中 19 家公司的采用。
Helicone 采用了不同的架构立场:它主要是一个 AI 网关——一个你通过它路由请求的代理——在此之上叠加了可观测性、成本追踪、缓存和速率限制,而不是一个需要你去插桩代码的追踪 SDK。这意味着集成通常只需要更换一行 base URL,而不需要包装每个 LLM 调用,这确实是三者中实现"我能按端点查看我的 OpenAI/Anthropic/Gemini 消费"的最快路径。它也是开源可自托管的,直到 2026 年 3 月,它还在一条明确的轨迹上添加更深入的评估和 AI 智能体可观测性功能,以与 Langfuse 和 Braintrust 更正面竞争。
Braintrust 是评估优先构建的:trace 和评估分数从第一天起就存在于同一个对象中,而不是事后附加的。它的差异化在于集成到 CI/CD 的评估——当质量分数回归时可以阻止合并;一个名为 Brainstore 的专有 trace 数据库,专门为大型嵌套 AI 智能体 trace 设计(传统行导向数据库处理得很差);以及"Topics"功能,能够自动将生产 trace 聚类为模式,使团队能够发现新兴的失败模式,而无需预先手工编写每个评估。它提供 Python、TypeScript、Go、Ruby 和 C# 的 SDK,而且——值得注意的是——没有真正意义上的自托管开源版本;Enterprise 提供混合/本地部署,但产品本质上是云优先和商业许可的。
值得用一句话提一下第四个名字:Arize AI,尤其是其开源的 Phoenix 项目,与三者都相邻,但更侧重于从传统模型监控传承而来的 ML 风格评估严谨性和漂移检测。对于已经在用 embedding 和统计漂移思维方式的团队来说,这是一个合法的选择,但对于主要需求是"追踪我的 AI 智能体并捕获回归"的团队来说,它的匹配度更窄,所以我在此将其作为脚注而非第四个完整竞争者。
值得精确理解这三款工具中"评估"的含义,因为这个词被用得很松散。三者都支持三种广泛的评分机制:LLM-as-a-judge(另一个模型根据评分标准对输出进行评分)、基于代码的评估器(确定性检查——JSON 是否解析成功、输出是否包含禁用短语、提取的数字是否在容差范围内),以及人工审核队列,用于前两者都无法可靠判断的情况。它们的不同之处在于工作流集成:Braintrust 将评估器直接接入 CI,使回归导致构建失败;Langfuse 将评估视为一等公民对象,你可以针对生产 trace 和数据集临时运行或调度;Helicone 的评估界面是三者中最薄的,这反映了其网关优先的起源——历史上更接近于"标记此 trace 供审核"而非"阻止此部署"。
每个平台实际上是如何构建的
架构差异解释了很多营销页面略过的大量权衡。
Langfuse 的核心数据层就是 ClickHouse 本身——该公司实际上是在将收购它的数据库的基础上构建了 v3 产品,从 Postgres 切换过来,因为 Postgres 在规模上成为了摄入/分析的瓶颈。这不是巧合,正是这笔收购首先在技术上说得通的原因,这也是为什么 Langfuse 的自托管部署并非易事:在生产规模上运行好它意味着运行好 ClickHouse,这是另一项需要运维技能的事情。
Helicone 的代理架构意味着它按定义能看到每个请求——没有 SDK 插桩 gap,不会因为有人忘记包装某个调用而漏掉 span——但这也意味着你的 LLM 流量在到达 OpenAI 或 Anthropic 之前物理上要经过 Helicone 的基础设施(或者你的自托管实例)。这是基于 SDK 的追踪不会引入的延迟和可用性依赖,而且这是一份需要签署的不同风险画像,尤其是现在维护那个代理的团队已经被合并进了一家文档公司。
Braintrust 的 Brainstore 是最固执己见的架构赌注:一个专为嵌套的树形 AI 智能体 trace 数据构建的数据库,该公司声称在全文搜索、写延迟和此特定 workload 的 span 加载时间上优于"传统"数据库(Braintrust 没有在公开的定价/营销页面上发布比较数据,所以把具体的倍数当作供应商声称的,等你用自己的 trace 跑基准测试)。代价是 Brainstore 是专有的——你无法通过自托管来摆脱它,如果你想离开也没有开源核心版本可以依赖。
Braintrust 架构还有第二层值得注意:"Loop",一个内置 AI 智能体,可以按需生成提示词、评分器和数据集;以及"Topics",能够针对你定义的自定义维度(用例、客户群、合规敏感度、语气等)持续聚类实时生产环境追踪数据,而无需你先手动编写分类体系。这两个功能相对于 Langfuse 和 Helicone 目前的特性集来说都是真正新颖的——两者目前都没有提供等价功能——但两者也意味着更多的评估逻辑存在于 Braintrust 的专有层中,而非你拥有并可以迁移到其他地方的代码中。
在安全与合规层面,三家公司在其高端层级已经收敛到同一份清单:SOC 2 Type II、HIPAA 支持以及 SSO/SAML 在 Braintrust(Enterprise)、Langfuse(Pro 及以上,提供 BAA)以及 Helicone(Team 及以上)中均可使用。三家在这方面不再有实质性差异——把合规当作你在特定层级需要验证的基础要求,而不是在它们之间做选择的决定性因素。
十八个月前,"选择哪个 LLM 可观测性工具"是一个功能与定价的问题。现在它也是一个关于供应商持续经营的问题,以下是使其成为问题的 timeline:
2026 年 1 月 16 日 — ClickHouse 宣布收购 Langfuse,作为其由 Dragoneer Investment Group 领投的 4 亿美元 C 轮融资的一部分,Bessemer、GIC、Index、Khosla、Lightspeed 等参与跟投。Langfuse 的创始人(Marc Klingen、Max Deichmann、Clemens Rawert)及全体团队加入 ClickHouse。创始人在公告中明确表示:许可条款不变,自托管仍为一等公民,团队继续构建 Langfuse,路线图不变。
2026 年 2 月 17 日 — Braintrust 宣布完成 8000 万美元 B 轮融资,由 ICONIQ Capital 领投,a16z、Greylock、Elad Gil 及 basecase capital 跟投。公开命名的客户包括 Notion、Vercel、Ramp、Stripe、Replit、Zapier、Airtable 及 Instacart。资金用途声明:扩大工程和销售团队、新办公室,以及在 Braintrust 用户大会上公布的新产品。
2026 年 3 月 3 日 — Mintlify 宣布收购 Helicone,创始人 Justin Torre 和 Cole Gottdank 及团队加入位于旧金山的 Mintlify。Mintlify 的公告声明 Helicone 进入维护模式:安全更新、bug 修复以及"新模型"继续交付,但——用创始人自己在博客上的话——"我们今后不会交付新功能。"创始人后续的文章将这次变动描述为赌"知识层"(Mintlify 的文档/检索业务)比他们花了三年构建的可观测性层更重要的押注。
直白地说:三家供应商中有一家书面告知了自己的用户:active development has stopped(active 开发已停止)。
成本。Helicone 公布的定价从免费开始(每月 10K 请求),Pro 79 美元/月,Team 799 美元/月,以及定制的 Enterprise。Langfuse Cloud 提供 Free、Core 29 美元/月、Pro 199 美元/月(企业 SSO/RBAC 附加组件 300 美元/月),以及 Enterprise 2,499 美元/月,所有层级都在包含额度之上按用量额外计费。Braintrust 的模式在结构上不同——平台费(Starter 0 美元、Pro 249 美元/月)加上处理数据(4 美元/GB,随后 3 美元/GB)和评分输出(每 1,000 条 2.50 美元,随后 1.50 美元)的按量计费,这意味着你的账单会随评估量规模增长,而其他两家的计费方式没有这么直接。在不知道你实际追踪量与评估频率的情况下,这些定价之间没有可比性——在假设标价就是你会收到的账单之前,从每个供应商的计算器获取真实数字。
自托管与锁定。这是三家分歧最大的地方。Langfuse 的 MIT 许可核心可自托管,无席位上限、无保留限制、无用量上限——如果你愿意自行运行和扩展 ClickHouse 支持的堆栈,那就是真正的免费(实话实说:在中等规模下,这大约每月 3,000–4,000 美元的基础设施和 DevOps 开销,相比之下等效的托管 Pro 层级只需 199–300 美元/月,所以"免费"自托管在计算工程时间后其实并不是免费的)。Helicone 也是开源可自托管的,但维护模式项目只能让你用到其最后发布的版本——不会有未来的架构改进。Braintrust 基本上没有有意义的自托管或开源核心路径;你就是一个有风险投资支持的公司云客户,仅此而已,你的评估历史和 Brainstore 格式的追踪数据存在于他们的基础设施中。
延迟与爆炸半径。Helicone 的网关模式意味着其基础设施上的中断或减速会直接导致你的模型调用中断或减速,而不仅仅是仪表板上的数据缺口。Langfuse 和 Braintrust 基于 SDK/OTel 的追踪降级更优雅——追踪后端的小故障意味着你丢失一些可观测性数据,而不是你的应用停止调用 LLM。
可维护性,即"两年后这还会是一个产品吗"。这是收购浪潮实际上已经回答的问题,而且回答得参差不齐。Langfuse 的创始人留在他们自己的产品中,有一个资金充裕、方向一致的父亲公司,其核心业务(实时分析基础设施)直接受益于 Langfuse 的持续增长——对于一个开源基础设施项目来说,这是一个相当好的收购结果。Braintrust 刚刚拿到风险投资专门用于继续更快地构建,保持独立意味着其路线图对自己的客户负责,而不是对母公司单独的产品策略负责。Helicone 的创始人明确表示新功能开发已停止;今天 Helicone 与 Langfuse/Braintrust 在评估、AI 智能体可观测性或其他任何方面的差距现在是永久性的差距,而非临时性的,除非有 fork 或资源充足的竞争者接手。
选择 Langfuse,如果你需要将敏感的追踪数据保留在自己的基础设施内(受监管行业、合同数据驻留要求),你已运行或愿意运行 ClickHouse 相邻的基础设施,并且你想要一个真正完整的开源工具而不是开源核心的试用版。如果你的技术栈已倾向于 LangChain/LlamaIndex,鉴于其原生集成深度,Langfuse 也是最合适的。
选择 Braintrust,如果评估是真正的瓶颈——你有一个质量标准希望在上线前自动执行,而不仅仅是事后可见——并且你愿意成为一家资金充裕的初创公司的云客户。CI/CD 质量门控工作流和 Topics 的自动模式发现是本次对比中最具差异化的能力;目前 Langfuse 或 Helicone 中没有任何功能可以等价于"因为评估分数退化而阻止部署"作为一等、内置的工作流。
选择 Helicone,谨慎地,如果你特别想要网关风格的成本追踪和缓存,且集成工作量最低(换一个 base URL,搞定),你的需求已被其当前功能集完全满足,并且你接受"当前功能集"现在是永久性的。它仍然是仅需要路由、日志记录和成本/缓存的团队的合理选择——只是在后期预留迁移工作量,因为"维护模式"是日落时钟的一种委婉说法,即使是一个异常缓慢的日落时钟。
混合/混合方法在实践中很常见。很多团队在多个模型提供商前纯粹为路由/缓存/回退运行 Helicone(或其他网关),同时将追踪发送到 Langfuse 或 Braintrust 进行实际的可观测性和评估工作流——网关和追踪/评估平台并不互斥,鉴于 Helicone 的状态,这种分工是今后继续使用它的一种更有保障的方式。
还有几个更具体的场景值得点名,因为"选择评估优先的那个"只有在你知道评估优先的工作流日常是什么样子时才有帮助。每周迭代系统提示词的客服机器人团队从 Braintrust 的 playground 到数据集再到 CI 的循环中获得最直接的价值:用一次点击将上周最差的生产追踪转化为回归数据集,然后针对每次未来的提示词变更运行质量门控。为十几个产品团队构建共享内部 LLM 网关的平台团队——集中式速率限制、逐团队成本归因、响应缓存以减少冗余支出——更接近 Helicone 的原始设计中心,而不是其他两个,尽管其路线图已冻结。而在合规密集型环境(健康数据、金融数据)中构建 AI 智能体、同时需要追踪和提示词在物理上永不离开 VPC 的团队,现实中只有一个选项:Langfuse 自托管。
Braintrust 的 Brainstore 性能声明(全文本搜索更快、写延迟更低、span 加载对比"竞品"的倍数)在公开营销页面上没有公布对比方法论或具体数字——在你用自己的 trace 量跑一遍之前,对这些倍数持怀疑态度是合理的。
Langfuse 的"自托管免费"宣传在许可层面是成立的,但在计算基础设施成本和让 ClickHouse 在生产 trace 量下良好运行的 DevOps 时间后,总拥有成本就不真实了——几篇独立拆解文章指出,一旦超越兴趣爱好规模,自托管的真实 TCO 与托管 Pro 套餐在同一个量级,甚至更高。
Helicone 和 Mintlify 的公告帖子都用了温和的措辞来描述维护模式("服务继续运行"、"安全更新……持续交付"),但没有强调这在运营层面意味着什么:没有路线图响应来弥补竞争性功能差距,没有随着新模型 API 发布而集成新的提供商,而且支持团队不会随着你的使用量增长而扩充。
而且这三家厂商的对比页(是的,包括这篇文章中聚合的那些)都是由被比较方自己编写的——把 hosted 在 x.com 自有域名上的"X vs Y"页面当作营销文案而非证据来对待。
还有一个没有任何收购公告会详述的事实:这三笔交易都是由被收购公司的创始人自己框架为对用户绝对正面的——"没有变化"、"路线图继续"、"你的数据安全"。这是创始人在收购公告中应该说的正确的话,而且 Langfuse 的证据(自一月以来的持续提交、持续的开源发布)迄今为止支撑了这一点。但收购后五个月的连续性是一个微薄的样本,Helicone 的"维护模式"也是用与 Langfuse"什么都没有改变"同样令人安心的语气宣布的——两种结果的实际差异只有在你看完全文而不仅仅是标题承诺的下一步后才会显现。当你所依赖的厂商被收购时,要看细则,不要看措辞。
这些工具现在没有一个是差的——这正是让决策更难而非更容易的原因。如果三者之间功能深度差异很大,选择会不言自明。相反,你在根据二阶赌注做出选择:你是否信任一家基础设施数据库公司在其产品组合中保持一个开源可观测性产品的健康发展(Langfuse/ClickHouse 配对就目前五个月大的收购而言看起来确实是个好搭配);你是否信任一家资金充足的以评测为首要目标的纯正玩家在其 B 轮后扩大 GTM 团队时保持专注(Braintrust,尚待证明,但激励方向是对的);或者"维护模式"是否是你即将在生产中依赖的基础设施的一个真正的长期选项(Helicone,诚实的答案是:对于狭窄的用例可以,对于你期望增长的任何东西,不行)。
各读者画像应该选哪个
如果你是一个受监管行业的团队或有严格的数据主权要求,Langfuse 的自托管 MIT 核心是这三者中唯一真正满足"我们的 trace 数据永远不会离开我们 VPC"而无需企业合同的——选它,并且在开始时就为 ClickHouse 的运维开销做好预算。
如果你真正的痛点是"我们发布了一个智能体更新,却不知道质量是否退化,直到客户投诉",Braintrust 的 CI/CD 门控评测正是为这种工作流程量身打造的,如果你乐意成为一家刚刚拿到专门用于持续构建的资金云厂商的客户,那么缺乏自托管选项是值得的。
如果你处于早期阶段、多提供商、且主要需要成本可见性和缓存而不需要改动代码,Helicone 今天仍然很好地完成这项工作——只是不要围绕它还没有的功能规划你的两年路线图。
如果你还不确定,这也是一个合理的答案:三者都有慷慨的免费套餐,在真实工作负载上尝试其中两个两周的实际成本,比猜错一个你无法提前充分了解其长期轨迹的厂商要低。
你会真正把团队的路线图押注在这三者中的哪一个上?一家厂商的被收购状态是否会像影响我写这篇文章时的判断一样影响你的决策?