8.0
热点
AI SCORE
编程提效2026-08-25 11:27
LLM API限流新思路:基于Token数量的自适应并发控制
dev.to · AI#LLM工程#流量控制#开源库
Editor brief · 编辑速览
传统并发限制无法区分大小请求,作者开源async-bulkhead-llm库,实现maxConcurrent和maxInFlightTokens双维度控制,避免大请求饿死小请求。
并发限制对每个请求都一视同仁。
但对于 LLM 工作负载,这个假设并不成立。
一个 500 token 预算的请求和一个 30,000 token 预算的请求可能都占用一个并发槽,但它们消耗的提供商容量可能差异巨大。
这就是我构建 async-bulkhead-llm 要解决的问题。
它不只是限制并发请求,还能同时约束两个维度:
并发请求数 + 预估的飞行中 token 数
只有当两个预算都有足够容量时,请求才会被准入。
const bulkhead = new AsyncBulkhead({
maxConcurrent: 8,
maxInFlightTokens: 40_000,
});
这为 LLM 提供商提供了一个考虑到工作负载大小而非仅仅是请求数量的隔离层。
当交互式请求和大批量请求共享同一个上游模型时,这尤其有用。传统的并发限制器仍然可能让少量大请求占满大部分有用容量。
Token 感知的准入给了你另一个控制面。
async-bulkhead-llm 是一个我专门为解决这个问题而开发维护的开源 TypeScript/npm 库。
更广泛的教训很简单:对于 LLM 系统,并发只是负载的一个维度。
如果你正在构建生产级 LLM 基础设施,我很感兴趣你是如何处理准入控制和过载保护的。
