Superlinked 开源推理服务器,用单一集群替代多个独立模型服务,支持 OpenAI 兼容 API 和 LangChain 集成,K8s 部署配置开箱即用,适合多模型 Agent 系统的高效运维。
Self-hosted inference for agents. Every open model your agents call, served from one cluster in your cloud.
Docs | Quickstart | API Reference | Models
⭐ Help us reach more developers and grow the SIE community. Star this repo!
SIE 是一个开源推理引擎,通过单一 API 运行所有 Agent 任务背后的模型:搜索与检索、文档转 Markdown、结构化输出、内容安全,以及 Agent 循环本身。它用一套系统替代了每个任务单独搭一个模型服务器的拼凑模式,支持 100+ 模型,按需加载。
Drop-in 迁移的 OpenAI 兼容 API:/v1/embeddings、/v1/chat/completions、/v1/completions、/v1/responses
预配置模型目录:Stella、SPLADE、Qwen3、GLiNER、SigLIP 等;embedding 和检索模型已在 MTEB 上基准测试
支持多模型同时服务,按需加载和 LRU 淘汰
自带 Kubernetes 和 Helm 部署配置:负载均衡网关、KEDA 自动扩缩容、Grafana 监控面板
集成 LangChain、LlamaIndex、Haystack、DSPy、CrewAI、Chroma、Qdrant、Weaviate 和 LanceDB
安装 mise,然后从仓库根目录引导版本化的 Python、Rust、Node.js 和 Helm 工具链:
./tools/init.sh
常见的开发检查和本地服务可通过 mise 任务调用:
mise run test
mise run lint
mise run typecheck
mise run serve
mise run rust-check
mise run rust-test
mise run gateway-test
mise run server-sidecar-test
Python 工作区使用提交到仓库的根级 lock 文件。包成员关系在 pyproject.toml 中显式声明;一个包只有在引入其完整源代码的同一变更中才会加入工作区。原生音频始终是可选构建:安装 cmake,然后运行 mise exec -- uv sync --frozen --project . --all-packages --all-extras。
一个 SIE 集群运行整个 Agent 的推理后端。每个任务由少量可互换的模型组成;浏览 packages/sie_server/models/ 查看完整模型列表。
# macOS (Apple Silicon) 或 Linux,原生(需要 Python 3.12)
pip install "sie-server[local]" && sie-server serve
# Linux,NVIDIA GPU
docker run --gpus all -p 8080:8080 \
-v sie-hf-cache:/app/.cache/huggingface \
ghcr.io/superlinked/sie-server:latest-cuda12-default
# Linux,NVIDIA GPU — Transformers 5 OCR 模型(LightOnOCR 和 GLM-OCR)
docker run --gpus all -p 8080:8080 \
-v sie-hf-cache:/app/.cache/huggingface \
ghcr.io/superlinked/sie-server:latest-cuda12-transformers5
# Linux,CPU
docker run -p 8080:8080 \
-v sie-hf-cache:/app/.cache/huggingface \
ghcr.io/superlinked/sie-server:latest-cpu-default
Docker 镜像是按 bundle 分隔的,以保持依赖不兼容的模型系列相互隔离。使用 transformers5 镜像运行 LightOnOCR 或 GLM-OCR;默认镜像有意不包含它们。
# 在第二个终端中
curl http://localhost:8080/readyz # 期望返回: ok
服务器开箱即用 OpenAI API,embeddings 和 generation 均支持(集群网关服务 /v1/chat/completions、/v1/completions 和 /v1/responses)。你的第一次调用只需要 curl:
curl http://localhost:8080/v1/embeddings \
-H 'Content-Type: application/json' \
-d '{"model": "sentence-transformers/all-MiniLM-L6-v2", "input": "Hello world"}'
# {"object": "list", "data": [{"object": "embedding", "embedding": [-0.0344, 0.0310, ...
每个模型的首次调用会下载其权重(进度显示在服务器终端)。后续调用跳过下载步骤;推理延迟取决于模型、任务、硬件和批大小。
pip install sie-sdk # Python
npm install @superlinked/sie-sdk # TypeScript(pnpm 和 yarn 也可以)
from sie_sdk import SIEClient
from sie_sdk.types import Item
client = SIEClient("http://localhost:8080")
# 生成 embeddings
result = client.encode("sentence-transformers/all-MiniLM-L6-v2", Item(text="Hello world"))
print(result["dense"].shape) # (384,)
# 对搜索结果重排序
scores = client.score(
"cross-encoder/ms-marco-MiniLM-L-6-v2",
Item(text="What is machine learning?"),
[Item(text="ML learns from data."), Item(text="The weather is sunny.")],
)
print(scores["scores"][0]) # {'item_id': 'item-0', 'score': -7.1, 'rank': 0}
# 提取实体
result = client.extract(
"urchade/gliner_multi-v2.1",
Item(text="Tim Cook is the CEO of Apple."),
labels=["person", "organization"],
)
print(result["entities"][0])
# {'text': 'Tim Cook', 'label': 'person', 'score': 0.992, 'start': 0, 'end': 8, ...}
文本生成在 GPU generation 镜像上运行;停止第一个服务器,然后在同一端口启动这个:
# Linux,NVIDIA GPU(通过 MLX 在 Apple Silicon 上运行 generation,详见下方文档)
docker run --gpus all -p 8080:8080 \
-v sie-hf-cache:/app/.cache/huggingface \
ghcr.io/superlinked/sie-server:latest-cuda12-sglang
result = client.generate(
"Qwen/Qwen3-0.6B",
"Reply with a single word: the capital of France.",
max_new_tokens=16,
temperature=0.0,
)
print(result["text"]) # Paris
关于 Apple Silicon(MLX)上的 generation、TypeScript 演练以及所有配置方式,请参阅 quickstart guide、TypeScript SDK docs 和 SDK reference。
同一套代码可用于生产集群。SIE 自带负载均衡网关和 Kubernetes 部署面,包括 Helm charts、KEDA 自动扩缩容(缩容到零)和 Grafana 监控面板。公共 Terraform 模块独立维护,支持阿里云 ACK、EKS、AKS 和 GKE。不只是服务器,是整套栈。全部采用 Apache 2.0 许可。
# 选择一个 values overlay: values-ack.yaml / values-aws.yaml / values-aks.yaml / values-gke.yaml
#(锁定 chart 版本以实现可重现安装,例如 --version 0.6.18)
helm upgrade --install sie-cluster oci://ghcr.io/superlinked/charts/sie-cluster \
--namespace sie --create-namespace \
--set hfToken.create=true \
--set hfToken.value=YOUR_HF_TOKEN \
-f https://raw.githubusercontent.com/superlinked/sie/main/deploy/helm/sie-cluster/values-gke.yaml
参阅 deployment guide。
遥测:SIE 收集匿名使用数据(版本、操作系统、架构、GPU 类型)以了解采用情况。不收集 IP 地址、主机名或请求数据。可通过 SIE_TELEMETRY_DISABLED=1 或 DO_NOT_TRACK=1 禁用。
模型目录:每个模型都是 packages/sie_server/models/ 中的一个配置;将 Hugging Face ID 传递给 SDK 即可使用。
集成:九大框架和向量存储集成的设置指南,提供 Python 和 TypeScript 两种版本。
示例:端到端项目集。
MCP 边缘:将文档工作从 Claude 和其他 MCP 客户端卸载到你的集群,节省 agent token。
我们为何构建 SIE:动机,在 AI Engineer Europe 2026 上分享。
superlinked.com/docs | Apache 2.0