Chain-of-thought 推理显著提升代码/数学/Agent 任务准确率,但推理 token、工具调用和上下文扩展使账单难以预测,建议转向请求级定价模式。
Chain-of-thought reasoning 已成为从大语言模型中提取可靠、可验证结果的标准机制。DeepSeek R1、Kimi K2 Thinking、Qwen 3 等模型在给出最终答案前会生成明确的中间推理步骤。虽然这显著提升了代码、数学和 agent 任务的准确率,但也使 token 体积成倍膨胀。在按 token 计费的模式下,每一条推理 token、每一次工具调用、每一次上下文窗口扩展都会计入账单。对于运行 agent 循环或长上下文流水线的团队来说,这种不可预测性让预算成了噩梦。
推理模型不只返回答案。它们会探索假设、回溯、调用工具,通常会产生比最终输出长数倍的中间文本。在基于 token 的经济模型下,这一切都需要付费。
Agent 工作流让问题更加复杂。一个单一任务可能涉及:
按 token 收费的提供商,包括 Together AI、Fireworks AI、OpenRouter、Replicate 和 Anyscale,其成本与这个体积成正比。结果是,更重的推理和更丰富的上下文直接转化为更高的账单,而且这种方式在实际执行请求前往往难以预测。
Oxlo.ai 摒弃了按 token 计费,采用简单的契约:每个 API 请求一个固定费用,不受提示词长度或输出深度影响。这意味着,一条简短的问候和一条包含大量 chain-of-thought 的 1M token agent 轨迹,计费方式相同,都作为单个请求。
对于长上下文和 agent 工作负载,这种结构免除了推理税。你不需要为了节省 token 而裁剪系统提示词、压缩对话历史或禁用工具定义。相反,你可以设计最佳可能的提示词,让模型自行思考。
Oxlo.ai 完全兼容 OpenAI SDK,所以切换通常只需要修改 base URL。API 端点是 https://api.oxlo.ai/v1,热门模型没有冷启动问题。
该平台托管了超过 45 个模型,涵盖七个类别,其中包括多款为高级 chain-of-thought 推理而构建的模型:
DeepSeek R1 671B MoE:深度推理和复杂代码编写。
Kimi K2 Thinking:高级 chain-of-thought 推理。
Kimi K2.5 和 K2.6:高级推理、agent 编码和视觉,上下文最高达 131K。
Qwen 3 32B:多语言推理和 agent 工作流。
DeepSeek V4 Flash:高效 MoE 架构,1M 上下文窗口,接近最先进的开源推理能力。
GLM 5:744B MoE,用于长周期 agent 任务。
DeepSeek V3.2:编码和推理,免费层可用。
这些模型支持流式输出、函数调用、JSON 模式、多轮对话,以及适用的视觉能力。你可以通过 chat/completions 等标准端点使用它们。除推理外,Oxlo.ai 还托管了代码、视觉、图像生成、音频、embeddings 和目标检测的模型,全部采用相同的按请求计费模式。
由于 Oxlo.ai 使用 OpenAI SDK,你只需几行 Python 就可以运行 chain-of-thought 模型。以下示例将一个复杂的编码问题发送给 DeepSeek R1,并流式输出推理轨迹。
import openai
client = openai.OpenAI(
base_url="https://api.oxlo.ai/v1",
api_key="YOUR_OXLO_API_KEY"
)
response = client.chat.completions.create(
model="deepseek-r1-671b",
messages=[
{"role": "system", "content": "You are a helpful coding assistant. Think step by step."},
{"role": "user", "content": "Write a Python function that finds all palindromic substrings in O(n^2) time."}
],
stream=True
)
for chunk in response:
content = chunk.choices[0].delta.content
if content:
print(content, end="")
注意,这个请求的费用是固定的。无论模型用 500 个 token 还是 5,000 个 token 进行推理,账单都一样。你可以在 Oxlo.ai 定价页查看具体的计划详情。
按请求计费不只是计费上的便利,它改变了架构决策。团队不再需要在充分推理和成本控制之间权衡。
以下场景中 Oxlo.ai 比按 token 计费方案显著更便宜:
长上下文摄入。将长篇文档、代码库或对话历史输入具有 1M 上下文窗口的 DeepSeek V4 Flash 等模型,只算一个请求。
Agent 工具循环。在按量计费平台上,每次迭代向对话历史追加工具结果和推理轨迹都会增加 token。在 Oxlo.ai 上,每个往返算一个请求。
批量推理。在数千个样本上运行 chain-of-thought,受益于可预测的按请求计费经济模型。
对于长上下文工作负载,差异可达 10-100 倍,因为按 token 计费的提供商为每个输入和输出 token 收费,而 Oxlo.ai 只为请求本身收费。
Oxlo.ai 提供免费层,每天 60 个请求,覆盖 16+ 模型,包括 7 天全功能访问试用。付费计划从 Pro 的每天 1,000 个请求扩展到 Premium 的每天 5,000 个请求,两者均可访问全部模型,Premium 享有优先队列。Enterprise 计划提供自定义用量、专用 GPU,并保证比当前提供商节省 30%。
要开始使用,将你的 OpenAI 客户端指向 https://api.oxlo.ai/v1,选择一个推理模型,然后停止计算 token。