前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8598
  • 图解投机解码:为何生成 7 个 token 和 1 个耗时相同
  • video-use:让 Claude Code 帮你剪辑视频
  • 定时运行 Claude Agent 维护日志
  • Compound Engineering 发布多 IDE 编程增强插件
  • Uber 开源企业级 AI Agent 安全检测系统 ADR
  • 我用内核验证了 AI Agent 沙箱的真实隔离边界
  • 我让内核来验证沙箱是否真的锁住了
  • 本地优先的多跳 RAG:Chroma + 实体图实现零 token 查询
  • Qdrant 图层修复多跳向量检索难题
  • Claude Pro/Max/Team 限额真相:5小时窗口+周上限,按token计而非按消息
  • 英伟达开源Alpamayo 2 Super自动驾驶模型
  • Netflix推荐系统设计:ML系统设计深度剖析
  • 我造了一个实时检测免费LLM端点的工具
  • Prompt 本质是结构化上下文注入而非咒语
  • Cloudflare Wallet:让AI智能体持卡消费的支付基础设施
  • Cursor Google Workspace 插件安全检查清单
  • Cursor 发布:小模型与大模型之辩回归工程视野
  • Bug排查案例:追求根因而非表面修复
  • Meta发布Muse Spark 1.2:编程专用模型,支持端到端开发者工作流
  • Vercel沙箱防火墙功能向免费版开放
  • LLM CLI 0.32:推理过程可追踪、支持OpenAI服务器端工具
  • Claude Fable 5在Amazon Bedrock上的数据保留策略错误解决
  • 构建安全LLM系统:生产级授权实战指南
  • LLM安全实战:输入校验与结构化输出的硬核指南
  • Scientific Illustrator: 开源技术图可编辑转换工具
  • AI Swarm开发模式:突破团队Copilot效率天花板
  • AI Agent 如何记住用户偏好:键值记忆架构实战
  • Vercel Sandbox正式支持Devin Outposts
  • 阿里 Qwen 3.8-Max 开源:2.4T 参数、本地可跑、编程能力逼近 Opus 5
  • MCP 服务器:为什么你的 SaaS 需要一个(Python 实战)
  • 多终端 AI Agent 上下文复用:避免重复 Prompt 的实践
  • PixelRAG:将网页和PDF作为图像进行原生视觉索引的实战指南
  • Matt Pocock 开源 .agents 技能库:Claude Code 生产级工作流
  • MCP 服务器 demo 正常但模型不调用:工具描述写法决定成败
  • OpenAI 周活超10亿、GPT-5.6 Luna 降价80%, Codex 处理99.8%输出 token
  • llm-anthropic 0.26:支持Claude 5系列和服务端工具
  • LLM只能翻译,不能决策:算命app的工程教训
  • 我的应用里 LLM 被禁止做决策:规则引擎解耦实践
  • 373 个测试全绿,幂等性 bug 却让我多付了一次钱
  • Claude Code 沙箱安全边界详解:读写权限的取舍
  • OpenAI公布模型第三方网络安全评测
  • 开发者必读:SEO/AEO/GEO 搜索技术拆解
  • 我用 126 页站点验证 LLM 引用规律
  • 76% 已上线 Web 应用未配置 CSP 头部
  • CLAUDE.md 失效的 5 个常见错误及修复方法
  • DeepSeek AI Agent 被武器化用于代理劫持攻击
  • Keyv 供应链攻击关键信息:Shai-Hulud 行动
  • 如何写一个团队真正需要的代码审查SKILL.md
  • 树莓派跑AI Agent三个月:3B小模型的任务设计经验
  • 树莓派5本地跑AI推理:省掉每月40美元API费
  • MCP Workbench:MCP服务器的Postman式测试平台
  • 已加载 51 / 8598
8.0
热点
AI SCORE
工具产品2026-08-05 07:58

LLM CLI 0.32:推理过程可追踪、支持OpenAI服务器端工具

Simon Willison#LLM#CLI#AI编程工具
Editor brief · 编辑速览

LLM CLI工具新增推理可视化追踪、服务器端工具调用、SQLite日志重新设计,并内置GPT-5.6支持。开发者可直接在终端查看模型思考过程,或用CodeInterpreter执行代码。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

LLM 0.32 新版本支持推理追踪、OpenAI Responses、服务端工具和更智能的日志

今早发布了 LLM 0.32,这是自项目启动以来最重要的新版本。新版支持可见的推理追踪、服务端 provider 工具、重构的内容寻址 SQLite 日志、新模型以及由 OpenAI Responses API 驱动的多项新功能。同时还发布了新版 llm-anthropic 插件,带来了大量更新。

对推理模型运行 LLM 现在会将推理追踪显示到标准错误输出,这样你就能看到模型在"思考"什么,而不会把这些信息混入可能需要通过管道传给其他工具的标准输出中。添加 -R/--hide-reasoning 可以关闭此功能。

Running llm "think about the best thing about pelicans" in the macOS terminal window - grey text outputs saying Exploring pelican qualities, then after a paragraph of that a white paragraph of text comes out saying: The best thing about pelicans is their wonderfully oversized, practical design: that enormous bill and pouch look comical, but they make pelicans remarkably skilled fishers. Even better, many species cooperate—working together to herd fish before scooping them up. They're a great mix of goofy, graceful, and surprisingly clever.

LLM 开箱即用支持 GPT-5.6 模型系列,新的默认模型(与 llm "prompt" 一起使用)是经济实惠但能力不俗的 GPT-5.6 Luna。

LLM 调用现在可以使用来自各种 provider 的服务端工具。OpenAI 提供了代码执行环境作为服务端工具;LLM 现在可以运行需要该功能的 prompts,示例如下:

llm --tool CodeInterpreter 'Show current python and SQLite versions'

OpenAI 还有一个 WebSearch 工具。

llm-anthropic 插件新增了 WebSearch、WebFetch、CodeExecution 和 AnthropicMCP,用法如下:

llm -m claude-sonnet-5 -T 'AnthropicMCP("https://datasette.simonwillison.net/-/mcp")' \
  'how many rows in the blog_blogmark table?'

这会促使 Anthropic 在与他们的 API 的单次请求/响应交互中执行 MCP 调用,目标是 datasette-mcp 插件。

新的 llm openai endpoint 命令提供了一个工具,可以作为单行命令向任意 OpenAI 兼容端点执行 prompts。这些不会记录到日志中,因此这是针对任何支持 LLM API 世界通用语言的端点运行一次性 prompts 的便捷工具。

以下是我如何用它来通过 uvx(无需安装 LLM)运行针对本地 LM Studio API 中托管的 Gemma 4 12B 的 prompts,并配合 llm-tools-quickjs 插件使用:

uvx --with llm-tools-quickjs \
  llm openai endpoint http://localhost:1234/v1 -m google/gemma-4-12b \
  -T QuickJS 'Use QuickJS to multiply 3434 * 2434' --td

Output reads Tool call: QuickJS_execute_javascript({'javascript': '3434 * 2434'})  8358356 The result of 3434 * 2434 is 8,358,356.

LLM 之前的 Python API 需要你创建一个对话,然后一次一条地发送消息。这是对 LLM 本质的抽象——每个请求都携带了之前所有消息的完整历史。这种抽象在某些更高级的场景中开始成为障碍,因此新版本引入了 model.prompt(messages=[]) 参数,可以这样使用:

import llm
from llm import user, assistant, system

model = llm.get_model("gpt-5.6-luna")

response = model.prompt(messages=[
    system("You are a helpful pirate."),
    user("What is the capital of France?"),
    assistant("Paris, matey."),
    user("And Germany?"),
])
print(response.text())

LLM 之前从每个 prompt 返回一个字符串可迭代序列。当模型返回字符串响应时这很有效,但无法预测模型后续演进的奇怪形态。如今许多模型返回推理文本、输出字符串、工具调用甚至图像附件的混合内容。使用 LLM 0.32,你可以这样做:

for event in model.prompt("Explain cats").stream_events():
    if event.type == "reasoning":
        print(f"[thinking] {event.chunk}", end="", flush=True)
    elif event.type == "text":
        print(event.chunk, end="", flush=True)
    else:
        print(f"Other event: {event}")

结合这些功能,我们终于可以提供一个可靠的 OpenAI chat completions API 实现,我已将其作为 llm-chat-completions-server 插件发布:

llm install llm-chat-completions-server
llm chat-completions-server --port 9000
# Server is now running on http://127.0.0.1:9000/v1

现在你可以用新的 llm openai endpoint 命令通过该服务器向 LLM 运行 prompts 了!

llm openai endpoint http://127.0.0.1:9000/v1 'hello' -m gpt-5.4-mini

这类 API 更具挑战性的问题在于日志。如果我们打算支持在每次请求时向消息序列追加内容的模式,理想情况下应该避免为每一轮重复记录所有冗余的 JSON。

解决方案是新的内容寻址消息存储,其设计借鉴了 Git。你可以在文档中看到新的 schema,但 llm logs 和 llm logs --json 命令都已升级,可以将该格式转换回易于消费的形式。

这个版本还有更多内容。0.32 发布说明相当详尽,0.32rc2、0.32rc、0.32a3、0.32a2 和 0.32a0 的说明应该能填补所有遗漏。

现有的 LLM 插件都可以继续工作,但提供额外模型的插件需要升级到 0.32 才能充分参与新的流式事件系统。文档中有指南说明如何用 Structured messages 和流式事件实现插件。

我已更新了一些自己的插件:

llm-anthropic 0.26 新增了对 Claude 5 模型系列的支持,以及 WebSearch、WebFetch、CodeExecution 和 AnthropicMCP 服务端工具。

llm-gemini、llm-openrouter 和 llm-mistral 也在收尾中,发布在即。

这个版本中许多底层工具的改进是由 Datasette Agent 的需求驱动的。当我开始做 LLM 时,"agent"这个词的定义非常模糊,以至于我拒绝使用它。2025 年 9 月,我转而认为"LLM agent 运行工具循环以实现目标"这一定义已经足够成熟,我可以不再完全回避这个词了。

工具链现在可以暂停等待人类批准,并从存储的消息历史中恢复——这两者都是 Datasette Agent 所需的功能。

看着今天的 LLM,它开始越来越有 agent 的形态了。将一个 CLI 工具与来自不同来源的不同工具和不同模型混合搭配作为单行命令使用,这感觉很巧妙;它还包含一个功能足够强大的 Python 库,可以构建 Datasette Agent 和 llm-coding-agent 这样的系统。

也许下一个版本的 LLM 会将"agent"的概念 baked 到核心库中。我仍在思考这会是什么样子。

无状态 MCP 重新引起了我的兴趣(并催生了 mcp-explorer 和 datasette-mcp) - 2026 年 7 月 31 日

OpenAI 对 Hugging Face 的意外网络攻击是已经发生科幻小说 - 2026 年 7 月 22 日

本文是 Simon Willison 所著的 New release of LLM adds support for reasoning traces, OpenAI Responses, server-side tools, and smarter logging,发布于 2026 年 8 月 4 日。

系列文章:LLM 新版本

Large Language Models can run tools in your terminal with LLM 0.26 - 2025 年 5 月 27 日,下午 8:35

LLM 0.27,注释版发布说明:GPT-5 和改进的工具调用 - 2025 年 8 月 11 日,下午 11:57

LLM 0.32a0 是一个重大的向后兼容重构 - 2026 年 4 月 29 日,下午 7:01

New release of LLM adds support for reasoning traces, OpenAI Responses, server-side tools, and smarter logging - 2026 年 8 月 4 日,下午 11:58

上一篇:无状态 MCP 重新引起了我的兴趣(并催生了 mcp-explorer 和 datasette-mcp)

Sponsor me for $10/month and get a curated email digest of the month's most important LLM developments.

Pay me to send you less!

Original source

本文由 AI 翻译整理自 Simon Willison,原文版权归原作者所有。

阅读英文原文
上一篇
Vercel沙箱防火墙功能向免费版开放
下一篇
Claude Fable 5在Amazon Bedrock上的数据保留策略错误解决