Junie Local让用户在Mac上本地运行AI编程助手,输入/local即可下载约20GB模型并切换,完全离线、无限使用、不限token,模型是JetBrains针对其agent loop调优的Qwen3.6-27B(4-bit量化)。
JetBrains 发布了 Junie Local,这是其 AI 编程助手的本地运行版本,全部在你的机器上完成推理。不需要 token、不需要配额、不需要订阅,代码永远不会离开你的硬件。完全免费,安装只需一条命令:在 Junie 里输入 /local,模型开始下载、本地服务器启动、助手切换完毕。
这个动作之所以重要,是因为它直击了本地 AI 编程助手此前一直小众的三大痛点:配置摩擦、模型选型和质量。Junie 之前已经支持指向 Ollama 或 LM Studio、自带本地模型,但那意味着要自己选模型、调参数,而且要接受小模型只能处理简单任务的事实。Junie Local 把这些全部消除了——它自带一个 JetBrains 精选并针对自身 agent 循环调优过的模型,决策已经替你做完了。
以下是这次发布的具体内容、技术细节,以及免责条款里真正需要留意的地方。
在 Junie 里执行 /local。不需要写 JSON 配置、不需要先装运行时、不需要配置端点。大约下载 20 GB,之后所有操作都在你的硬件上运行,所以你的 prompt、源代码和 diff 都留在本地。
模型是 Qwen3.6-27B,4-bit 量化。硬件要求很明确:Apple M5 Mac,64 GB 内存。这个门槛直接刷掉了目前大多数桌面上的机器——这点我们稍后展开。
你现有的 Junie 配置完全保留,无需任何改动。Plan 模式、实时 prompt、Guidelines、Skills、以及你的 /commands 全部行为一致。正如 JetBrains 所说:引擎换了,agent 没变。
价格这一点值得反复强调:完全免费,无需注册、无需订阅、无需积分、无需绑卡。
随发布同步放出的深度解析是整个故事里最有参考价值的部分。所有人都在 benchmark 生成速度——也就是那张本地 LLM benchmark 图表里填充的 tokens/秒数字。但对于编程 agent 来说,这个指标恰恰不是应该追逐的目标。
编程 agent 大部分时间花在了 prefill 上,即读取文件以理解代码库正在发生什么。在出厂状态的 M5 Mac 上,prefill 速度约为 650 tokens/秒,而 RTX 5090 上约为 3,700 tokens/秒。当模型请求文件内容时,大部分等待时间在 prefill,而非生成。
JetBrains 深入分析了 prefill 缓慢的原因,发现了一个奇怪的现象:4-bit、8-bit、16-bit 量化下 prefill 速度完全相同。原因在于 prefill 是计算密集型(compute-bound),prefill 期间大多数矩阵运算都以完整的 16 位精度运行,与权重如何存储无关。M5 的 Neural Accelerator 有 M4 所不具备的 8 位算术指令。通过修补 MLX-VLM,使其在 prefill 期间将自注意力层的矩阵运算切换到 8 位,JetBrains 获得了约 40% 的 prefill 吞吐提升。该公司计划将此补丁以 PR 形式提交上游,同样的思路也可以通过修改 vLLM 的模型配置文件来实现。
这个指令集细节也是 Junie Local 从 M5 起步而非 M4 的原因。M4 的 16 位算术使 prefill 慢 20% 到 30%,而且完全无法使用 8 位优化技巧。
栈里还有更多技巧。Junie 现在将每个新请求直接加入 agent 的滚动上下文(rolling context),因此来自之前任务的 KV-cache 会被复用,而不是强制模型重新读取已经看过的文件。结合多 token 预测与 n-gram 匹配的投机解码(speculative decoding)将生成速度提升约一倍。
模型选型乍一看有些落后。Qwen3.8 更新,为什么要发 3.6?
因为 Qwen3.8 需要启用推理模式才能可靠运行。关闭它,质量下降得相当严重,模型甚至会陷入重复调用同一工具的死循环。开启推理后,大约会产生 5 倍的 token 量,最终折算下来任务慢约 4 倍。在如今的 Mac 上,老模型反而胜出。
Junie Local 发货时推理模式完全关闭。JetBrains 发现,开启推理带来的质量提升非常有限,但 token 消耗却多出两到三倍,折算下来任务执行速度约慢 2 倍。选择 4-bit 量化遵循同样的逻辑:benchmark 结果仅略逊于 8-bit,而由于生成是内存密集型(memory-bound),4-bit 速度快约一倍。
JetBrains 在模型正式接入 Junie 前,会在其自有私有测试集上对每个模型进行评估。在该测试集上,Qwen3.6-27B 与开启了 10,000 token 推理限制的 Sonnet 4.5 得分相当,GPT-5 medium effort 得分略高。
以正确的视角看待这些数字。本地模型关闭了推理运行,而云端模型开启了推理。而且测试集是 JetBrains 自有的,不是公开 benchmark,所以你无法独立复现这个对比。JetBrains 的实际主张是:日常工作中你可能不会注意到差距,而在复杂的架构密集型任务上,云端模型仍然领先。
一条有用的外部背景:JetBrains 自己的《开发者生态系统调查 2026》显示,90% 的专业开发者现在每周在工作中使用 AI 编程助手。对于这个群体来说,一个零 token 成本、设备端运行的选项是自然而然的下一步,尤其对于那些由于合同或法律限制不能将代码发送到云端 API 的人来说。
上面一切听起来像白送,某种意义上确实是,但有一个条件:你需要一台 M5 Mac,64 GB 内存。这是一台高配、昂贵的机器,不是任何人买的基准配置。如果你在用 16 GB 或 24 GB 统一内存的 M 系列 Mac,或者在 Windows 或 Linux 上,Junie Local 目前还不适合你。
20 GB 的下载量也意味着你要真正占用磁盘空间,而免费这个定价标签可以说还有第二个目的:它让硬件成为唯一的门槛,从而将需求推向 Apple 最高利润率的机型。这是推测,但这种对齐关系难以忽视。
Mac 是起点,不是计划。JetBrains 表示已经有了 NVIDIA DGX Spark 和 RTX 5090 的工作原型,也在关注 24 GB 显存的显卡。离散 GPU 上的 prefill 行为大不相同,它远不是那样的瓶颈,所以随着硬件变化,很多优化工作也会随之转移。
Junie Local 在你的 Mac 上完全本地运行 JetBrains 的 AI 编程助手,免费,无需账号或积分
一键命令 /local,下载约 20 GB,无需任何配置
运行 Qwen3.6-27B(4-bit),针对 Junie 的 agent 循环调优,推理模式关闭
真正的性能故事是 prefill 优化而非生成速度,包括一个在 M5 上带来约 40% 吞吐提升的 8-bit prefill 补丁
JetBrains 评定其与自有测试集上的 Sonnet 4.5 持平,GPT-5 medium 略胜
门槛是硬件:需要 M5 Mac 64 GB 内存,Windows、Linux 和离散 GPU 支持仍在原型阶段
如果你已经拥有一台顶配 M5 Mac,这是本周值得一试的简单选择。对其他人而言,这是一个值得关注的信号:主流 IDE 厂商首次认真尝试将设备端编程 agent 变成默认选项,而不是修补匠的玩物。
来源:JetBrains 官方公告 Junie Can Now Run Entirely on Your Mac 以及 How We Optimized the Qwen 3.6 Model for Our Junie Agent。