实测 Qwen2.5-Coder-32B 在代码编辑任务上独立跑分72.9%,比 Claude 3.5 Sonnet 低约10个百分点;MoE架构的 DeepSeek-Coder-V2-Lite 仅2.4B活跃参数即可运行。
两个数字放在一起看才有意义。Qwen2.5-Coder-32B 官方 Aider 得分——Qwen 自己在技术报告中给出的数据是 code editing 任务 73.7%。在同一基准测试上由第三方独立运行同一模型,得到 72.9%;而旁边的 Claude 3.5 Sonnet 测出了 84.2%,failingfast.io 的作者写道。同一个模型,厂商数据和第三方数据的差距很小,但与当前云端霸主的差距——稳定在 10 多个百分点。这不是在说「本地模型不行」,而是具体画出了一条线,过了这条线就该人工 review 了。
过去一年,边界之所以向前推进,靠的是架构演进,而不是粗暴堆参数。MoE 模型不会激活整个网络来处理每个 token,而是只激活其中一小部分:DeepSeek-Coder-V2-Lite-Instruct 总共 160 亿参数,但推理时实际激活的只有 24 亿,模型卡上注明了。Qwen3-Coder-30B-A3B 保持类似的比例——总共 305 亿参数,活跃部分 33 亿,上下文 256K,可扩展到 1M,Unsloth 量化版模型卡显示。Devstral Small 2 走了另一条路——24B 密集参数,但采用 Apache 2.0 许可证,号称可以在单张消费级 GPU 上运行,甚至可以不依赖独立显卡,Mistral 发布公告中指出。正是这个组合——MoE 的稀疏激活加上 Devstral 的紧凑——让 16–32 GB 首次成为真实项目的工作区间,而不是 Demo 玩具。
量化模型显存参考:7B 约需 5 GB,14B 约需 9 GB,32B 约需 20 GB,failingfast.io 上的实战拆解指出——这些数字没有明确标注量化等级和上下文窗口,所以长对话场景下实际显存消耗会更高。
实际配置方案对任何档位都一样:Ollama 或 llama.cpp 加上 VS Code 里装 Continue.dev 插件,两个模型各司其职——比如 qwen2.5-coder:1.5b 做补全,qwen2.5-coder:7b 做对话,通过 config.json 配置,SitePoint 指南里有步骤说明。指南作者诚实地说自己没有给出答案质量的实测数据——安装步骤可以验证,但对你的具体仓库有多大帮助,他没测。
Ben Hall,Katacoda 创始人、failingfast.io 作者,在自己的硬件上做了实战测试后,给不想深究选项的人一个建议:「If you just want to have something chosen for you and get started, use Qwen as your default coding assistant」——同时在同一篇文章里指出,模型真正翻车的场景恰恰是多文件的架构类任务,failingfast.io 上的评论。这与上表吻合:Qwen2.5-Coder 能覆盖 32 GB 档位的代码修改,但覆盖不了架构设计。
最常被忽视的反方观点

支持本地运行最常见的论调是:代码不离开内网,合规问题就解决了。这至少有一半是错的。Cyberhaven Labs 报告显示,2025 年编程用 endpoint 智能体数量增长了 509%,到 2025 年 12 月使用 AI 助手辅助开发的开发者比例达到 49.5%,Cyberhaven 写道——这些是 DLP 解决方案厂商的数据,他们有商业动机去卖出对抗这个风险的产品,但问题规模的判断是正确的。本地运行消除了一条攻击向量——向第三方 API 传输代码。但它解决不了智能体对 shell、凭证和文件系统的访问问题,解决不了通过仓库内容进行的 prompt injection,也解决不了插件和 MCP 服务器的供应链风险。
Simon Willison 说得更直白:「I think we're due a Challenger disaster with respect to coding agent security」——他的意思是,编程智能体(包括本地的)大规模运行在系统权限过度开放、缺乏管控的环境里,simonwillison.net 上的帖子。nolabs.ai 说法更中立:本地模型默认既不更安全也不更不安全,它们的风险画像不同——数据外传的风险消除了,但基础设施打补丁和防范较小模型的 jailbreak 攻击,责任全落在组织自己身上,来源:nolabs.ai,这是一篇公认的概念性分析,没有自有实证测试。
从这场争论得出的实践结论不是「别用本地智能体」,而是「先把权限问题从模型权重物理存放在哪的问题里独立出来处理」:限制智能体对 shell 的访问到具体命令,MCP 服务器和插件只从可信来源获取,不给智能体提供当前任务不需要的凭证访问权限,按计划更新模型和工具,而不是等出事了才打补丁。
并非所有云端禁令都是一回事

「云端被禁」这个说法在实践中很少是绝对的。BNY Mellon 整体屏蔽了对公共 LLM 的访问,理由是数据处理涉及信义义务,moveo.ai 列举了这个案例。三星在 2023 年 3 月的 20 天内发生三起事故——包括把源代码上传到 ChatGPT——之后采取了类似的全面禁令,并部署了内部安全环境——这个先例很老,但很有说明性,同一出 moveo.ai 综述的数据。而民主党全国委员会在 2026 年 4 月只明确禁止了 ChatGPT 和 Claude,理由是模型来源问题,但允许 Gemini 用于代码和数据分析——这个禁令实际上是按厂商列的例外清单,而非通用规则,同一个清单来自 moveo.ai。
Mistral 联合创始人 Timothy Lacroix 在 Vibe 2.0 发布会上干脆提议换个框架:「The fact that it's on-prem, I think, is less relevant than the fact that it's owned by the company」,VentureBeat 引述——也就是说,比起推理引擎的物理位置,谁控制权重和数据的流向更重要。这是厂商立场,销售的也包括同一模型的云端 API,所以不该把它当作中立观点来接受——但对读者来说它有实操价值:如果你的禁令其实是针对特定厂商的,而不是全面禁令,值得主动向合规团队确认允许例外的清单,而不是默认认为所有云端都关了。
如果你的情况恰好是这种部分禁令——部分仓库在严格的本地隔离环境里,部分允许使用已获批准的云端厂商来做质量对比——明智的做法是不必每次换厂商都手动重写集成客户端。provod.ai 提供了与 OpenAI 兼容的协议,通过单一密钥访问模型目录:你已经在本地敏感环境配置好的同一个 Continue.dev,对于获准使用云端的部分,只需切换 base URL,不需要重写客户端。
系列旗舰 Qwen3-Coder-480B-A35B,480 亿参数中活跃参数 350 亿,开发者宣称在智能体任务上可与 Claude Sonnet 4 媲美,Qwen 博客——正好说明这个系列的质量上限远在 16–32 GB 预算之外。对于这个显存区间,在用的是上表中列出的较年轻 MoE 变体,而「本地编程模型的自主性在哪里结束、人工 review 在哪里成为必须」这个问题,应该按具体任务来判断,而不是凭「本地的就是更差」这种感觉。
provod.ai — 全球 AI 模型目录,支持俄罗斯支付
无需海外银行卡和绕过支付方案即可连接所需模型:通过俄罗斯平台访问,余额用卢布充值。
一个目录涵盖文本和媒体最新模型:OpenAI 的 GPT、Anthropic 的 Claude、Google 的 Gemini、xAI 的 Grok、DeepSeek、Qwen、GLM、Kimi 和 MiniMax;图像方面——Nano Banana 2 Pro 和 GPT Image;视频方面——最新版的 Seedance、Kling、Veo 和 Google Omni。此外还有用于推理、搜索、文档、Embedding、音乐和音频的模型。
俄罗斯支付方式不会抬高模型本身价格:价格与官方费率 1:1 对应,provod.ai 不加收自己的溢价。
开始使用,绕过支付障碍:注册表单 · 模型价格 · 符合 152-ФЗ 的数据保护 · provod.ai 首页
Qwen2.5-Coder Technical Report, arXiv
Local AI Models for Coding: Is It Realistic in 2026? — failingfast.io
Introducing: Devstral 2 and Mistral Vibe CLI — Mistral AI
Qwen3-Coder-30B-A3B-Instruct-GGUF 模型卡 — Unsloth AI at Hugging Face
DeepSeek-Coder-V2-Lite-Instruct 模型卡 — Hugging Face
Complete VS Code + Ollama + Continue Setup — SitePoint
What Is a Local Coding Agent? Security Risks Guide — Cyberhaven Labs
LLM predictions for 2026 — Simon Willison
Local Language Models and Security — nolabs.ai
Companies Banning ChatGPT (2026): The Enterprise Security List — Moveo.AI
A European AI challenger goes after GitHub Copilot: Mistral launches Vibe 2.0 — VentureBeat
Qwen3-Coder: Agentic Coding in the World — Alibaba Qwen Team