Mistral发布Medium 3.5新模型
Mistral开源模型家族推出新版本,Hacker News热度500+。
Mistral开源模型家族推出新版本,Hacker News热度500+。
Mistral 已将 coding Agent 迁移到云端,通过 Mistral Medium 3.5 支持并行、异步执行任务。Mistral Medium 3.5 是一款全新的 128B 开放权重模型,针对长周期的编码与生产力工作进行了优化。本次更新在 Mistral Vibe 和 Le Chat 中引入了远程 Agent,同时新增 Work 模式,可处理研究、跨工具工作流等多步骤任务,并在敏感操作中始终保留人工监督。Mistral Medium 3.5 现已面向 Pro、Team 和 Enterprise 套餐开放,价格为每百万输入 token 1.5 美元、每百万输出 token 7.5 美元。
过去,coding Agent 大多运行在你的笔记本电脑上。今天,我们将它们迁移到了云端,让它们能够自主运行、并行处理任务,并在完成后通知你。你可以通过 Mistral Vibe CLI 启动这些 Agent,也可以直接在 Le Chat 中启动,无须离开当前对话,就能将编码任务交给它们处理。
这一切由正在公开预览的 Mistral Medium 3.5 提供支持。它是 Mistral Vibe 和 Le Chat 中新的默认模型,专为长时间执行编码和生产力任务而打造。Le Chat 全新的 Work 模式(预览版)进一步扩展了这项能力,提供了一个强大的 Agent,可处理研究、分析和跨工具操作等复杂的多步骤任务。
Mistral Medium 3.5 是一款全新的旗舰模型,将指令遵循、推理和编码能力融合进单个 128B 稠密模型中。模型以开放权重形式发布,采用修改版 MIT 许可证。
Mistral Medium 3.5 是一款全新的旗舰模型,将指令遵循、推理和编码能力融合进单个 128B 稠密模型中。模型以开放权重形式发布,采用修改版 MIT 许可证。
模型规模适中,仅需四块 GPU 即可自行托管,同时在真实场景中拥有出色表现。
模型规模适中,仅需四块 GPU 即可自行托管,同时在真实场景中拥有出色表现。
Mistral Vibe 远程 Agent 支持异步编码:session 运行在云端,可以从 CLI 或 Le Chat 启动,也可以将本地 CLI session 直接迁移到云端。
Mistral Vibe 远程 Agent 支持异步编码:session 运行在云端,可以从 CLI 或 Le Chat 启动,也可以将本地 CLI session 直接迁移到云端。
在 Le Chat 中启动 Mistral Vibe 编码任务。session 运行在同一个远程运行环境中,即使你暂时离开,也会继续执行。
在 Le Chat 中启动 Mistral Vibe 编码任务。session 运行在同一个远程运行环境中,即使你暂时离开,也会继续执行。
Le Chat 的 Work 模式运行在一个由 Mistral Medium 3.5 驱动的新 Agent 上。它会逐步处理多步骤任务,并行调用工具,直至完成工作。
Le Chat 的 Work 模式运行在一个由 Mistral Medium 3.5 驱动的新 Agent 上。它会逐步处理多步骤任务,并行调用工具,直至完成工作。
Mistral Medium 3.5 是我们的首款旗舰级融合模型,目前已开放公开预览。它是一个拥有 256k 上下文窗口的 128B 稠密模型,使用同一套权重处理指令遵循、推理和编码任务。它在真实使用场景中表现出色,并且仅需四块 GPU 即可自行托管。现在,每个请求都可以配置推理强度,因此同一个模型既能快速回复聊天消息,也能完成复杂的 Agent 任务。我们还从零开始训练了视觉编码器,使其能够处理不同尺寸和宽高比的图像。
Mistral Medium 3.5 在 SWE-Bench Verified 上取得了 77.6% 的成绩,领先于 Devstral 2,以及 Qwen3.5 397B A17B 等模型。它还拥有强大的 Agent 能力,在 τ³-Telecom 上取得了 91.4 分。
该模型专为长周期任务而打造,能够可靠地调用多个工具,并生成可供下游代码使用的结构化输出。正是它,让 Vibe 的异步云端 Agent 具备了实际发布的条件。
Mistral Medium 3.5 将成为 Le Chat 的默认模型。它还将在我们的 coding Agent Vibe CLI 中取代 Devstral 2。
从今天起,即使你暂时离开,编码 session 也能继续处理耗时较长的任务。多个 session 可以并行运行,你不再需要成为 Agent 每一步操作的瓶颈。
你可以从 Mistral Vibe CLI 或 Le Chat 启动云端 Agent。在其运行期间,你可以查看 Agent 正在执行的操作,包括文件 diff、工具调用、进度状态,以及执行过程中提出的问题。如果你希望让本地 CLI session 在离开后继续运行,也可以将正在进行的 session 迁移至云端,其 session 历史、任务状态和审批信息都会一并保留。
Vibe 可以接入工程团队已经在使用的各类系统,并在所有需要人工介入的环节保留人在回路。它可以连接 GitHub,处理代码和 pull request;连接 Linear 和 Jira,处理 issue;连接 Sentry,处理 incident;还可以连接 Slack 或 Teams 等应用,进行结果汇报。
每个编码 session 都运行在隔离的 sandbox 中,包括大范围编辑和安装操作。工作完成后,Agent 可以在 GitHub 上创建 pull request 并通知你,让你只需审查最终结果,而不必检查生成结果过程中的每一次按键。
它适合处理工作量大、定义明确、会占用开发者时间但不需要占用其判断力的任务,例如模块重构、测试生成、依赖升级、CI 问题调查和 bug 修复。
我们通过 Mistral Studio 编排的 Workflows,将 Mistral Vibe 引入 Le Chat。我们最初为内部编码环境构建了这项能力,随后将其提供给企业客户。今天,这项能力向所有人开放,任何人都可以从 Web 端启动编码任务。由于不再受限于本地终端,开发者可以同时并行运行多个任务。
你可以直接在 Le Chat 中启动编码 session。这样,在聊天中描述的任务会运行于 CLI 和 Web 端所使用的同一个远程运行环境,并在稍后以完成的 branch 或 draft PR 形式返回。
Le Chat 全新 Work 模式(预览版)。
Work 模式是 Le Chat 中一种强大的新 Agent 模式,专门用于处理复杂任务,由全新的运行框架和 Mistral Medium 3.5 提供支持。Agent 会成为 assistant 自身的执行后端,使 Le Chat 能够执行读取和写入、同时使用多个工具,并持续推进多步骤项目,直至完成你的要求。
以下是目前 Work 模式能够帮助你完成的工作。
跨工具工作流:在一次运行中集中处理 email、消息和 calendar 中的待办信息;结合来自你的信息源中的参会者背景、最新新闻和谈话要点,为 meeting 做准备。
跨工具工作流:在一次运行中集中处理 email、消息和 calendar 中的待办信息;结合来自你的信息源中的参会者背景、最新新闻和谈话要点,为 meeting 做准备。
研究与综合分析:围绕某个主题深入研究 Web、内部文档和已连接的工具,然后生成结构化简报或报告,你可以在导出或发送前对其进行编辑。
研究与综合分析:围绕某个主题深入研究 Web、内部文档和已连接的工具,然后生成结构化简报或报告,你可以在导出或发送前对其进行编辑。
分类处理收件箱并起草回复;根据团队和客户的讨论在 Jira 中创建 issue;通过 Slack 向团队发送摘要。
分类处理收件箱并起草回复;根据团队和客户的讨论在 Jira 中创建 issue;通过 Slack 向团队发送摘要。
session 的持续时间比普通聊天回复更长,因此 Agent 可以跨越多个回合持续工作,通过反复试错,一直执行到任务完成。在 Work 模式中,connector 默认启用,无须手动选择,因此 Agent 可以访问文档、邮箱、calendar 和其他系统,获取采取正确行动所需的丰富上下文。
Agent 执行的每项操作都清晰可见:你可以看到每次工具调用及其思考依据。在执行发送消息、写入文档或修改数据等敏感任务之前,Le Chat 会根据你的权限请求明确批准。
Mistral Medium 3.5 现已在 Mistral Vibe 和 Le Chat 中推出,并为 Pro、Team 和 Enterprise 套餐中的远程 coding Agent 及 Le Chat Work 模式提供支持。
通过 API 使用时,价格为每百万输入 token 1.5 美元、每百万输出 token 7.5 美元。开放权重已发布至 Hugging Face,采用修改版 MIT 许可证。
该模型也可用于原型开发:既可以通过 build.nvidia.com 上由 NVIDIA GPU 加速的 endpoint 托管使用,也可以作为可扩展的容器化推理微服务 NVIDIA NIM 使用。
与我们一起构建 Agent 系统的未来。
我们正在招聘研究、工程和产品领域的人才,共同推动 Agent 系统进一步发展。欢迎查看我们的开放职位。
业界领先的性能。更简单的企业部署。更高的成本效率。