先说结论

如果你今天只想知道 Mistral Medium 3.5 到底值不值得看,先记住这 8 句话:

  • Mistral 在 2026 年 4 月 29 日 左右把 Mistral Medium 3.5 推到公开视野里,并在官方博客里把它定义成 “first flagship merged model”,核心目标是把 instruction-followingreasoningcoding 合到同一套权重里。
  • 截至 2026 年 5 月 22 日,Mistral 官方文档已经确认它是一个 128B dense256K context、支持多模态输入的开放权重模型,并采用 Modified MIT 许可。
  • 官方同时给出两个很关键的现实信号:它可以 self-host on as few as four GPUs,并且已经替换 Devstral 2 成为 Mistral Vibe 编码 Agent 的默认模型。
  • 从 API 价格看,官方公开价是 输入 $1.5 / 1M tokens,输出 $7.5 / 1M tokens。这不算低价跑量模型,但也没有冲到 Claude / GPT 的最高价层。
  • Mistral 官方公开 benchmark 里最值得看的不是泛泛的“更强了”,而是 77.6% SWE-Bench Verified91.4 on τ³-Telecom,这说明它重点在 Agent 编码和长任务执行,不是只卖聊天体验。
  • 如果你现在主要在比较 Claude CodeCodexQwenDeepSeek 这些路线,Mistral Medium 3.5 最值得看的不是“欧洲也有一个大模型”,而是 开放权重 + 远程 Agent + Work mode 这套组合。
  • 对中国用户来说,它今天不一定是最容易落地的默认主力层,因为本地社区、中文资料、价格敏感型 API 和国内工作流接入上,QwenDeepSeek 仍然更顺手;但如果你关心 欧洲合规、开放权重、企业私有化和代码 Agent,它非常值得进候选名单。
  • 一句话判断:
    • 普通开发者:先把它当值得跟踪的开放权重高端模型。
    • 进阶 Agent 用户:重点看 Vibe remote agentsLe Chat Work modereasoning effort
    • 站长、工具团队和企业:重点看它能不能在 自托管、可审计和多工具编排 之间给出更平衡的路线。

如果你要把它放回站内模型路线里看,建议顺手看:

同方向标杆页面怎么写,我们补了什么?

这次同方向最值得研究的页面,主要有三类:

  • Mistral 官方 model card,把关键购买信息压得很短:256k$1.5 / $7.5Modified MIT licenseagentic and coding use cases
  • Mistral 官方 Vibe remote agents 博客,不先讲愿景,而是先告诉开发者:默认模型换了、远程 Agent 上线了、Le Chat 里能跑 Work mode 了。
  • Hugging Face 官方模型卡,会把工程团队最在意的 reasoning effort、多语言、函数调用、Agent benchmark 和许可范围一次列出来。

这些标杆共同做对的一件事是:

先讲能不能接住真实工程任务,再讲“这是个多大参数的模型”。

站内这篇补的,是中文用户最缺的三层判断:

  1. 它适合放在你的哪一层,而不是只看 benchmark。
  2. 开放权重APIVibe remote agents 三条线分别意味着什么。
  3. 中国团队今天什么时候该试,什么时候该继续用 Qwen / DeepSeek / Claude / Codex

Mistral Medium 3.5 到底发布了什么?

先把事实说清楚。

按 Mistral 官方公开页面,Mistral Medium 3.5 现在最关键的公开信息有 7 个:

  • 它是 128B dense 模型,不是 MoE。
  • 它支持 256K context window
  • 它是 multimodal,支持文本和图像输入、文本输出。
  • 它用 Modified MIT 许可发布开放权重,不是完全无条件的传统 MIT。
  • 它的 reasoning effort 可以按请求配置,不是把推理和快答拆成完全不同型号。
  • 它已在 Le Chat 里替代旧的中高端路线,并在 Mistral Vibe 里替代 Devstral 2
  • 官方公开价格是 input $1.5 / 1M tokensoutput $7.5 / 1M tokens

这些点放在一起,真正的含义不是“又多了个欧洲模型”,而是:

Mistral 正在把 开放权重旗舰、代码 Agent、远程执行和企业工作模式 收到一条更完整的产品线上。

这次最值得看的,不是参数,而是“统一模型 + 远程 Agent”

很多人看 Mistral Medium 3.5 第一眼会被两个点吸引:

  • 128B
  • 开放权重

但真正更重要的,是它后面跟着的两条产品动作:

  • Mistral Vibe remote agents
  • Le Chat Work mode

为什么这比参数更重要?

因为官方自己已经把判断重点写出来了:

  • 它成了 Vibe 的默认编码模型。
  • 它支持 agent 级工具调用和结构化输出。
  • 它能在云端持续跑长任务,并允许多个 session 并行。

也就是说,Mistral 不是只在卖一个“能下载的模型”,而是在卖一整条更适合工程团队的路线:

  1. 本地或私有化可以考虑开放权重。
  2. 需要云端长任务时,可以接 Vibe remote agents
  3. 需要跨工具复杂任务时,可以进 Le Chat Work mode

哪些团队最该试,哪些团队不该急着换?

1. 最值得优先试的人

更适合优先测试 Mistral Medium 3.5 的,通常有这些特征:

  • 你已经在认真评估代码 Agent,而不是只用聊天工具问几句。
  • 你希望保留 开放权重 或自托管路线,不想完全押注闭源 API。
  • 你做的是长任务、异步任务、多工具任务,比如大规模改代码、测例补全、CI 调查、文档整理。
  • 你所在团队对 欧洲合规私有化可审计 或供应商分散有明确要求。

2. 不该马上全量迁移的人

如果你属于下面这些情况,今天更该观察,而不是立刻替掉现有主力:

  • 你最看重的是中文效果和国内社区经验。
  • 你当前预算极度敏感,需要比 $1.5 / $7.5 更低的 API 分层。
  • 你已经在 Claude CodeCodex 或国内模型上跑出了稳定效率。
  • 你需要的是“开箱即用的产品成熟度”,而不是一条更灵活的工程路线。

中国用户今天更现实的判断方式

如果你是中文开发者或工具团队,今天看 Mistral Medium 3.5 最稳的顺序不是先看参数,而是:

  1. 你更需要 开放权重 还是更需要低价 API。
  2. 你更需要 欧洲 / 企业合规,还是更需要中文生态和本地社区。
  3. 你是真要做 Agent 编码,还是只是想找一个通用聊天替代。

如果你的答案更偏:

  • 中文优先
  • 低价优先
  • 社区资料多优先
  • 国内 API 接入顺手优先

那今天更实际的路线通常还是:

  • Qwen
  • DeepSeek
  • 或者继续用闭源高质量编码入口

如果你的答案更偏:

  • 私有化
  • 欧洲部署
  • 多工具 Agent
  • 长任务远程执行

Mistral Medium 3.5 就值得认真进 shortlist。

它更像谁的替代项,不像谁的替代项?

更像替代“分裂的工程路线”

它最可能替代的是这种分裂结构:

  • 一个开放模型做私有化
  • 一个闭源模型做高质量代码推理
  • 一个单独 Agent 框架做异步任务

因为 Mistral 现在试图把这些层收得更近。

不像“直接替掉所有闭源编码工具”

它今天还不该被理解成:

  • 立刻替掉所有 Claude Code
  • 立刻替掉所有 Codex
  • 立刻替掉所有 Cursor

原因也很直接:

  • 产品成熟度、团队协作、插件生态和默认体验,不只看模型。
  • 中国团队真实落地时,还要看文档、连接器、账号体系和社区实践。
  • 开放权重带来的灵活性,不自动等于最低总成本。

为什么 77.6% SWE-Bench Verified 很重要,但不能单独决定一切?

Mistral 官方把 77.6% SWE-Bench Verified 放得很靠前,这是合理的,因为它直接对应代码修复和 Agent 编码能力。

但你今天不能只拿这个数就做采购决策,原因有三个:

  1. SWE-Bench Verified 更像“解决真实代码问题的上限信号”,不等于你团队今天的真实完成率。
  2. 工程团队的总成本,不只取决于模型答对多少,还取决于:
    • 能不能并行
    • 能不能看 diff
    • 能不能接现有工具
    • 人工审批链顺不顺
  3. 你如果最终还是要自己托管、做权限边界、接内部系统,那真正成本不只在 token。

所以更稳的做法不是“看到 77.6% 就全换”,而是拿自己的真实仓库和任务做灰度测试。

站长和工具团队今天最值得看的,是“可审计的 Agent 路线”

对站长、开发平台团队和企业自动化团队来说,Mistral Medium 3.5 最值得看的不只是模型分数,而是这条路线:

  • 开放权重
  • 远程 Agent
  • Work mode
  • 可看 diff、可见工具调用、显式审批

这意味着它更像:

  • 一个可被接进工程体系的执行层
  • 而不只是一个聊天窗口里的聪明模型

如果你正在做:

  • 自动修复
  • 批量重构
  • 测试补全
  • 文档与代码联动
  • 受权限约束的企业 Agent

那它的信号价值会大于“普通用户对话好不好聊”。

质量门槛判断

如果一篇 Mistral Medium 3.5 文章只会说“欧洲出了个 128B 开放模型”,那它通常不如官方模型卡有价值。

真正值得保留的判断页,至少要回答清楚:

  • 它到底适合放在默认层、编码层还是远程 Agent 层。
  • 开放权重VibeLe Chat Work mode 各自意味着什么。
  • 中国团队为什么不能只看 benchmark 就下结论。
  • 它什么时候值得进 shortlist,什么时候继续观望更合理。

常见问题

Mistral Medium 3.5 是开源模型吗?

更准确地说,它是 open weights,并采用 Modified MIT 许可。它不是“毫无额外约束的传统 MIT 代码仓库”那种理解方式,企业在正式使用前仍然需要看清许可条款。

它现在最适合什么任务?

按 Mistral 官方公开描述,它最适合 agentic and coding use cases,包括长任务编码、结构化输出、多工具调用、远程异步执行和复杂工作模式,不是只做聊天回复。

4 张 GPU 就一定能低成本跑起来吗?

不能这么简单理解。官方说的是它能 self-host on as few as four GPUs,这说明它具备私有化可行性,但真实成本还要看你用什么 GPU、推理框架、量化方式、并发量和稳定性要求。

它现在就能替掉 Qwen 或 DeepSeek 吗?

不能一刀切。对中文优先、低价优先、国内工作流优先的团队,QwenDeepSeek 今天依然更容易落地;对看重开放权重旗舰、欧洲路线和远程 Agent 的团队,Mistral Medium 3.5 才更值得测试。

这篇文章的首图来源是什么?

首图是本站自制信息图,文件位于 /article-images/mistral-medium-3-5-guide-2026-05-22.svg。视觉依据来自 Mistral 官方模型卡、Vibe remote agents 公告和 Hugging Face 官方模型卡中的 128B、256K、价格、许可与 Agent 路线信息整理,没有嵌入来源不明图片。

资料来源

延伸阅读