当前位置: 首页 > news >正文

模型路由正在取代模型本身,成为 AI 基础设施的新战场

四个路由产品

AI 圈的关键词不是某个新模型,而是「路由」。7 月 21 日,vLLM 社区发布 Semantic Router 新篇章,正式提出 Mixture-of-Models(MoM)架构;7 月 22 日,Cursor 上线 Cursor Router,把智能模型路由做成团队级产品;7 月 23 日,Merge 发布 Fusion,用「多模型面板 + 裁判模型」合成单一答案;同日,Runway 推出 Media Router,把路由思路搬进了图像/视频/音频生成领域。

四家公司,四个赛道,同一个判断:当模型迭代快到没有人能押注单一供应商时,「选哪个模型」正在从一次性架构决策,变成每个请求级别的动态决策。

为什么是现在?一笔算得清的账

Cursor 公布的数据很能说明问题:约 60% 的开发者日常只使用一个固定模型作为「主力驾驶」。这意味着大量常规任务——改个 UI、写个单测、格式化文档——都在按前沿模型的价格计费。Cursor Router 用 60 万条真实请求训练了一个请求分类器,在数百万请求的在线 A/B 测试中验证:

模式

效果

成本变化

Auto Intelligence

用户满意度接近 Fable 5

成本降低约 60%

Auto Balance

满意度高于 Opus 4.8

成本降低约 36%

早期企业客户实测

质量无下降

单请求节省 30%–50%

按单次 commit 计算,Intelligence 模式成本 $$6.76,Balance 模式$$4.63,而全程使用 Fable 5 是 $$12.69、Opus 4.8 是$$7.34。路由的本质,是把「成本-智能」的帕累托前沿变成一个可调参数。

与此同时,模型侧的价格战还在加剧:7 月 21 日 Google 发布的 Gemini 3.6 Flash 定价 $$1.50$$7.50(每百万输入/输出 token),输出 token 用量比 3.5 Flash 少 17%;7 月 16 日发布的 Grok 4.5 定价 $$2$$6,号称 2 倍 token 效率。模型每两周换一轮性价比排名,任何硬编码单一模型的架构都会在下一次发布后立刻「过时」。

三种路由范式:分类器、面板、系统

这一波产品其实代表了三种不同的技术路线:

1. 分类器路由(Cursor Router):在请求进入模型之前,用一个轻量分类器分析 query、上下文、任务复杂度和领域,再结合各模型的行为画像做匹配——简单任务走高性价比模型,UI 修改走「品味最好」的模型,长程复杂问题走前沿推理模型。关键设计是为「模型频繁更新」的世界准备的:新模型发布后只需更新分类器,而不是重写应用。

2. 面板合成(Merge Fusion):一次 API 调用把 prompt 并行发给至少 2 个分析模型,再由一个独立的裁判模型(judge)评估各候选答案并合成最终输出。代价也很直白:3 模型面板约产生 4 次计费调用,且不支持流式输出。适合研究、分析这类「质量优先于延迟」的场景。

3. 系统级 MoM(vLLM Semantic Router):走得最远的一条路——把多个独立模型、路由策略、偏好、评估套件打包成一个带版本号的复合模型工件,可以像单一模型一样被训练、评估、导出、部署和调用。与 MoE 在单次前向传播内路由 token 不同,MoM 协调的是架构、许可证、模态、硬件都可能不同的独立模型。

对开发者来说,好消息是这三种范式共享同一个前提:OpenAI 兼容的统一接口。切换模型只需要改一个字段:

from openai import OpenAI client = OpenAI(base_url="https://wrouter.ai/v1", api_key="xx-...") # 简单任务:高性价比模型 resp = client.chat.completions.create( model="gemini-3.6-flash", messages=[{"role": "user", "content": "把这段 JSON 转成 CSV"}], ) # 复杂推理:切到前沿模型,只改 model 字段 resp = client.chat.completions.create( model="claude-opus-4-8", messages=[{"role": "user", "content": "审查这个分布式锁实现的竞态条件"}], )

多模型架构的第一步是统一接入层

路由策略可以慢慢调,但所有路由的前提是:你得先有一个能稳定访问所有模型的接入层。这恰恰是国内开发者最大的痛点——OpenAI、Anthropic、Google 的 API 各有各的协议、计费和网络门槛,自己维护多套 SDK 和密钥,等于把 Cursor 用分类器解决的问题,用人肉运维又做了一遍。

这也是 wrouter.ai 这类模型中转站的价值所在:把 GPT、Claude、Gemini 等主流模型收敛到一个 OpenAI 兼容端点后面,开发者拿一个 key 就能实现上面代码里的「改一个字段换模型」。具体到选型,三点值得关注:

  • 稳定:生产流量最怕单一上游抖动,统一接入层自带冗余价值——上游波动时应用层无感;

  • 模型完整:路由策略的上限取决于模型池的广度,主流前沿模型齐全,新模型跟进快,分类器才有的可选;

  • 合规:以合规方式提供服务、账单透明,这在「路由即采购」(每个请求都是一次购买决策)的时代,是审计链路的基础。

一个务实的演进路径:先用统一接口把应用和具体供应商解耦(一天内可完成),再逐步引入分层策略——比如 80% 常规请求走 Flash 级模型、20% 复杂任务升级到前沿模型,最后才考虑引入自动分类器。Cursor 的数据说明,哪怕只做到第二步,30% 以上的成本节省就已经到手了。

结语

2026 年上半年,行业还在争论「哪个模型最强」;这个七月,Cursor、Merge、Runway、vLLM 用产品给出了另一个答案:没有永远最强的模型,只有始终在线的路由。当推理成本占到头部实验室收入的一半以上,当模型排名每两周洗一次牌,把模型选择权从架构图里拿出来、放进每一次请求里,是所有认真做 AI 应用的团队迟早要走的一步。不妨从统一接入层开始,今天就把第一行base_url改掉。

来源

  • Cursor: Introducing Cursor Router — https://cursor.com/blog/router

  • vLLM Blog: Beyond a Single Model — Mixture-of-Models — https://vllm.ai/blog/2026-07-21-vllm-sr-new-chapter-mom

  • RuntimeWire: Merge launches Fusion — https://runtimewire.com/article/merge-launches-fusion-multiple-ai-models-one-answer

  • TechCrunch: Runway launches AI model router — https://techcrunch.com/2026/07/23/runway-bets-on-ai-model-routing-as-generative-media-gets-crowded/

  • Google Blog: Gemini 3.6 Flash — https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/

http://www.cnnetsun.cn/news/3866209.html

相关文章:

  • 深入了解广东省建设监理协会网站:赋能行业转型与质量提升的全面指南
  • Unity Shader阴影缺失?FallBack机制揭秘
  • 荣茂网站建设怎么做?从小白到专家的全过程分享,揭秘企业官网搭建核心逻辑
  • Excel多行查找匹配与跨表排序:从VLOOKUP到XLOOKUP的实战进阶
  • 深度解析:海南省建设厅网站如何助力建筑从业者获取最新政策与资质查询
  • 弱电工程师必知:光纤技术核心原理、选型与工程实践指南
  • EasyDSS私有化部署,用户不流失,让每一帧视频成为自有资产
  • Windows Cleaner:为你的电脑注入新生,彻底告别C盘爆红与系统卡顿
  • 揭秘正规网站建设报价背后的真相:从隐形消费到价值重塑的真诚对话
  • Cesium PolygonGeometry 添加面完整知识点 TS 代码
  • 拒绝套路与模板:通化 网站建设 如何真正助力本地中小企业破局增长与品牌突围
  • 杭州网站建设服务:为何本地商家必须重视网站建设的长期价值
  • 深入解析C++ SFINAE:从编译原理到现代Concepts演进
  • 【数据链路层详解】从以太网帧到 ARP 协议的最后一跳
  • ClaudeAPI成本中心与业务标签设计指南
  • 构建韧性系统:从监控告警到自动修复的工程实践
  • 别被课堂笑声骗了:儿童外教课的真实效果,到底该怎么评估?这一篇讲透!
  • 干部名册管理:换届启动要“锁死”,过程跟踪要“鲜活”
  • 权限不足问题深度解析:从身份验证到资源访问的系统性排查指南
  • 2024年零基础个人网站怎么搭建?揭秘网站建设suteng的避坑指南与实战心得
  • 网站建设 python 选型指南:为什么资深开发者最终都选择了 Python 构建现代数字平台
  • 华硕笔记本性能控制终极指南:如何用G-Helper替代Armoury Crate
  • 工业机器视觉系统如何选择?从海康机器人、基恩士到国产视觉方案的发展趋势
  • XUnity.AutoTranslator:为什么这个开源工具能让你的外语游戏瞬间变身中文版?
  • 基于ItChat与AI API的微信智能助手开发实战
  • IT66630 芯片技术全解析:HDMI2.0一分二有源分配器底层原理科普
  • 图书馆建设网站:从蓝图到现实,我们如何重新定义阅读空间的数字化未来
  • 深入解析systemd:从核心概念到高级服务管理实战
  • 第十九章 Linux 职业发展与认证
  • Unity Shader进阶:从Phong到PBR的BRDF光照模型实现与调试