Cloudflare AI Gateway 推出自动模型路由,可按任务选择更省钱的模型

Cloudflare AI Bl4 天前

Cloudflare AI Gateway 推出 Auto Router 公测

Cloudflare 在 AI Gateway 中发布了 Auto Router 公测功能。用户只需将模型设置为 cloudflare/auto,系统就会自动把每个请求路由到“足够胜任该任务”的模型,而不需要终端用户手动选择模型。

Cloudflare 表示,在其内部通过 OpenCode 使用 Auto Router 的早期结果显示,相比只使用 OpenAI Sol、Anthropic Claude Opus 等前沿模型,成本最高可节省 30%。

为什么要做自动路由

很多组织在引入 AI 工具时,早期通常会经历一个快速探索阶段:尝试各种工具、分发 API Key、让用户自由调用模型。随着 AI 使用逐渐规范化,企业会希望管理和监督 token 开销。

预算、限额、身份关联分析等机制可以帮助企业看到谁在花钱、花了多少,但它们仍然依赖用户在每次请求时主动做出“省钱”的模型选择。

问题在于,并不是所有任务都需要最强模型。例如,摘要邮件或聊天记录通常不需要 Opus 级别的能力;但企业也不希望完全禁止安全工程团队使用高能力模型。

Cloudflare 的目标是让 AI Gateway 不只负责观察和限制,还能在请求流经网关时替用户做出智能决策:为每个请求选择一个能力足够、成本更合适的模型。

内部评测结果

Cloudflare 称,其在内部 OpenCode 部署以及自研代理框架 Cloudflare OS 中使用 Auto Router,并在编码任务上观察到与前沿模型相近的结果。

Auto Router 更适合覆盖多种知识工作任务的场景,例如大型组织中技术团队与非技术团队的日常工作。Cloudflare 将 cloudflare/auto 与 OpenAI GPT-6 Sol、Anthropic Claude Opus 5.5 在内部通用知识工作基准上进行了比较。

该基准包含模拟的工作区工具,覆盖邮件、日历、Slack、文件、差旅和财务等常见流程。每个任务都要求模型使用这些工具生成可验证答案或完成动作。

模型 成功次数 成功率 总成本 单次成功成本
cloudflare/auto 252/291 86.6%(+6.2/−6.9 个百分点) $2.10 $0.0084
Anthropic Claude Opus 5.5 281/291 96.6%(+2.7/−3.8 个百分点) $5.91 $0.0210
OpenAI GPT-6 Sol 245/291 84.2%(+6.5/−6.9 个百分点) $2.64 $0.0108

评测包含 97 个任务,每个模型每个任务采样 3 次。括号中的数值为 95% 置信区间,使用 10,000 次任务级 bootstrap 重采样估计,并保留每个任务内的 3 次重复结果。

Cloudflare 表示,在这组测试中,Auto Router 的表现接近其他先进日常工作模型,成本约为 Sol 的 80%、Opus 的 35%。

成本优化不只是选择“单价最低”的模型

Cloudflare 提到,模型路由要解决的是不同模型能力边界不均匀的问题。某个问题的解法可能存在于模型组合中的某个位置,路由器的任务是在质量和价格之间做权衡,为每个任务选择合适模型。

节省成本的核心并不是让所有任务都用便宜模型,而是避免为不需要前沿模型能力的任务支付前沿模型价格。

另一个观察是:token 标价更低,并不一定意味着最终成本更低。某些模型虽然输入输出单价低,但可能需要更多 token 才能完成问题。因此,路由器需要最小化预测的完整执行成本,而不只是按每百万 token 的价格做负载分配。

Auto Router 如何工作

当请求发送到 cloudflare/auto 时,AI Gateway 会先构建可服务该请求的模型池。系统会过滤掉不支持请求格式或执行模式的模型,并考虑凭证、计费配置、访问控制策略和支出限制。

如果某些上游服务商或模型处于异常状态,系统也会将其排除;故障恢复后,再自动加入候选池。

随后,路由器会查看对话的紧凑表示,重点考虑最近的消息和最新轮次。对话会被发送到运行在 Workers AI 上的多头分类模型。该分类器部署在边缘网络的 GPU 上。

分类器会输出两类信号:

  1. 对 14 类任务给出概率,例如编码、规划、研究、数据分析等;
  2. 从 1 到 5 分评估请求的四个维度:复杂度、模糊性、风险程度、对早前上下文的依赖。

之后,一个独立评分矩阵会结合这些信号与模型基准测试结果,估计每个模型对该请求的适配程度。Cloudflare 称,其通过定义一组示例任务与难度画像中的首选模型,再调整权重来校准评分矩阵。

最后,路由器会把预期质量与每个模型的输入、输出 token 价格结合起来。在简单请求中,价格权重更高,因此能力足够的小模型更容易胜出;随着任务难度提高,成本惩罚降低,更强模型有更大机会被选中。

长会话中的缓存与切换成本

对于调试、编码等长时间代理会话,成本不一定主要由模型标价决定,缓存读取成本也会随着会话长度增长而上升。

如果中途切换模型,原有缓存会失效,新模型需要重新写入完整上下文。这有时仍然值得,因为某些模型的缓存读写价格更低,可能很快抵消重写成本。

Auto Router 并不会完全避免模型切换,而是把缓存读写成本纳入考虑:

  • 在同一轮用户输入循环中,缓存通常仍然可用,切换模型很少划算,因此更倾向继续使用同一模型;
  • 在不同轮次之间,系统会施加一个随上下文 token 数增长而增加的切换惩罚;
  • 如果某个模型仍保有该会话的可用缓存,则按较低的缓存读取价格估算;
  • 其他候选模型则按重写上下文的完整成本估算。

Cloudflare 还指出,模型切换存在另一个成本:多数模型无法读取其他模型的推理 token,因此切换后新模型可能需要以输出价格重新进行推理。未来,Cloudflare 希望让路由器在切换时优先停留在同一模型家族内。

路由结果与可解释性

路由器最终会返回一个排序列表。AI Gateway 会优先尝试排名第一的模型;如果该服务商无法处理请求,则可以转向其他符合条件的模型。

Cloudflare 认为,这种“两阶段架构”有几个好处:

  • 决策更可解释:可以查看任务预测类别、复杂度等信号如何转化为模型选择;
  • 新模型上线时不必重新训练分类器,只需将其基准测试权重加入评分矩阵;
  • 同一个分类器可以支持不同路由策略。

例如,Cloudflare 计划未来推出 cloudflare/auto-best,它使用相同的分类和模型池,但会选择预期质量最高的模型,而不应用成本权衡。

后续计划

Cloudflare 表示,Auto Router 目前只是起点,后续会继续投入研究和新的路由策略。近期计划包括:

  • 扩展 cloudflare/auto 支持的模型;
  • 在过滤模型时纳入零数据保留要求;
  • 选择模型时考虑服务商容量;
  • 为每个请求选择合适的推理或思考级别;
  • 增加对 Responses API 和 WebSockets 的完整支持;
  • 探索将结构化决策模型作为第一阶段分类器。

Auto Router 在公测期间免费提供。

评论

请登录后发表观点

暂无数据