Cloudflare 发布多模态决策模型 Clef-omni,并下调 Clef-flash 价格

Cloudflare AI Bl2 小时前

重点概览

Cloudflare 扩展了其开放权重决策模型 Clef 系列,新增 Clef-omni,可在单一流程中原生处理 音频、视频、图像和文本。同时,Clef-flash 降价,Clef 的托管推理速度也有所提升。

主要变化包括:

  • 新增 Clef-omni:支持 wav、mp3、mp4、webm,以及文本和图像输入。
  • Clef-flash 输入价格从每百万 token 0.09 美元降至 0.038 美元。
  • Clef 托管版本推理速度提升,部分输入规模下中位延迟最高约 2.0× 改善。
  • Clef-flash 托管版上下文窗口从此前宣传的 64k 调整为 24k;自托管权重未变,训练支持 256k 上下文。

Clef-omni:面向音频、视频、图像和文本的决策模型

Clef-omni 是 Clef 系列的新成员,定位为多模态决策模型。此前的 Clef 已支持图像和视频帧数组,而 Clef-omni 进一步加入了对音频和视频文件的原生处理能力。

这意味着,在某些工作流中,开发者不再需要先搭建多级流水线,例如:

  • 先用语音识别模型把音频转成文本;
  • 再把视频拆成音频和图像帧;
  • 最后交给另一个模型进行分类或决策。

Clef-omni 的目标是让模型直接在一个 API 调用中处理多种输入模态,并基于统一上下文输出结构化决策结果。

模型架构与训练方式

Clef-omni 基于 Qwen3-Omni-30B-A3B-Instruct 混合专家模型基础构建。该基础模型本身具备处理文本、图像、音频和视频的能力。

Cloudflare 表示,Clef-omni 采用其主要理解主干,但移除了文本转语音输出组件。由于 Clef 系列并不是传统意义上的大语言模型,不需要生成长文本输出,因此可以跳过输出 token 生成带来的开销。

其处理流程包括:

  • 对完整输入载荷执行快速 prefill;
  • 同时对各模态输入和候选参数选项进行评分;
  • 将媒体元素映射到统一序列中;
  • 将视频、音频与视觉帧同步处理;
  • 通过两阶段注意力路由,从输入中提取候选值相关证据;
  • 使用内置词法语法保留选项语义,实现受 schema 约束的评分。

训练方法与此前 Clef 类似:

  • 冻结 Qwen3 主干;
  • 训练低秩适配器 LoRA;
  • 使用标签平滑交叉熵损失;
  • 结合 Brier score 校准。

官方描述称,这样做是为了增强模型对 schema 变化、字段顺序变化和提示结构变化的鲁棒性。

延迟表现

Cloudflare 给出的 Clef-omni 延迟数据如下:

输入类型 延迟表现
纯文本决策 中位约 130 ms
图像输入 中位约 150 ms
音频片段 数百毫秒
21 秒带声音视频 约 1.5 秒

这些数据均针对单次 API 调用场景。

基准测试表现

Cloudflare 公布了 Clef-omni、Clef、Clef-flash 与 Jev 在多个基准上的对比。部分结果如下:

Benchmark Clef-omni Clef Clef-flash Jev
BFCL · case exact 98.2 98.47 98.76 95.75
ToolRet · nDCG@10 66.6 69.19 66.43 65.28
API-Bank · accuracy 92.7 91.93 93.11 88.19
Home appliances · case exact 69.3 82.95 97.73 52.27
When2Call · accuracy 63.3 72.37 65.58 80.97
BANKING77 · macro-F1 94.8 94.20 90.93 79.74
CLINC150+OOS · macro-F1 97.7 97.43 66.77 89.27
BRIGHT · nDCG@10 42.0 45.91 39.26 47.52
Amazon ESCI · macro-F1 57.8 57.48 57.39 55.21
PhishNChips · accuracy 73.2 79.60 75.05 62.55

另一个面向工作流的评测结果如下:

Workflow Metric Clef-omni Clef Clef-flash Jev
Invoice processing Exact actions 60.2 64.7 57.1 61.8
Invoice processing Primary action 82.0 86.2 73.3 83.1
Customer service Exact actions 71.6 76.3 77.0 76.0
Security incidents Exact actions 61.7 62.9 61.7 61.7
Agent trace observability Primary action 65.8 68.5 69.8 71.6

从公开结果看,Clef-omni 在部分分类和意图识别任务上表现较强,但并非所有任务都领先;在一些工作流评测中,Clef 或 Jev 仍有更高分数。

Clef-flash 降价,但托管上下文窗口缩小

Clef-flash 的价格被下调:

模型 输入价格
Clef-flash 每百万输入 token 0.038 美元
Clef 每百万输入 token 0.24 美元
Clef-omni 每百万输入 token 0.15 美元

Clef-flash 此前价格为每百万输入 token 0.09 美元。此次降价伴随一个取舍:托管版上下文窗口从此前宣传的 64k 调整为 24k。

Cloudflare 表示,根据使用数据,只有 0.24% 的请求超过 24k 输入 token,因此将托管版 Clef-flash 的上下文窗口降至 24k,以换取更低价格。需要更大上下文的用户可选择 Clef;自托管 Clef-flash 的模型权重未变,训练支持 256k 上下文窗口。

Clef 托管推理速度提升

Clef 托管版本也进行了推理优化。Cloudflare 表示,这些优化主要发生在服务基础设施层,而不是模型权重或架构层,因此没有发布新权重。

延迟对比如下:

输入规模 优化前中位 / p95 优化后中位 / p95 中位速度提升
约 800 tokens 262 / 438 ms 152 / 351 ms 1.7×
约 3,400 tokens 616 / 777 ms 305 / 531 ms 2.0×
约 16,000 tokens 2,721 / 3,250 ms 1,635 / 1,805 ms 1.7×

其中一项优化是切换到 SGLang 进行模型服务。Cloudflare 表示,其与 SGLang 团队合作提交了对 Clef 的支持,相关改动计划进入 SGLang 0.5.22。

适用场景观察

Clef 系列的定位不是通用聊天模型,而是面向结构化决策、分类、路由和工具选择等场景。Clef-omni 的新增能力使其更适合包含多模态输入的工作流,例如:

  • 客服对话中的语音、截图和文本联合判断;
  • 安全事件中的日志、截图、录音或视频片段分类;
  • 发票、票据、商品图片与文本字段联合处理;
  • Agent 工作流中的工具选择、动作判断和路由决策。

需要注意的是,公开基准显示不同模型在不同任务上各有优势。Clef-omni 的价值主要在于单模型多模态输入和 schema 约束决策,而不是在所有文本任务上全面替代 Clef 或 Clef-flash。

评论

请登录后发表观点

暂无数据