Cloudflare发布开放权重的Clef-omni,基于Qwen3-Omni构建,可直接处理文本、图像、音频和完整视频,面向结构化决策而非文本生成。Clef-flash输入价格同步下降约58%,但托管版上下文窗口从64k缩至24k。
IT之家 10 月 10 日消息,Cloudflare 昨日(10 月 9 日)发布公告,宣布推出开放权重决策模型 Clef-omni,支持通过单次 API 调用处理文本、图像、音频和视频等输入。

定位方面,该模型在此前 Clef 系列模型的基础上,扩展了对多模态输入的支持,模型权重已在 Hugging Face 开放。
多模态支持方面,此前的 Clef 支持文本、图像,以及从视频中抽取的连续画面(把视频按时间抽取成一张张静态图像,再将这些图像按顺序作为输入交给模型)。Clef-omni 则新增了音频和完整视频输入,支持 wav、mp3、mp4 和 webm 格式。
Cloudflare 称,开发者无需另行搭建语音转写及音视频拆分流程,可以用一个模型处理多种输入。
Cloudflare 称,Clef-omni 基于 Qwen3-Omni-30B-A3B-Instruct 构建,并保留了其主要理解能力。该模型面向结构化决策任务,不生成常规文本输出。在公司公布的测试中,纯文本请求的中位响应时间约为 130 毫秒,图像请求约为 150 毫秒;一段带声音的 21 秒视频,约 1.5 秒即可完成评分。
Cloudflare 还将 Clef-flash 每百万输入 Token 的价格从 0.09 美元(IT之家注:按现汇率约合 0.6 元人民币)降至 0.038 美元(按现汇率约合 0.25 元人民币),降幅约 58%。Clef-flash 托管版的上下文窗口同步从 64k 缩至 24k。
软媒旗下网站:IT之家、最会买 - 返利返现优惠券、iPhone之家、Win7之家、Win10之家、Win11之家
软媒旗下软件:软媒手机APP应用、魔方、最会买、要知