Qwen3.8支持音视频理解、任务规划、工具调用,在OmniVideoBench上减少45.7%的token消耗,定位企业级Agent应用。
Alibaba 的 Qwen 团队发布了 Qwen3.8-Omni-Flash。团队将其定位为首款以 agent 为核心构建的全模态模型。它接受文本、图片、音频、视频输入,输出文本。音视频理解、推理与工具调用能力融为一体。工作流设计得很简洁:理解内容、规划任务、执行工具、交付结果。
是否支持部署?支持,目前以托管 API 形式提供。已在 QwenCloud、阿里云 Model Studio 和 Qwen Studio 上线。发布时未公布开源权重,因此暂不支持自托管。
Qwen3.8-Omni-Flash 基于 Qwen3.8-Flash-Next 架构构建。该基础模型于 2026 年 8 月开源了权重。
上下文窗口为 1M tokens。QwenCloud 列出最大输入 991K、最大输出 131K。最大推理长度为 262K tokens。
输出仅为文本。如果需要生成语音,Model Studio 文档建议开发者使用 Qwen3.5-Omni。思考模式默认开启,reasoning_effort 设为 xhigh。设为 none 可禁用思考。
API 同时支持 DashScope 和 OpenAI 协议。可配合 Chat Completions 和 Responses API 使用。支持 Function Calling、联网搜索、结构化输出、上下文缓存和批量调用。
大多数视频模型从开头逐帧读到结尾。即使答案只出现在 3 分钟的片段里,也是如此。
Qwen 研究团队描述了一条不同的路径。Agent 从问题出发,决定要观看和聆听什么内容,然后通过多轮从粗到细的采集收集证据。计算资源和 tokens 投向真正重要的片段。
研究团队在 OmniVideoBench 上报告了结果:准确率从 63.4 提升到 67.8,token 使用量从 145,736 降至 79,117,降幅约 45.7%。
以上数据均来自 Qwen,发布时暂无独立验证结果。
在 29 项评估中,平均分相对 Qwen3.5-Omni-Plus 提升超过 25%。
WildClawBench-MM 提升 36.5 分。AgenticVBench 提升 22.3 分。
UniClawBench 达到 69.6。
LongAudioSpan 提升 8.3 分。OmniVideoBench 提升 9.6 分。
OmniCap-IF 的 CSR 和 ISR 分别提升 8.5 和 14.1 分。
研究团队表示,音视频性能已接近 Gemini 3.8 Flash,并声称整体音频性能已超过 Gemini 3.8 Flash。X 上的帖子将 Agent 相关提升总结为:WildClawBench-MM 和 UniClawBench 平均提升 19.5 分。
🚀 Meet Qwen3.8-Omni-Flash, Qwen's first omni-modal model built around agentic capabilities! Native audio-video understanding, reasoning, and tool use come together in one model: understand the content, plan the task, execute with tools, and deliver the result. Highlights: 🥳-… [pic link]
QwenCloud 定价为每 1M 输入 tokens 0.15 美元,每 1M 输出 tokens 0.47 美元。隐式缓存命中每 1M tokens 0.016 美元。
研究团队报告相对 Qwen3.5-Omni-Plus 大幅降低成本:音频输入每小时费用降低超过 98%,音视频输入每小时费用降低超过 93%。X 帖子称视频输入降低约 89%。
Model Studio 文档列出的关键限制:
用 OpenAI SDK 调用只需几行代码:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url=os.environ["DASHSCOPE_BASE_URL"],
)
completion = client.chat.completions.create(
model="qwen3.8-omni-flash",
messages=[{"role": "user", "content": [
{"type": "video_url", "video_url": {"url": os.environ["VIDEO_URL"]}},
{"type": "text", "text": "List the key moments with timestamps."},
]}],
modalities=["text"],
stream=True,
)
for chunk in completion:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")
模型输出为文本,因此媒体处理由工具完成。Qwen 团队开源了两个项目来支持这一点。
Qwen-MM-Plugins 以 Apache-2.0 协议发布。其标语是"让任何 agent 都能驾驭多模态原生能力"。每项能力均可作为 Skill 安装,外加一个可选的 MCP 服务器。引导式安装器支持 Claude Code、CodeBuddy、Codex、Qoder、OpenClaw、Qwen Code 和 Gemini CLI。
Omni 能力与发布演示对应如下:
omni-memory 为长视频构建音视频记忆。
omni-video2note 将教程视频转换为带插图的 PDF。
omni-chatcut 支持音乐转 MV、电影解说和保留说话人音色的视频翻译。
一个核心插件让主模型原生读取本地图片和视频帧。README 指出当前存在一个缺口:大多数 harness 尚无法原生向主模型输入音频,音频目前仍通过 API 路由。
Qwen3.8-Omni-Flash 接受文本、图片、音频、视频输入,输出文本。
它提供 1M token 上下文窗口、Function Calling、联网搜索,以及默认开启的思考模式。
Agent 感知使 OmniVideoBench 在 token 用量减少约 45.7% 的同时,分数从 63.4 提升到 67.8。
QwenCloud 定价为每 1M 输入 tokens 0.15 美元、每 1M 输出 tokens 0.47 美元。
发布时仅提供 API,配套有 Apache-2.0 协议的 Qwen-MM-Plugins 用于 agent harness。
查看技术详情、QwenCloud 模型页面、API 文档和 GitHub 仓库。所有荣誉归于该项目的研究人员。此外,欢迎关注我们的 Twitter,也别忘了加入我们的 150k+ ML SubReddit 并订阅我们的通讯。你用 telegram 吗?现在也可以加入我们了。
需要与我们合作推广您的 GitHub 仓库、Hugging Face 页面、产品发布或网络研讨会吗?欢迎联系我们。
Asif Razzaq 是 Marktechpost AI Media Inc. 的 CEO。作为一位有远见的企业家和工程师,Asif 致力于将人工智能的潜力用于社会公益。他最近的举措是推出了人工智能媒体平台 Marktechpost,该平台以深入报道机器学习和深度学习新闻著称,内容既有技术深度又易于被广大受众所理解。该平台月浏览量超过 200 万次,彰显了其受欢迎程度。