阿里通义推出首个原生多模态Agent模型,可同时处理音视频并调用工具编辑vlog、翻译视频。在Benchmark上几乎追平Gemini 3.8 Flash,API成本更低。
Qwen3.8-Omni-Flash 是 Qwen 推出的首款专为 AI Agent 构建的多模态模型。它将音频和视频联合处理、得出结论,并自主调用工具来剪辑 vlog、翻译短视频或总结电影内容。上下文窗口达 100 万 token。在音视频任务上,Qwen 表示其表现已接近 Gemini 3.8 Flash。
Qwen 3.8 Omni Flash 在多模态基准测试中与 Gemini Flash 3.8 表现相当,但价格实惠得多。 | 图片:Qwen

API 定价为每百万输入 token 0.15 美元、每百万输出 token 0.47 美元。Qwen 估算音频输入成本低于每小时 0.01 美元,720p 带音频视频(每秒一帧)约 0.20 美元,不含响应费用。作为对比,Gemini 3.8 Flash 入门价为每百万 token 输入 0.75 美元、输出 3.75 美元,且将于 2027 年 1 月 1 日起涨价一倍。
该模型可通过 Qwen Studio、Qwen Cloud 及 API 访问。开源的 Qwen-MM-Plugins 为 Claude Code、Gemini CLI 及 Qwen Code 等 Agent 增加了视频剪辑、说话人识别、PDF 视频笔记及可复用工作流等功能。Qwen-Live Harness 则支持使用摄像头和麦克风进行实时交互。
无废话 AI 新闻——人工精选
订阅 THE DECODER,享受无广告阅读、周报 AI 新闻通讯、每年六期的独家"AI Radar"前沿报告、完整档案访问及评论区参与。