阿里视频生成大模型Wan 3.0开启公测,并支持将文档、PPT等内容转换为视频。现有素材未提供接口、效果、价格与限制等具体信息。
8月6日,阿里巴巴视频生成大模型 Wan 3.0 开启公测。
8月6日,阿里巴巴视频生成大模型 Wan 3.0 开启公测,在生成时长、万能创作、全能参考以及真实世界还原等维度全面升级:单次可生成 30 秒视频,完整表达创作意图;在文本、图片、音频、视频四种基础模态之外,首次支持 doc、xls、ppt、pdf、md 等文档格式输入;力求准确还原真实世界——人物千人千面,每一帧画面既真实,又可信。
生成时长的延展是 Wan 3.0 最直观的升级。单段 30 秒生成让叙事节奏更游刃有余,连续运镜、一镜到底等复杂镜头语言得以充分表达,AI 视频从“生成一个镜头”走向“讲述一段完整的故事”。Wan 3.0 还有智能时长功能,可根据提示词自动推荐合适时长。
Wan 3.0 正从视频生成模型跃迁为信息的表达载体,不仅能以文本、图片、音频、视频作为全能参考,还能读取文档、ppt 等结构化信息,搭配提示词即可生成教学课件、产品演示、业务汇报等内容。支持格式覆盖 doc、xls、ppt、pdf、md 等,单个文件或链接不超过 100MB、50 页。比如上传一个智能眼镜产品的 ppt,配上提示词,就能得到一个完整的形象片。
这背后,是模型强大的提示词工程与指令遵循能力,将提示词转化为调度输入、控制表达的中枢。
视频生成模型正从内容生成升级为生产力工具,用户对画面的要求不止于清晰,更要真实。无论是现实场景还是数字化信息,Wan 3.0 都力求精准地复刻与呈现。生成视频中的人像力求“千人千面”,更敏锐地刻画五官与皮肤细节,人物情绪表达自然克制,微表情与肢体动作彼此联动。全能参考任务中,角色、道具、声音、空间关系、风格等细粒度维度均可稳定保持。数字化信息的画面审美也同步提升,让图表、数据与界面内容同样拥有质感。
此外,Wan 3.0 的视频编辑能力也有大幅提升,支持修改画面、剧情与台词。Wan 3.0 在声音质感与文字准确度方面仍有进步空间。
即日起,Wan 3.0 在阿里云百炼、万镜一刻、万相官网、千问创作 PC 端、IF STUDIO 和堆友开启公测,在千问 APP 灰度开放。480P、720P、1080P 的 API 价格分别为 0.3、0.6、1.2 元/秒,API 接口将于近期全量开放。
本文由阿里云提供,量子位获授权转载,观点归原作者所有。
蚂蚁集团开源 Avernet,让人与智能体像组织一样高效协作 2026-08-07
PPIO 正式发布“Fusion 融合模型”:用十分之一的价格超越顶级模型的智商 2026-08-07
美学升维,流畅突破:荣耀 MagicOS 11 双架构重塑体验 2026-08-06
Artificial Analysis 榜单:阿里 Qwen3.8 Agentic 能力得分全球第一 2026-08-06
胜出队伍最高可获 3 万人民币奖金,并且有望共享千万美金风投资金池。
36 氪报道,多位阿里云内部人士透露,无招将前往阿里巴巴集团,担任阿里巴巴董事会主席兼 CEO 张勇助理。
量子位 QbitAI 版权所有 © 北京极客伙伴科技有限公司 京 ICP 备 17005886 号-1