稀宇科技开源 H3 多模态模型,支持文本、图像、视频、声音统一理解与原生双声道音视频输出。性价比优势明显,程序员可直接集成到项目中进行视频生成应用开发。
IT之家 7 月 31 日消息,稀宇科技今天宣布推出 MiniMax H3 通用多模态视频模型。魔搭社区显示,这款模型将于北京时间 8 月 3 日 0 点正式开源。

MiniMax H3 支持统一理解由文本、图像、视频和声音组成的多模态上下文,并能够输出具备原生双声道的音视频,最高支持生成 15 秒、2K 分辨率的内容。
IT之家获悉,得益于 Contextual Omni Representation、H3-VAE、H3-Omni Transformer、In-context Regeneration 等多项技术,MiniMax 称其有能力提供行业内最优的性价比。该模型默认提供 2K 分辨率,在 2K 分辨率下,每秒价格不到主流模型的三分之一;在 768P 分辨率下,价格为主流模型 720P 分辨率的二分之一。
原生多模态理解与生成:支持文字、图片、音频、视频等多种输入,能够理解不同素材中的人物、动作、声音、情绪、镜头、风格与表达意图,并将多种参考信息自然融合。
原生多模态理解与生成:支持文字、图片、音频、视频等多种输入,能够理解不同素材中的人物、动作、声音、情绪、镜头、风格与表达意图,并将多种参考信息自然融合。
多模态精准编辑与控制:支持从多个维度编辑人物、物体、场景、声音与节奏,并具备精细化的指令遵循能力。
多模态精准编辑与控制:支持从多个维度编辑人物、物体、场景、声音与节奏,并具备精细化的指令遵循能力。
商用级多场景内容生成:面向影视、广告、品牌、电商与游戏等真实商业内容场景,同时兼顾文字字幕、品牌信息、创意特效、产品展示、UI / UX 动态演示、游戏视觉及风格化表达。
商用级多场景内容生成:面向影视、广告、品牌、电商与游戏等真实商业内容场景,同时兼顾文字字幕、品牌信息、创意特效、产品展示、UI / UX 动态演示、游戏视觉及风格化表达。
广告声明:文内含有的对外跳转链接(包括但不限于超链接、二维码、口令等形式),用于传递更多信息、节省甄选时间,结果仅供参考。IT之家所有文章均包含本声明。
软媒旗下网站:IT之家、最会买 - 返利返现优惠券、iPhone之家、Win7之家、Win10之家、Win11之家。
软媒旗下软件:软媒手机 APP 应用、魔方、最会买、要知。