📌 项目地址:Wan-Video/Wan2.2 | ⭐ 15,987 颗星 | 🔧 Python | 📜 Apache-2.0
📌 项目地址:Wan-Video/Wan2.2 | ⭐ 15,987 | Python | 论文:arXiv 2503.20314
先说定位
阿里 Wan 团队的第二代视频生成基座模型。README 里最硬的一句主张是:在运动、语义、审美多个维度上“达到所有开源和闭源模型中的 TOP 性能”——把闭源也拉进来比。底气来自数据规模:训练数据比 Wan2.1 多 65.6% 的图像、多 83.2% 的视频。
数据增量主要补上一代的短板。Wan2.1 在大幅度人物动作上翻车不少,这代把 Complex Motion Generation 单列为四大更新点之一。
MoE:按时间步拆去噪
仓库里最值得展开的技术点。
扩散模型去噪时,早期时间步定主体、构图和运动轨迹,后期时间步补细节。两类任务对模型能力的要求不同,让一个模型从头干到尾,容量就是瓶颈。
Wan2.2 的做法:按时间步把去噪过程切开,交给多个专门的专家模型。总容量上去了,推理的计算开销不变。对用户的直接意义是——模型变强了,跑一段 720P 视频的等待时间没有跟着涨。
这个思路在 LLM 里已经验证过。搬到视频扩散模型上,Wan2.2 在开源阵营里走得比较早。
5B Hybrid TI2V:消费级显卡能跑的 720P
开源的 5B 模型,文生视频和图生视频一个模型全包,输出 720P@24fps,4090 就能跑。README 称它是目前最快的 720P@24fps 模型之一。
速度的另一半功劳在 Wan2.2-VAE:压缩比 16×16×4。一帧 720P 编码进 latent 空间后,Transformer 要处理的序列长度大幅缩短,显存占用跟着下来——这是 5B 模型能进消费级显卡的原因。
代价也要说清楚:压缩越狠,latent 还原回像素的细节损失越大。要 1080P 以上的成品,得自己接超分工序,仓库没有内置。
审美数据:光影色调写进提示词
训练数据带细粒度标注——灯光、构图、对比度、色调。实际效果是提示词里写光影方向、色彩倾向,模型能听懂。README 的说法是“可定制审美偏好的电影级风格生成”。以前风格控制靠抽卡,现在可以描述了。
模型家族现状
5B Hybrid TI2V:现在就能跑的版本,覆盖文生视频和图生视频。
Wan2.2-Animate-14B:2025 年 9 月发布,角色动画和角色替换的统一模型,能复制整体动作和表情。11 月 13 日已合入 Diffusers(PR #12526),Diffusers 版权重在 Hugging Face 的 Wan-AI/Wan2.2-Animate-14B-Diffusers。想快速上手,走 Diffusers pipeline 是阻力最小的路径。不想装环境,可以直接在 wan.video、ModelScope Studio 或 HuggingFace Space 上在线试。
Wan2.2-S2V-14B:8 月 26 日发布的音频驱动视频模型,官方页面在 humanaigc.github.io/wan-s2v-webpage。做音频驱动内容的,建议先确认权重可用性再排计划。
我的判断
15,987 颗星,社区已经主动把 Animate 接进 Diffusers。我觉得它的生态位很清楚:开源视频生成里工程化程度最高的一档。
5B 模型适合两类人:手里有 4090 级别显卡、想本地跑 720P 视频的;做研究需要可复现基线的。注意它是生成模型,不是视频编辑工具,拿现成素材做局部修改不在能力范围内。
官方有中英文使用指南、Discord 和微信群。环境问题先翻指南,一个下午把 5B 跑通——这个门槛在当前开源视频模型里算低的。