📌 项目地址:meituan-longcat/LongCat-Video | ⭐ 8,687 颗星 | 🔧 Python | 📜 未标注

项目地址:meituan-longcat/LongCat-Video | ⭐ 8,687 | Python

一个模型干三件事

LongCat-Video 是美团的视频生成基础模型,参数量 13.6B。它不区分任务:文生视频、图生视频、视频续写(Video-Continuation),加载同一个模型就能做,不需要为不同任务换不同的权重。

这里最值得展开的是视频续写。大部分视频模型只生成固定时长的片段,做长视频靠多段拼接,拼接处经常出现色彩漂移和画质下降。LongCat-Video 在预训练阶段就把续写作为训练目标,所以长视频能力是原生的。官方的说法是能生成分钟级长度的视频,且无色彩漂移、无质量衰减。这类说法通常要打折扣,但把续写放进预训练目标确实是不多见的做法,技术报告(arXiv:2510.22200)里有详细论证。

速度:几分钟出 720p 30fps

推理效率方面,官方数据是几分钟内生成 720p、30fps 的视频。支撑这个速度的是两个技术:一是时间和空间两个维度上的粗到细生成策略,先出低分辨率草稿再逐步细化;二是 Block Sparse Attention(块稀疏注意力),分辨率越高,这个优化的收益越大。

训练侧用的是多奖励 GRPO(Group Relative Policy Optimization),也就是带多个奖励信号的强化学习。官方在内部和公开基准上都做了评测,结论是性能可比肩主流开源模型和最新商业方案。这个结论的依据在技术报告里,信不信可以自己去验证。

真正的主线:Avatar 系列

如果只看 LongCat-Video 本体,它是一个不错的视频生成模型。但看更新时间线,这个仓库的野心更大:

2025 年 12 月 16 日,发布 LongCat-Video-Avatar,音频驱动的角色动画模型。支持 Audio-Text-to-Video、Audio-Text-Image-to-Video 和视频续写,音频输入兼容单流和多流(比如多个人同时说话的场景)。

2026 年 5 月 21 日,发布 Avatar-1.5,半年一次大版本,改动很实在:

  • 音频编码器从 Wav2Vec2 换成 Whisper-Large,唇形同步更准
  • 长视频生成达到官方所称的“可生产级”物理合理性和时序稳定性
  • 泛化到动漫、动物、复杂真实场景
  • 通过步数蒸馏,推理压缩到 8 步

Avatar-1.5 的权重在 Hugging Face 上开放:meituan-longcat/LongCat-Video-Avatar-1.5。半年两次大更新,每次都有具体的能力跃迁,这个迭代节奏在开源视频模型里算快的。

入口汇总

README 节选里没有给出安装命令和推理脚本,所以这里不写“怎么跑起来”,直接看官方文档更靠谱:

  • 代码:github.com/meituan-longcat/LongCat-Video
  • Avatar-1.5 权重:huggingface.co/meituan-longcat/LongCat-Video-Avatar-1.5
  • Avatar-1.5 项目页:meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/
  • 技术报告:arxiv.org/abs/2510.22200

下手前想清楚这几件事

显存。 13.6B 参数的模型,本地推理需要高端 GPU,具体需求以官方文档为准。

许可证。 README 节选里没写开源协议和商用条款,商用前必须去仓库确认,别默认能随便用。

内容风险。 音频驱动的人物视频生成天然涉及肖像问题。给真实人物配音配脸,素材授权和平台合规都是绕不开的坎。

版本。 这个项目更新很快,本文信息基于当前 README,实际使用以仓库最新 release 为准。

这篇文章对你有帮助吗?

发表回复