「ViMax」多智能体视频生成框架,把短视频生成拆成一支创作团队

ViMax 官方 demo 视频抽帧

ViMax 是 HKUDS 开源的 agentic video generation 框架,目标是把“导演、编剧、制片、视频生成器”这些角色放进一条多智能体流水线里。它不是只调用一个视频生成模型,而是试图从想法、剧本或长篇叙事出发,自动完成脚本拆解、故事板、角色与场景设计、参考图选择、镜头规划、首帧生成、一致性检查和最终视频生成。

截至 2026 年 5 月 20 日,这个 GitHub 仓库约有 5.5k Star、932 Fork,主要语言是 Python,许可证是 MIT,最近一次 push 是 2026 年 3 月 29 日。仓库没有公开 GitHub latest release,当前主要以 README、代码和技术报告形式展示项目进展。

把短视频生成拆成一支创作团队

ViMax 想解决的是当前 AI 视频生成里很常见的几个痛点:单次生成通常只有几秒,角色和场景容易漂移,脚本、镜头、音画结构和叙事密度往往需要人工补齐。它的思路是用多智能体把这些环节拆开,让不同模块分别负责故事理解、剧本规划、角色提取、场景抽取、故事板设计、参考图选择和画面生成。

README 里列了四个方向:Idea2Video 从一个想法生成完整视频故事;Novel2Video 面向长篇文本,把叙事压缩成多场景视频结构;Script2Video 根据用户写好的剧本生成视频;AutoCameo 则把用户上传的照片整合进互动式短片流程。整体更像一个实验中的 AI 制片系统,而不是单点模型 demo。

关键不只是生成,而是一致性

项目架构里最值得看的部分,是它把“连续性”当成核心问题处理。ViMax 会跟踪角色、环境和时间线里的参考画面,给当前镜头选择合适的 reference image;再根据上一段视觉逻辑生成图像提示词,并并行生成多个候选图,通过 MLLM/VLM 选择一致性更好的首帧。

这套设计很接近人类视频制作里的流程:先有剧本和分镜,再有镜头设计、参考素材、关键帧和后续视频片段。对长一点的 AI 生成视频来说,能否记住角色长相、场景关系和前后镜头逻辑,往往比单个画面是否惊艳更重要。

适合研究和折腾,不是即开即用剪辑软件

ViMax 当前更适合 AIGC 研究者、视频生成开发者和愿意搭 API / 配模型的人。README 里使用 uv 管理环境,配置文件需要填 chat model、image generator 和 video generator;示例里提到 Gemini、MiniMax 等 OpenAI-compatible 接口,也提供 idea2video、script2video、novel2movie 等 pipeline。

换句话说,它的价值不是“打开网页就生成大片”,而是把 AI 视频生成拆成可研究、可替换、可调试的工作流。如果你正在关注多智能体创作、长视频一致性、故事板自动化或从文本到镜头的链路,ViMax 很值得翻一翻。

传送门

项目地址:https://github.com/HKUDS/ViMax

原创文章,如若转载,请注明出处:https://wefound.cc/p/3055.html

(0)
「Umami」隐私友好的开源网站分析工具
上一篇 2026年 5月 20日 上午10:41
「ERPNext」GPL-3.0 开源 ERP:把财务、库存、制造、项目和人事放进一套可自托管系统
下一篇 2026年 5月 20日 上午11:37

相关推荐