BigBanana AI Director:用关键帧工作流打造工业化 AI 短剧
BigBanana AI Director 将剧本、资产、关键帧和视频生成串成完整流水线,帮助创作者稳定制作连续的 AI 短剧与漫剧。
BigBanana AI Director:用关键帧工作流打造工业化 AI 短剧
AI 视频生成最大的难题,往往不是“能不能生成一张漂亮的图”,而是能否把一个故事稳定地制作成一部连续、可修改、可交付的短剧。角色可能在不同镜头中变脸,场景缺乏连续性,镜头动作难以控制,最终还要依靠大量人工整理素材。
BigBanana AI Director(AI 漫剧工场)针对的正是这类生产问题。它是一套面向创作者的短剧和漫剧制作平台,将从灵感、剧本、角色资产到镜头和成片交付的流程集中在一个项目工作区中。项目的核心理念可以概括为:Script-to-Asset-to-Keyframe,即先把故事结构化,再沉淀可复用资产,最后通过关键帧驱动视频生成。
从“抽卡式生成”转向可控流水线
许多 Text-to-Video 工具适合快速尝试,但当创作者需要制作多集内容时,仅凭一段提示词反复生成,通常很难控制人物身份、服装、场景和镜头起止状态。BigBanana 的工作流把生成过程拆成几个可检查的阶段:
- Script:叙事规划。 输入故事大纲、小说片段或单集创意,生成结构化剧本。
- Asset:一致性资产。 将角色、场景和道具制作成可复用的参考资产。
- Keyframe:关键帧控制。 为镜头定义起始帧和结束帧,再生成中间的视频过渡。
- Delivery:成片交付。 对镜头进行粗剪、预览、渲染追踪和导出。
这种拆分的价值在于,每一步都有明确的编辑入口。AI 负责加速创作,创作者仍然可以修改角色描述、台词、镜头动作和提示词,而不是只能接受一次生成结果。
关键帧驱动镜头生成
BigBanana 将动画制作中的关键帧概念引入 AI 视频工作流。创作者可以先生成或上传精准的 Start Frame 和 End Frame,再利用 Veo 等视频模型生成两帧之间的平滑运动。这种方式比单纯描述“镜头从这里移动到那里”更容易表达具体的视觉意图。
例如,一个角色从房间门口走到窗边,可以先确定角色在门口的构图,再确定角色站在窗边的结束姿态。中间的运动由视频模型补全,同时生成过程会读取当前场景图、角色服装参考和道具参考,降低人物变形与场景跳变的概率。
平台还提供九宫格分镜预览。系统可以先生成 9 个候选视角,创作者再选择完整九宫格或裁切其中一格作为首帧。这为镜头设计提供了一个低成本的构图筛选环节,适合在正式生成视频前快速比较景别、视角和画面布局。
四个主要制作阶段
Phase 01:叙事规划
在叙事规划阶段,系统会从输入内容中提取角色、场景、道具、镜头、动作和台词等结构化信息。创作者可以设置语言、目标时长、视觉风格和模型组合,并对 AI 生成的剧本正文、角色视觉描述、镜头动作与提示词逐项续写、改写或手动精修。
对于批量制作,系统还会在正式生成前生成一份全自动生产方案。创作者可以逐镜头选择使用九宫格分镜链路,还是使用首尾帧插值链路,从而在效率和可控性之间进行取舍。
Phase 02:一致性资产
角色资产包括标准定妆参考图和衣橱系统,可用于维护同一角色的身份与多套造型。场景和道具也可以独立资产化,保存提示词、参考图和形体参考。
资产既可以来自当前项目,也可以从跨项目资产库复用。对于缺少图片的角色、场景或道具,平台支持批量补齐,为后续镜头生成准备完整的上下文。
Phase 03:镜头制作
镜头工作台以网格方式集中展示镜头的叙事动作、角色、场景和道具信息。每个镜头都可以管理 Start Frame、End Frame,包括生成、上传、继承和编辑已有帧。
视频生成支持两条链路:单图 Image-to-Video,以及基于首尾帧的插值生成。前者适合快速让一张画面动起来,后者更适合对镜头起点、终点和运动方向有明确要求的场景。
Phase 04:成片交付
成片交付中心提供时间线预览、镜头完成度展示和渲染日志。内置的 CutOS 风格 AI 粗剪工具可以对已生成镜头进行调序、裁剪、滤镜处理和导出前检查。
输出内容包括母版视频、片段压缩包和源素材,方便继续在 Premiere 或 DaVinci Resolve 等专业工具中完成后期。剧集数据也支持导入导出,适合跨设备迁移和轻量协作。
提示词管理与问题排查
生成质量不稳定时,问题可能来自上游的剧本描述、角色设定、场景提示词或关键帧要求。BigBanana 提供集中式提示词管理页面,用于检索和编辑模板、角色、场景、道具、关键帧及视频提示词,并保留编辑历史以便版本回滚。
这意味着创作者可以沿着生产链路排查问题,而不必在多个生成页面之间重复寻找原始配置。对于需要批量生产的团队,提示词历史还能够帮助建立可复用的制作规范。
如何部署公开版
当前公开仓库主要保留说明文档、docker-compose.yaml 和历史参考版本。后续版本更新将主要通过官方 Docker 镜像发布,部署和升级应以官方镜像为准。
基本部署步骤如下:
git clone https://github.com/shuyu-labs/BigBanana-AI-Director.git
cd BigBanana-AI-Director
docker-compose up -d
启动后,在浏览器中访问:
http://localhost:3005
查看日志或停止服务:
docker-compose logs -f
docker-compose down
更新官方镜像并重建容器:
docker-compose pull
docker-compose up -d --force-recreate
首次进入应用后,需要在新手引导、账号中心或模型配置中填写 AntSK API Key 或 Token。平台默认通过 AntSK API 统一接入文本、图像和视频模型,公开运行版本需要相应的模型组合,例如 GPT-5.2、Nano Banana Pro,以及 Sora-2 或 Veo-3.1。项目也提供在线版本,可直接访问 https://director.tree456.com/ 使用。
模型与授权说明
AntSK API 提供统一接口接入多类模型,包括 GPT-5.2、GPT-5.1、Claude 4.6 Sonnet 等文本模型,Nano Banana Pro、Gpt Image 2 等视觉模型,以及 Sora-2、Veo-3.1、Vidu、Seedance 2.0 和 happyhorse 等视频模型。其定位是减少多平台切换,并提供 OpenAI 兼容协议、用量统计和费用追踪。
项目采用 CC BY-NC-SA 4.0 许可证,允许个人学习、非商业使用、修改和二次创作,但禁止未经商业授权的商业用途。商业版用户可以获得完整源码交付;商业授权可联系 [email protected]。如果需要私有模型网关、其他模型渠道或深度定制,也需要基于商业版源码另行适配。
适合什么场景
BigBanana AI Director 更适合系统化短剧制作、AI 漫剧、多集内容生产和需要反复复用角色与场景资产的工作流。它并不只是一个单次图片或视频生成器,而是把剧本、世界观、资产、镜头和交付结果组织到同一个项目结构中。
如果目标是快速验证一个创意,在线工具可能已经足够;如果目标是从小说或故事大纲持续生产多集内容,关键帧驱动和资产复用则能提供更稳定的制作基础。对于希望减少重复配置、提高镜头一致性,并保留人工精修空间的创作者来说,这种工业化流程比单纯追求一次生成效果更有长期价值。