BigBanana AI Director:用关键帧工作流打造工业化 AI 短剧

BigBanana AI Director 将剧本、资产、关键帧和视频生成串成完整流水线,帮助创作者稳定制作连续的 AI 短剧与漫剧。

BigBanana AI Director:用关键帧工作流打造工业化 AI 短剧

AI 视频生成最大的难题,往往不是“能不能生成一张漂亮的图”,而是能否把一个故事稳定地制作成一部连续、可修改、可交付的短剧。角色可能在不同镜头中变脸,场景缺乏连续性,镜头动作难以控制,最终还要依靠大量人工整理素材。

BigBanana AI Director(AI 漫剧工场)针对的正是这类生产问题。它是一套面向创作者的短剧和漫剧制作平台,将从灵感、剧本、角色资产到镜头和成片交付的流程集中在一个项目工作区中。项目的核心理念可以概括为:Script-to-Asset-to-Keyframe,即先把故事结构化,再沉淀可复用资产,最后通过关键帧驱动视频生成。

从“抽卡式生成”转向可控流水线

许多 Text-to-Video 工具适合快速尝试,但当创作者需要制作多集内容时,仅凭一段提示词反复生成,通常很难控制人物身份、服装、场景和镜头起止状态。BigBanana 的工作流把生成过程拆成几个可检查的阶段:

  1. Script:叙事规划。 输入故事大纲、小说片段或单集创意,生成结构化剧本。
  2. Asset:一致性资产。 将角色、场景和道具制作成可复用的参考资产。
  3. Keyframe:关键帧控制。 为镜头定义起始帧和结束帧,再生成中间的视频过渡。
  4. Delivery:成片交付。 对镜头进行粗剪、预览、渲染追踪和导出。

这种拆分的价值在于,每一步都有明确的编辑入口。AI 负责加速创作,创作者仍然可以修改角色描述、台词、镜头动作和提示词,而不是只能接受一次生成结果。

关键帧驱动镜头生成

BigBanana 将动画制作中的关键帧概念引入 AI 视频工作流。创作者可以先生成或上传精准的 Start Frame 和 End Frame,再利用 Veo 等视频模型生成两帧之间的平滑运动。这种方式比单纯描述“镜头从这里移动到那里”更容易表达具体的视觉意图。

例如,一个角色从房间门口走到窗边,可以先确定角色在门口的构图,再确定角色站在窗边的结束姿态。中间的运动由视频模型补全,同时生成过程会读取当前场景图、角色服装参考和道具参考,降低人物变形与场景跳变的概率。

平台还提供九宫格分镜预览。系统可以先生成 9 个候选视角,创作者再选择完整九宫格或裁切其中一格作为首帧。这为镜头设计提供了一个低成本的构图筛选环节,适合在正式生成视频前快速比较景别、视角和画面布局。

四个主要制作阶段

Phase 01:叙事规划

在叙事规划阶段,系统会从输入内容中提取角色、场景、道具、镜头、动作和台词等结构化信息。创作者可以设置语言、目标时长、视觉风格和模型组合,并对 AI 生成的剧本正文、角色视觉描述、镜头动作与提示词逐项续写、改写或手动精修。

对于批量制作,系统还会在正式生成前生成一份全自动生产方案。创作者可以逐镜头选择使用九宫格分镜链路,还是使用首尾帧插值链路,从而在效率和可控性之间进行取舍。

Phase 02:一致性资产

角色资产包括标准定妆参考图和衣橱系统,可用于维护同一角色的身份与多套造型。场景和道具也可以独立资产化,保存提示词、参考图和形体参考。

资产既可以来自当前项目,也可以从跨项目资产库复用。对于缺少图片的角色、场景或道具,平台支持批量补齐,为后续镜头生成准备完整的上下文。

Phase 03:镜头制作

镜头工作台以网格方式集中展示镜头的叙事动作、角色、场景和道具信息。每个镜头都可以管理 Start Frame、End Frame,包括生成、上传、继承和编辑已有帧。

视频生成支持两条链路:单图 Image-to-Video,以及基于首尾帧的插值生成。前者适合快速让一张画面动起来,后者更适合对镜头起点、终点和运动方向有明确要求的场景。

Phase 04:成片交付

成片交付中心提供时间线预览、镜头完成度展示和渲染日志。内置的 CutOS 风格 AI 粗剪工具可以对已生成镜头进行调序、裁剪、滤镜处理和导出前检查。

输出内容包括母版视频、片段压缩包和源素材,方便继续在 Premiere 或 DaVinci Resolve 等专业工具中完成后期。剧集数据也支持导入导出,适合跨设备迁移和轻量协作。

提示词管理与问题排查

生成质量不稳定时,问题可能来自上游的剧本描述、角色设定、场景提示词或关键帧要求。BigBanana 提供集中式提示词管理页面,用于检索和编辑模板、角色、场景、道具、关键帧及视频提示词,并保留编辑历史以便版本回滚。

这意味着创作者可以沿着生产链路排查问题,而不必在多个生成页面之间重复寻找原始配置。对于需要批量生产的团队,提示词历史还能够帮助建立可复用的制作规范。

如何部署公开版

当前公开仓库主要保留说明文档、docker-compose.yaml 和历史参考版本。后续版本更新将主要通过官方 Docker 镜像发布,部署和升级应以官方镜像为准。

基本部署步骤如下:

git clone https://github.com/shuyu-labs/BigBanana-AI-Director.git
cd BigBanana-AI-Director
docker-compose up -d

启动后,在浏览器中访问:

http://localhost:3005

查看日志或停止服务:

docker-compose logs -f
docker-compose down

更新官方镜像并重建容器:

docker-compose pull
docker-compose up -d --force-recreate

首次进入应用后,需要在新手引导、账号中心或模型配置中填写 AntSK API Key 或 Token。平台默认通过 AntSK API 统一接入文本、图像和视频模型,公开运行版本需要相应的模型组合,例如 GPT-5.2、Nano Banana Pro,以及 Sora-2 或 Veo-3.1。项目也提供在线版本,可直接访问 https://director.tree456.com/ 使用。

模型与授权说明

AntSK API 提供统一接口接入多类模型,包括 GPT-5.2、GPT-5.1、Claude 4.6 Sonnet 等文本模型,Nano Banana Pro、Gpt Image 2 等视觉模型,以及 Sora-2、Veo-3.1、Vidu、Seedance 2.0 和 happyhorse 等视频模型。其定位是减少多平台切换,并提供 OpenAI 兼容协议、用量统计和费用追踪。

项目采用 CC BY-NC-SA 4.0 许可证,允许个人学习、非商业使用、修改和二次创作,但禁止未经商业授权的商业用途。商业版用户可以获得完整源码交付;商业授权可联系 [email protected]。如果需要私有模型网关、其他模型渠道或深度定制,也需要基于商业版源码另行适配。

适合什么场景

BigBanana AI Director 更适合系统化短剧制作、AI 漫剧、多集内容生产和需要反复复用角色与场景资产的工作流。它并不只是一个单次图片或视频生成器,而是把剧本、世界观、资产、镜头和交付结果组织到同一个项目结构中。

如果目标是快速验证一个创意,在线工具可能已经足够;如果目标是从小说或故事大纲持续生产多集内容,关键帧驱动和资产复用则能提供更稳定的制作基础。对于希望减少重复配置、提高镜头一致性,并保留人工精修空间的创作者来说,这种工业化流程比单纯追求一次生成效果更有长期价值。

Source

shuyu-labs/BigBanana-AI-Director: BigBanana AI Director是一个工业级一站式 AI 短剧,AI 漫剧,AI 导演平台,面向创作者,实现从灵感到成片的高效生产。 它摇弃了传统的“抽卡式”生成,采用 "Script-to-Asset-to-Keyframe" 的工业化工作流。实现 “一句话生成完整短剧,从剧本到成片全自动化”,同时精准控制角色一致性、场景连续性与镜头运动。