BigBanana AI Director: creación de microseries de IA industrializadas mediante un flujo de trabajo basado en fotogramas clave
BigBanana AI Director conecta el guion, los recursos, los fotogramas clave y la generación de vídeo en una línea de producción completa, ayudando a los creadores a producir de forma estable microseries y cómics animados de IA continuos.
BigBanana AI Director: creación de microseries de IA industrializadas mediante un flujo de trabajo basado en fotogramas clave
El mayor desafío de la generación de vídeo con IA no suele ser «si se puede generar una imagen atractiva», sino si es posible convertir una historia de forma estable en una microserie continua, editable y lista para entregar. Los personajes pueden cambiar de rostro entre distintas tomas, las escenas pueden carecer de continuidad, los movimientos de cámara pueden ser difíciles de controlar y, al final, todavía es necesario organizar manualmente una gran cantidad de materiales.
BigBanana AI Director (fábrica de cómics animados con IA) está diseñado precisamente para resolver este tipo de problemas de producción. Es una plataforma de creación de microseries y cómics animados orientada a creadores, que concentra en un único espacio de trabajo de proyecto todo el proceso, desde la inspiración, el guion y los recursos de los personajes hasta las tomas y la entrega de la obra final. Su concepto central puede resumirse como: Script-to-Asset-to-Keyframe, es decir, estructurar primero la historia, consolidar después recursos reutilizables y, por último, impulsar la generación de vídeo mediante fotogramas clave.
De la «generación por lotería» a una línea de producción controlable
Muchas herramientas de Text-to-Video son adecuadas para realizar pruebas rápidas, pero cuando un creador necesita producir contenido en varios episodios, generar repetidamente a partir de un simple prompt suele dificultar el control de la identidad de los personajes, el vestuario, los escenarios y los estados inicial y final de las tomas. El flujo de trabajo de BigBanana divide el proceso de generación en varias etapas verificables:
- Script: planificación narrativa. Introduce un esquema de la historia, un fragmento de novela o la idea de un episodio para generar un guion estructurado.
- Asset: recursos coherentes. Convierte personajes, escenarios y objetos en recursos de referencia reutilizables.
- Keyframe: control mediante fotogramas clave. Define el fotograma inicial y el fotograma final de cada toma para generar después la transición de vídeo intermedia.
- Delivery: entrega de la obra final. Permite realizar un montaje preliminar, previsualizar, seguir el progreso del renderizado y exportar las tomas.
El valor de esta división reside en que cada paso cuenta con una entrada de edición clara. La IA acelera la creación, pero el creador aún puede modificar las descripciones de los personajes, los diálogos, los movimientos de cámara y los prompts, en lugar de tener que aceptar el resultado de una única generación.
Generación de tomas impulsada por fotogramas clave
BigBanana incorpora el concepto de fotograma clave de la producción de animación al flujo de trabajo de vídeo con IA. Los creadores pueden generar o subir primero un Start Frame y un End Frame precisos, y después utilizar modelos de vídeo como Veo para generar un movimiento fluido entre ambos fotogramas. Este método facilita expresar una intención visual concreta más que describir simplemente «la cámara se mueve de aquí hasta allí».
Por ejemplo, para hacer que un personaje camine desde la puerta de una habitación hasta la ventana, primero se puede definir la composición del personaje en la puerta y después la pose final del personaje junto a la ventana. El modelo de vídeo completa el movimiento intermedio. Durante la generación, también consulta la imagen de la escena actual y las referencias del vestuario del personaje y de los objetos, lo que reduce la probabilidad de deformaciones del personaje y saltos entre escenas.
La plataforma también ofrece una previsualización de storyboard en cuadrícula de nueve posiciones. El sistema puede generar primero nueve ángulos candidatos, tras lo cual el creador puede elegir la cuadrícula completa o recortar una de sus posiciones para utilizarla como fotograma inicial. Esto proporciona una etapa de selección de composición de bajo coste para el diseño de tomas y resulta adecuada para comparar rápidamente el tipo de plano, el ángulo de visión y la distribución de la imagen antes de generar el vídeo definitivo.
Cuatro etapas principales de producción
Phase 01: planificación narrativa
Durante la etapa de planificación narrativa, el sistema extrae del contenido introducido información estructurada sobre personajes, escenarios, objetos, tomas, acciones y diálogos. El creador puede configurar el idioma, la duración objetivo, el estilo visual y la combinación de modelos, además de continuar, reescribir o perfeccionar manualmente, elemento por elemento, el texto del guion, las descripciones visuales de los personajes, las acciones de las tomas y los prompts generados por la IA.
Para la producción por lotes, el sistema también genera un plan de producción completamente automatizado antes de comenzar la generación formal. El creador puede elegir para cada toma entre utilizar el flujo de storyboard de nueve posiciones o el flujo de interpolación entre fotogramas inicial y final, tomando así decisiones sobre el equilibrio entre eficiencia y control.
Phase 02: recursos coherentes
Los recursos de los personajes incluyen imágenes de referencia estandarizadas del aspecto definitivo y un sistema de vestuario, que pueden utilizarse para mantener la identidad del mismo personaje y varios estilos. Los escenarios y los objetos también pueden convertirse en recursos independientes, conservando sus prompts, imágenes de referencia y referencias de forma.
Los recursos pueden proceder del proyecto actual o reutilizarse desde una biblioteca de recursos compartida entre proyectos. Para personajes, escenarios u objetos que no tengan imágenes, la plataforma permite completarlos por lotes y preparar así un contexto completo para la generación posterior de tomas.
Phase 03: producción de tomas
La mesa de trabajo de tomas muestra de forma centralizada y en una cuadrícula la acción narrativa, los personajes, los escenarios y los objetos de cada toma. En cada toma se pueden gestionar el Start Frame y el End Frame, incluyendo la generación, la subida, la herencia y la edición de fotogramas existentes.
La generación de vídeo admite dos flujos: Image-to-Video a partir de una sola imagen y generación por interpolación basada en los fotogramas inicial y final. El primero es adecuado para animar rápidamente una imagen, mientras que el segundo resulta más apropiado en escenas que requieren un control preciso del punto de inicio, el punto final y la dirección del movimiento.
Phase 04: entrega de la obra final
El centro de entrega de la obra final ofrece una previsualización de la línea de tiempo, una vista del grado de finalización de las tomas y registros de renderizado. La herramienta integrada de montaje preliminar con IA, basada en el estilo de CutOS, permite reordenar, recortar y aplicar filtros a las tomas generadas, además de realizar comprobaciones antes de la exportación.
Los contenidos de salida incluyen el vídeo máster, paquetes comprimidos de clips y materiales fuente, lo que facilita continuar la posproducción en herramientas profesionales como Premiere o DaVinci Resolve. Los datos de las series también admiten importación y exportación, lo que resulta adecuado para migrar entre dispositivos y colaborar de forma ligera.
Gestión de prompts y resolución de problemas
Cuando la calidad de generación es inestable, el problema puede proceder de la descripción del guion, la configuración del personaje, el prompt del escenario o los requisitos de los fotogramas clave. BigBanana ofrece una página centralizada de gestión de prompts para buscar y editar plantillas, personajes, escenarios, objetos, fotogramas clave y prompts de vídeo, conservando además el historial de edición para facilitar la restauración de versiones.
Esto permite a los creadores investigar los problemas siguiendo la línea de producción, sin tener que buscar repetidamente la configuración original entre varias páginas de generación. Para los equipos que necesitan producir por lotes, el historial de prompts también ayuda a establecer normas de producción reutilizables.
Cómo desplegar la versión pública
Actualmente, el repositorio público conserva principalmente la documentación, docker-compose.yaml y versiones históricas de referencia. Las actualizaciones posteriores se publicarán principalmente mediante imágenes oficiales de Docker; el despliegue y las actualizaciones deben realizarse de acuerdo con la imagen oficial.
Los pasos básicos de despliegue son los siguientes:
git clone https://github.com/shuyu-labs/BigBanana-AI-Director.git
cd BigBanana-AI-Director
docker-compose up -d
Después de iniciar el servicio, accede desde el navegador a:
http://localhost:3005
Para consultar los registros o detener el servicio:
docker-compose logs -f
docker-compose down
Para actualizar la imagen oficial y reconstruir el contenedor:
docker-compose pull
docker-compose up -d --force-recreate
La primera vez que se accede a la aplicación, es necesario introducir la AntSK API Key o el Token en la guía de inicio, el centro de cuentas o la configuración de modelos. De forma predeterminada, la plataforma utiliza la API de AntSK para integrar de manera unificada modelos de texto, imagen y vídeo. La versión pública en funcionamiento requiere una combinación de modelos correspondiente, como GPT-5.2, Nano Banana Pro y Sora-2 o Veo-3.1. El proyecto también ofrece una versión en línea, disponible directamente en https://director.tree456.com/.
Información sobre modelos y licencias
AntSK API ofrece una interfaz unificada para integrar múltiples tipos de modelos, incluidos modelos de texto como GPT-5.2, GPT-5.1 y Claude 4.6 Sonnet; modelos visuales como Nano Banana Pro y Gpt Image 2; y modelos de vídeo como Sora-2, Veo-3.1, Vidu, Seedance 2.0 y happyhorse. Su objetivo es reducir los cambios entre plataformas y proporcionar un protocolo compatible con OpenAI, estadísticas de uso y seguimiento de costes.
El proyecto utiliza la licencia CC BY-NC-SA 4.0, que permite el aprendizaje personal, el uso no comercial, las modificaciones y las obras derivadas, pero prohíbe los usos comerciales sin autorización comercial previa. Los usuarios de la edición comercial pueden obtener la entrega del código fuente completo. Para adquirir una licencia comercial, se puede contactar con [email protected]. Si se necesita una puerta de enlace privada para modelos, otros canales de modelos o una personalización profunda, también será necesario realizar una adaptación adicional basada en el código fuente de la edición comercial.
Casos de uso adecuados
BigBanana AI Director es más adecuado para la producción sistemática de microseries, los cómics animados con IA, la creación de contenido en varios episodios y los flujos de trabajo que requieren reutilizar repetidamente recursos de personajes y escenarios. No es simplemente un generador de imágenes o vídeos individuales, sino que organiza el guion, el universo narrativo, los recursos, las tomas y los resultados de entrega dentro de una misma estructura de proyecto.
Si el objetivo es validar rápidamente una idea, una herramienta en línea puede ser suficiente. Si el objetivo es producir de forma continua varios episodios a partir de una novela o un esquema argumental, el control mediante fotogramas clave y la reutilización de recursos proporcionan una base de producción más estable. Para los creadores que desean reducir la configuración repetitiva, mejorar la coherencia entre tomas y conservar espacio para el perfeccionamiento manual, este flujo industrializado ofrece más valor a largo plazo que perseguir únicamente el resultado de una sola generación.