Director de línea de tiempo MiniMax H3 de ComfyUI para vídeos de larga duración

Crea líneas de tiempo editables de medios de referencia y genera vídeos MiniMax H3 de larga duración con continuación latente directa, audio bloqueado y control adaptativo de las uniones.

Director de línea de tiempo MiniMax H3 de ComfyUI para vídeos de larga duración

Generar un clip corto a partir de una imagen de referencia es relativamente sencillo. Generar un vídeo coherente y sincronizado que dure un minuto o más es mucho más difícil: la identidad se desvía, las uniones de audio se vuelven perceptibles y cada extensión suele requerir otra cadena de muestreo creada manualmente.

ComfyUI-MiniMaxH3-TimelineDirector aborda este problema de flujo de trabajo con un director de línea de tiempo editable para la canalización nativa de ComfyUI MiniMax H3 Reference to Video. Combina imágenes de referencia, vídeos, bandas sonoras emparejadas, guías, indicaciones y ventanas de generación en una sola interfaz, y después expande la línea de tiempo en un grafo de generación segmentado.

El proyecto se distribuye bajo GPL-3.0 y, en la versión indicada, cuenta con 275 estrellas, 31 forks y un único colaborador. La versión 0.6.0 se centra en la generación ligera de duración ilimitada y añade humanos digitales de larga duración y canto de personajes con el audio de origen bloqueado.

Por qué importa la línea de tiempo

El plugin trata la generación como un problema de organización, no como una colección de entradas desconectadas. Puedes colocar clips, recortarlos, dividirlos, definir rangos numéricos y establecer ventanas de generación cian. Solo los medios que intersectan el rango de generación activo se incluyen en el plan actual de referencia o guía de H3.

Esto permite usar un único flujo de trabajo para varias tareas que, de otro modo, serían diferentes:

  • Texto a vídeo sin medios cargados.
  • Generación con referencia de imagen de uno o varios segmentos.
  • Vídeo impulsado por audio y sincronización labial de humanos digitales.
  • Sustitución de personajes y transferencia de movimiento.
  • Referencias de vídeo editables.
  • Generación de vídeos largos segmentados manualmente.
  • Canto de personajes de larga duración con una banda sonora sin cambios.

El estado de la línea de tiempo se serializa en el JSON del flujo de trabajo de ComfyUI, por lo que un proyecto puede guardarse, abrirse de nuevo y reproducirse sin reconstruir manualmente la disposición de los medios.

La función principal: generación segmentada de duración ilimitada

El plugin divide una duración objetivo en segmentos superpuestos y completa el proceso en una sola ejecución de ComfyUI. En lugar de depender de nodos Loop genéricos o cadenas de muestreo duplicadas, utiliza un grafo de expansión finito que realiza lo siguiente:

  1. Generación por segmento con una semilla compartida.
  2. Continuación directa desde la cola latente AV muestreada del segmento anterior.
  3. Enmascarado de vídeo Drift-Control adaptativo.
  4. Continuidad de audio AV suave.
  5. Eliminación de la superposición.
  6. Ensamblaje final sincronizado.

El límite práctico de duración lo determinan la VRAM local, la RAM, la capacidad del disco y los límites de ejecución de ComfyUI, no un número fijo de segmentos. El repositorio incluye dos ejemplos generados en una sola ejecución, cada uno de aproximadamente 52,625 segundos, con 1.263 fotogramas a 24 fps.

Por qué es útil la continuación latente directa

Un enfoque convencional podría decodificar el segmento anterior a RGB, pasar ese resultado a la siguiente etapa y volver a codificarlo. Esto introduce un ciclo innecesario de decodificación y recodificación, y puede amplificar las discontinuidades visuales. Finite Segment Sampling transporta directamente la cola latente AV muestreada del segmento anterior al inicio del siguiente.

La superposición solicitada se alinea con la cuadrícula temporal válida de MiniMax H3. Por ejemplo, una superposición solicitada de 24 fotogramas puede convertirse en 22, mientras que 48 puede convertirse en 39. El valor alineado se utiliza de forma coherente para el transporte latente, el recorte decodificado y el ensamblaje final, evitando que las distintas etapas discrepen sobre la unión.

Drift-Control adapta su máscara tanto al número de tokens de vídeo de la superposición alineada como al programa de sigma del sampler conectado. Esto incluye programas acelerados de cuatro y ocho pasos. Solo se vuelve a aplicar ruido dinámicamente al prefijo de vídeo desechable, mientras que el latente del lado de la unión permanece limpio.

Para la continuación de audio, la superposición transportada permanece exacta hasta los ocho últimos ticks latentes de audio. A continuación, una máscara Soft AV de semicoseno libera gradualmente la superposición hacia el audio recién generado. Durante el ensamblaje, la superposición Soft AV entrante sustituye a la cola de audio anterior para que la transición permanezca presente en la banda sonora final.

Cada segmento utiliza la semilla exacta mostrada en el nodo de muestreo. Los nodos auxiliares de bucle genérico antiguos y la dependencia de PR #15923 se han eliminado.

Audio bloqueado para humanos digitales de larga duración

Una de las incorporaciones más útiles es la compatibilidad con una banda sonora larga que debe permanecer sin cambios durante varias ventanas de generación. Una imagen de referencia preserva la identidad del personaje, mientras que la banda sonora bloqueada se decodifica una vez, se divide por posición exacta de muestra y se inyecta en el latente AV de cada segmento.

La máscara de eliminación de ruido de audio se establece en cero para la fuente bloqueada, lo que permite que la señal original pase sin regenerarse de forma independiente para cada segmento. La salida final restaura la banda sonora continua después del ensamblaje de los segmentos.

El ajuste automático elimina una causa habitual de errores:

  • Si la línea de tiempo es más corta que el audio de origen, la fuente se trunca.
  • Si la línea de tiempo supera la duración de la fuente, se conserva todo el audio disponible y solo el excedente se rellena con silencio.
  • Los usuarios no necesitan hacer coincidir manualmente los metadatos del MP3, las duraciones válidas de H3 ni los retardos de preámbulo del códec.

Esto permite flujos de trabajo de sincronización labial y canto de personajes de larga duración mucho más fáciles de controlar que el audio generado de forma independiente para cada segmento. El audio de origen vinculado puede seguir las ediciones de vídeo y también puede desactivarse de forma independiente.

Modos de referencia

Cada clip de vídeo puede asignarse a uno de tres propósitos:

Fixed Guide

El clip ancla la superposición en sus posiciones de fotograma generadas. Esto resulta útil cuando el movimiento o el encuadre de origen deben tratarse como una guía estructural sólida.

Editable Reference

El clip se pasa como una referencia de vídeo H3 numerada sin bloquear estrictamente el sujeto original. Por lo general, este es el modo preferido para la sustitución de personajes y la generación flexible basada en referencias.

Boundary Only

Solo se utilizan como anclas los fotogramas primero y último de la superposición. Esto resulta útil cuando los extremos deben permanecer estables, pero se permite que el interior generado cambie.

Las bandas sonoras de los vídeos pueden activarse o desactivarse de forma independiente. También se admiten imágenes y archivos de audio independientes, con un orden estable de <Picture N>, <Video N> y <Audio N> desde la interfaz hasta las entradas de H3.

Comportamiento de las indicaciones y planificación

El flujo de trabajo principal expone tanto una Global Prompt como indicaciones por segmento. La indicación global solo se reutiliza cuando todas las indicaciones de segmento están vacías. En cuanto se introduce una indicación para cualquier segmento, todos los segmentos deben tener una indicación y la indicación global se desactiva.

Esta regla evita una ambigüedad fácil de pasar por alto, en la que algunos segmentos heredan instrucciones globales mientras otros las sustituyen silenciosamente. Es especialmente importante para la generación de larga duración, donde cada segmento debe describir la superposición como la toma inicial antes de introducir contenido nuevo.

El proyecto también incluye un puente de indicaciones Omni opcional. MiniMax H3 Omni Media-Bundle Prompt Bridge envía el conjunto ordenado de imágenes, vídeos y audio a un backend instalado de Prompt Rewriter Omni y devuelve únicamente rewritten_prompt. Esta variante resulta útil cuando la comprensión multimodal del material debe producirse antes de la expansión de la indicación de H3. Requiere MiniMax-H3-Prompt-Rewriter-ComfyUI y su modelo, cuantización y configuración de VRAM asociados.

Nodos principales

La arquitectura recomendada utiliza dos nodos principales:

  • MiniMax H3 Material Planner — edita los medios y produce un plan H3 compacto junto con un conjunto ordenado de medios Omni.
  • MiniMax H3 Finite Segment Sampling — expande el plan en operaciones de continuación, enmascarado, muestreo, deduplicación y ensamblaje.

El MiniMax H3 Omni Media-Bundle Prompt Bridge opcional gestiona la reescritura de indicaciones. MiniMax H3 Timeline Director (Compatibility) conserva el flujo de trabajo original todo en uno y admite flujos guardados antiguos.

La generación de vídeos largos solo necesita:

Material Planner Segment Plan -> Finite Segment Sampling

Plan Encoder sigue registrado como nodo interno oculto para los grafos de ejecución expandidos y la compatibilidad con versiones anteriores. Esta arquitectura dividida también evita un ciclo de dependencias de ComfyUI.

Instalación

Clona el repositorio en el directorio de nodos personalizados de ComfyUI:

cd ComfyUI/custom_nodes
git clone https://github.com/Songssx/ComfyUI-MiniMaxH3-TimelineDirector.git

Reinicia ComfyUI y busca MiniMax H3.

La interfaz original está en inglés. El chino simplificado se proporciona mediante el sistema oficial de localización de ComfyUI y sigue el idioma seleccionado en los ajustes de ComfyUI. Recarga o reinicia el frontend después de cambiar la configuración regional.

Requisitos

Necesitas:

  • Una versión reciente de ComfyUI con nodos MiniMax H3 nativos.
  • MiniMaxH3AddGuide al utilizar Guides.
  • Modelo MiniMax H3 Ref2VA, CLIP, VAE de vídeo y VAE de audio.
  • Python 3.10 o posterior.
  • El paquete imageio-ffmpeg de ComfyUI para previsualizaciones proxy de baja resolución.

No se declara ninguna dependencia adicional de pip. El plugin depende de paquetes normalmente presentes en una instalación compatible de ComfyUI, incluidos PyAV, Pillow, NumPy, PyTorch, torchaudio, aiohttp e imageio-ffmpeg.

Para proteger la VRAM, las previsualizaciones proxy pueden generarse silenciosamente hasta 480×270 y 12 fps. El redimensionado durante la decodificación también adapta la salida a la anchura y altura configuradas en el nodo.

Flujo de trabajo práctico

  1. Abre el flujo de trabajo All-in-One Full Timeline Director.
  2. Establece la anchura, la altura y generation_seconds.
  3. Añade imágenes, vídeos y audio desde la barra de herramientas o arrastrando archivos a la interfaz.
  4. Mueve, recorta o divide los clips según sea necesario.
  5. Arrastra el rango cian sobre el intervalo que quieras generar.
  6. Asigna a cada vídeo un modo: Fixed Guide, Editable Reference o Boundary Only.
  7. Decide si debe incluirse el audio emparejado del vídeo.
  8. Añade una indicación global o completa las indicaciones de todos los segmentos.
  9. Para la generación de larga duración, crea ventanas GEN superpuestas y elige la superposición de unión deseada.
  10. Conecta directamente el Segment Plan de Material Planner a Finite Segment Sampling.

El plugin gestiona la alineación de fotogramas válidos, Drift-Control, Soft AV, la eliminación de superposiciones, el recorte de colas y el ensamblaje AV final. No segmenta automáticamente los medios según la duración de la referencia ni infiere si la identidad del personaje debe continuar. Los rangos de segmento, las superposiciones y las asignaciones siguen siendo decisiones explícitas del usuario.

Para referencias de vídeo largas, utiliza la toma final del segmento anterior como Guide inicial del segmento siguiente. Describe esa superposición como Shot 1 antes de introducir contenido nuevo y después elimina el intervalo Guide repetido del segmento posterior durante el ensamblaje.

Trabajo relacionado y licencia

Drift-Control AV está adaptado de ComfyUI-MiniMaxH3-Contex-Loop bajo GPL-3.0 y sigue siendo experimental, especialmente para comparaciones de cadenas largas de una misma toma. El puente Omni y el flujo de generación de indicaciones toman como referencia y adaptan pytraveler/MiniMax-H3-Prompt-Rewriter-ComfyUI.

El proyecto también reconoce a los mantenedores de los nodos nativos MiniMax H3 y Guide de ComfyUI, y dirige a los usuarios a MiniMax-AI/MiniMax-H3 para consultar las directrices oficiales del modelo.

Para los desarrolladores que ya utilizan los nodos MiniMax H3 de ComfyUI, Timeline Director es valioso porque convierte un grafo puntual de referencia a vídeo en un sistema reutilizable de edición y continuación. Su idea más potente no consiste simplemente en añadir otro nodo, sino en convertir la selección de medios, los límites de segmento, la política de superposición, el alcance de las indicaciones, la continuidad del audio y el ensamblaje final en partes explícitas de un flujo de trabajo reproducible.

Fuente

Songssx/ComfyUI-MiniMaxH3-TimelineDirector: Director de línea de tiempo de medios de referencia editable para ComfyUI MiniMax H3 Reference to Video