Timeline Director MiniMax H3 pour les vidéos longues dans ComfyUI
Créez des timelines de médias de référence modifiables et générez des vidéos longues avec MiniMax H3 grâce à la continuation directe des latents, au verrouillage audio et au contrôle adaptatif des raccords.
Timeline Director MiniMax H3 pour les vidéos longues dans ComfyUI
Générer un court clip à partir d’une image de référence est relativement simple. Générer une vidéo cohérente et synchronisée d’une minute ou plus est beaucoup plus difficile : l’identité dérive, les raccords audio deviennent perceptibles et chaque extension nécessite souvent une nouvelle chaîne d’échantillonneurs construite manuellement.
ComfyUI-MiniMaxH3-TimelineDirector répond à ce problème de workflow avec un directeur de timeline modifiable pour le pipeline natif MiniMax H3 Reference to Video de ComfyUI. Il combine images de référence, vidéos, bandes-son associées, guides, prompts et fenêtres de génération dans une seule interface, puis transforme la timeline en graphe de génération segmenté.
Le projet est publié sous licence GPL-3.0 et, au moment de la version mentionnée, compte 275 étoiles, 31 forks et un seul contributeur. La version 0.6.0 se concentre sur la génération légère de longueur illimitée et ajoute les humains numériques longue durée ainsi que le chant de personnages avec une source audio verrouillée.
Pourquoi la timeline est importante
Le plugin traite la génération comme un problème d’agencement plutôt que comme un ensemble d’entrées indépendantes. Vous pouvez positionner et découper les clips, les diviser, définir des plages numériques et établir des fenêtres de génération cyan. Seuls les médias qui intersectent la plage de génération active sont inclus dans le plan de référence ou de guide H3 actuel.
Cela permet d’utiliser un seul workflow pour plusieurs tâches qui seraient autrement différentes :
- Texte vers vidéo sans média importé.
- Génération avec référence image en un ou plusieurs segments.
- Vidéo pilotée par l’audio et synchronisation labiale d’humains numériques.
- Remplacement de personnages et transfert de mouvement.
- Références vidéo modifiables.
- Génération vidéo longue segmentée manuellement.
- Chant de personnages longue durée avec une bande-son inchangée.
L’état de la timeline est sérialisé dans le JSON du workflow ComfyUI. Un projet peut donc être enregistré, rouvert et reproduit sans reconstruire manuellement l’agencement des médias.
Fonctionnalité phare : génération segmentée de longueur illimitée
Le plugin divise une durée cible en segments qui se chevauchent et termine le processus en une seule exécution ComfyUI. Au lieu de s’appuyer sur des nœuds Loop génériques ou des chaînes d’échantillonnage dupliquées, il utilise un graphe d’expansion fini qui effectue les opérations suivantes :
- Génération par segment avec une graine partagée.
- Continuation directe depuis la fin du latent AV échantillonné du segment précédent.
- Masquage vidéo Drift-Control adaptatif.
- Continuité audio Soft AV.
- Suppression du chevauchement.
- Assemblage final synchronisé.
La limite pratique de durée est déterminée par la VRAM locale, la RAM, l’espace disque et les limites d’exécution de ComfyUI, et non par un nombre codé en dur de segments. Le dépôt contient deux exemples générés en une seule exécution, chacun d’environ 52,625 secondes, à 1 263 images et 24 images par seconde.
Pourquoi la continuation directe des latents est utile
Une approche conventionnelle pourrait décoder le segment précédent en RGB, transmettre ce résultat à l’étape suivante, puis l’encoder à nouveau. Cela introduit une étape inutile de décodage/réencodage et peut accentuer les discontinuités visuelles. Le Finite Segment Sampling transmet directement la fin du latent AV échantillonné précédent au début du segment suivant.
Le chevauchement demandé est aligné sur la grille temporelle légale de MiniMax H3. Par exemple, un chevauchement demandé de 24 images peut devenir 22, tandis que 48 peut devenir 39. La valeur alignée est utilisée de manière cohérente pour le transfert latent, le découpage décodé et l’assemblage final, afin d’éviter que les différentes étapes ne divergent sur le raccord.
Drift-Control adapte son masque à la fois au nombre de tokens vidéo du chevauchement aligné et au programme de sigma de l’échantillonneur connecté. Cela inclut les programmes accélérés en quatre et huit étapes. Seul le préfixe vidéo jetable est soumis à un nouveau bruitage dynamique ; le latent du côté du raccord reste propre.
Pour la continuation audio, le chevauchement transféré reste exact jusqu’aux huit derniers ticks du latent audio. Un masque Soft AV en demi-cosinus libère ensuite progressivement le chevauchement dans le nouvel audio généré. Lors de l’assemblage, le chevauchement Soft AV entrant remplace la fin audio précédente afin que la transition reste présente dans la bande-son finale.
Chaque segment utilise exactement la graine affichée sur le nœud d’échantillonnage. Les anciens nœuds d’aide aux boucles génériques ainsi que la dépendance à la PR #15923 ont été supprimés.
Audio verrouillé pour les humains numériques longue durée
L’un des ajouts les plus utiles est la prise en charge d’une longue bande-son qui doit rester inchangée sur plusieurs fenêtres de génération. Une image de référence préserve l’identité du personnage, tandis que la bande-son verrouillée est décodée une fois, découpée selon des positions exactes d’échantillons, puis injectée dans le latent AV de chaque segment.
Le masque de débruitage audio est réglé sur zéro pour la source verrouillée, ce qui permet au signal original de passer au lieu d’être régénéré indépendamment pour chaque segment. La sortie finale restaure la bande-son continue après l’assemblage des segments.
L’ajustement automatique élimine une source fréquente d’échec :
- Si la timeline est plus courte que l’audio source, la source est tronquée.
- Si la timeline dépasse la source, tout l’audio disponible est conservé et seul l’excédent est rempli de silence.
- Les utilisateurs n’ont pas besoin d’aligner manuellement les métadonnées MP3, les durées valides pour H3 ou les délais de préremplissage du codec.
Cela permet des workflows de synchronisation labiale et de chant de personnages longue durée bien plus faciles à contrôler que l’audio généré indépendamment pour chaque segment. L’audio source associé peut suivre les modifications vidéo et peut également être désactivé indépendamment.
Modes de référence
Chaque clip vidéo peut recevoir l’un des trois objectifs suivants :
Guide fixe
Le clip ancre le chevauchement aux positions de ses images générées. Ce mode est utile lorsque le mouvement ou le cadrage source doit être traité comme un guide structurel fort.
Référence modifiable
Le clip est transmis comme référence vidéo H3 numérotée, sans verrouiller rigidement le sujet original. Il s’agit généralement du mode privilégié pour le remplacement de personnages et la génération flexible guidée par une référence.
Limites uniquement
Seules les première et dernière images du chevauchement sont utilisées comme ancres. Ce mode est utile lorsque les extrémités doivent rester stables, mais que l’intérieur généré doit pouvoir changer.
Les bandes-son vidéo peuvent être activées ou désactivées indépendamment. Les images et fichiers audio autonomes sont également pris en charge, avec un ordre stable <Picture N>, <Video N> et <Audio N> depuis l’interface jusqu’aux entrées H3.
Comportement des prompts et planification
Le workflow principal expose à la fois un Global Prompt et des prompts propres à chaque segment. Le prompt global est réutilisé uniquement lorsque tous les prompts de segment sont vides. Dès qu’un prompt de segment est saisi, chaque segment doit avoir un prompt et le prompt global est désactivé.
Cette règle évite une ambiguïté facile à manquer, dans laquelle certains segments hériteraient des instructions globales tandis que d’autres les remplaceraient silencieusement. Elle est particulièrement importante pour la génération longue, où chaque segment doit décrire le chevauchement comme le plan d’ouverture avant d’introduire un nouveau contenu.
Le projet inclut également un pont de prompt Omni optionnel. Le MiniMax H3 Omni Media-Bundle Prompt Bridge envoie le groupe ordonné d’images, de vidéos et d’audio à un backend Prompt Rewriter Omni installé et ne renvoie que rewritten_prompt. Cette variante est utile lorsque la compréhension multimodale des médias doit avoir lieu avant l’expansion du prompt H3. Elle nécessite MiniMax-H3-Prompt-Rewriter-ComfyUI, ainsi que le modèle, la quantification et la configuration VRAM associés.
Nœuds principaux
L’architecture recommandée utilise deux nœuds principaux :
- MiniMax H3 Material Planner — modifie les médias et produit un plan H3 compact ainsi qu’un groupe de médias Omni ordonné.
- MiniMax H3 Finite Segment Sampling — transforme le plan en opérations de continuation, de masquage, d’échantillonnage, de déduplication et d’assemblage.
Le MiniMax H3 Omni Media-Bundle Prompt Bridge optionnel gère la réécriture des prompts. MiniMax H3 Timeline Director (Compatibility) conserve le workflow monolithique original et prend en charge les anciens workflows enregistrés.
La génération de vidéos longues nécessite uniquement :
Material Planner Segment Plan -> Finite Segment Sampling
Le Plan Encoder reste enregistré comme nœud interne masqué pour les graphes d’exécution développés et la compatibilité ascendante. Cette architecture séparée évite également une dépendance cyclique de ComfyUI.
Installation
Clonez le dépôt dans le répertoire des nœuds personnalisés de ComfyUI :
cd ComfyUI/custom_nodes
git clone https://github.com/Songssx/ComfyUI-MiniMaxH3-TimelineDirector.git
Redémarrez ComfyUI et recherchez MiniMax H3.
L’interface source est en anglais. Le chinois simplifié est fourni via le système officiel de localisation de ComfyUI et suit la langue sélectionnée dans les paramètres de ComfyUI. Rechargez ou redémarrez l’interface après avoir changé de langue.
Prérequis
Vous avez besoin de :
- Une version récente de ComfyUI avec les nœuds MiniMax H3 natifs.
MiniMaxH3AddGuidelors de l’utilisation de Guides.- Le modèle MiniMax H3 Ref2VA, CLIP, le VAE vidéo et le VAE audio.
- Python 3.10 ou ultérieur.
- Le paquet
imageio-ffmpegde ComfyUI pour les aperçus proxy basse résolution.
Aucune dépendance pip supplémentaire n’est déclarée. Le plugin s’appuie sur des paquets normalement présents dans une installation ComfyUI compatible, notamment PyAV, Pillow, NumPy, PyTorch, torchaudio, aiohttp et imageio-ffmpeg.
Pour protéger la VRAM, les aperçus proxy peuvent être générés silencieusement jusqu’à 480×270 et 12 images par seconde. Le redimensionnement lors du décodage adapte également la sortie à la largeur et à la hauteur configurées sur le nœud.
Workflow pratique
- Ouvrez le workflow All-in-One Full Timeline Director.
- Définissez la largeur, la hauteur et
generation_seconds. - Ajoutez des images, des vidéos et de l’audio depuis la barre d’outils ou en déposant des fichiers dans l’interface.
- Déplacez, découpez ou divisez les clips selon vos besoins.
- Faites glisser la plage cyan sur l’intervalle à générer.
- Attribuez à chaque vidéo un mode : Guide fixe, Référence modifiable ou Limites uniquement.
- Décidez si l’audio associé aux vidéos doit être inclus.
- Ajoutez un prompt global ou complétez les prompts de chaque segment.
- Pour une génération longue, créez des fenêtres GEN qui se chevauchent et choisissez le chevauchement de raccord souhaité.
- Connectez directement le Segment Plan du Material Planner à Finite Segment Sampling.
Le plugin gère l’alignement des images légales, Drift-Control, Soft AV, la suppression des chevauchements, la découpe des fins et l’assemblage AV final. Il ne segmente pas automatiquement les médias en fonction de la durée de la référence et ne déduit pas si l’identité du personnage doit être poursuivie. Les plages de segments, les chevauchements et les affectations restent des décisions explicites de l’utilisateur.
Pour les références vidéo longues, utilisez le plan final du segment précédent comme Guide d’ouverture du segment suivant. Décrivez ce chevauchement comme le Plan 1 avant d’introduire un nouveau contenu, puis supprimez l’intervalle de Guide répété du segment suivant lors de l’assemblage.
Projets associés et licence
Drift-Control AV est adapté de ComfyUI-MiniMaxH3-Contex-Loop sous GPL-3.0 et reste expérimental, notamment pour les comparaisons de longues chaînes sur un même plan. Le pont Omni et le workflow de génération de prompts font référence à pytraveler/MiniMax-H3-Prompt-Rewriter-ComfyUI et l’adaptent.
Le projet remercie également les mainteneurs des nœuds MiniMax H3 et Guide natifs de ComfyUI et oriente les utilisateurs vers MiniMax-AI/MiniMax-H3 pour les recommandations officielles concernant le modèle.
Pour les développeurs qui utilisent déjà les nœuds MiniMax H3 de ComfyUI, Timeline Director est précieux, car il transforme un graphe ponctuel de référence vers vidéo en un système réutilisable d’édition et de continuation. Son idée la plus forte n’est pas simplement d’ajouter un nœud supplémentaire, mais de rendre la sélection des médias, les limites des segments, la politique de chevauchement, la portée des prompts, la continuité audio et l’assemblage final explicites dans un workflow reproductible unique.