Visual Enhancer : mise à l’échelle DLSS 5 pour les images, les vidéos et la lecture en direct

Découvrez Visual Enhancer, un outil Windows portable qui combine DLSS 5, RTX Video Super Resolution, HDR, la génération d’images intermédiaires et la lecture en direct.

Pourquoi Visual Enhancer est important

Mettre à l’échelle une image basse résolution est facile à démontrer, mais difficile à rendre constamment utile. Les différents médias nécessitent des traitements différents : une photographie peut bénéficier d’une réduction du bruit et d’une reconstruction des détails, tandis qu’une vidéo compressée a besoin d’un nettoyage temporel, d’une interpolation d’images, d’une conversion HDR et d’une exportation préservant l’audio. Visual Enhancer regroupe ces opérations dans une seule application Windows portable pour les GPU NVIDIA RTX.

Le projet repose sur des pipelines configurables plutôt que sur un simple bouton « améliorer ». Vous pouvez organiser les différentes étapes, n’activer que les opérations nécessaires pour une tâche, prévisualiser le résultat et exporter un fichier ou un lot complet. La même application propose également un mode de lecture en direct pour les vidéos locales, les flux directs, YouTube et Twitch.

Installation

Visual Enhancer est distribué sous forme d’application portable :

  1. Téléchargez la dernière version depuis le dépôt GitHub.
  2. Extrayez l’intégralité de l’archive ZIP dans un dossier.
  3. Exécutez Visual Enhancer.exe.

L’application nécessite Windows 11 64 bits avec Direct3D 12 et un GPU NVIDIA GeForce RTX compatible. Des pilotes NVIDIA à jour sont requis pour les étapes utilisant NVIDIA. La disponibilité du rendu neuronal DLSS 5 dépend du matériel pris en charge, de la compatibilité des pilotes et de l’initialisation réussie sur le GPU de traitement IA sélectionné.

La planification accélérée du GPU doit être activée pour la génération d’images intermédiaires DLSS. RTX Video Super Resolution et RTX Video HDR nécessitent leurs environnements d’exécution respectifs. La mise à l’échelle vidéo EWA Lanczos nécessite en outre un périphérique Vulkan disponible et une version de FFmpeg prenant en charge libplacebo.

Un pipeline conçu pour l’expérimentation

Les listes d’étapes Image et Vidéo sont indépendantes. Les étapes sont exécutées de haut en bas, et chaque carte peut être activée, désactivée ou déplacée. L’ordre initial des images est le suivant :

Réduction du bruit → Rendu neuronal DLSS → Mise à l’échelle → Super résolution DLSS
→ RTX Super Resolution → Colorisation → Netteté

Le pipeline vidéo inclut également la génération d’images intermédiaires DLSS avant la colorisation. Ces étapes sont disponibles, mais les effets ne sont pas obligatoires. Le rendu effectue des vérifications préalables après chaque étape activée, en validant les dimensions, les fréquences d’images, les capacités matérielles et la compatibilité HDR.

Cet ordre est important. La mise à l’échelle vidéo, DLSS Super Resolution et RTX Super Resolution ne peuvent pas traiter une vidéo HDR à des positions arbitraires ; elles doivent donc normalement être exécutées avant la conversion HDR. Une netteté vidéo non nulle doit également précéder la conversion HDR. La fréquence cible de la génération d’images intermédiaires doit être supérieure à la fréquence d’images qui entre dans cette étape.

Rendu neuronal DLSS 5

Le moteur Neuroframe rend le rendu neuronal DLSS 5 directement disponible dans Visual Enhancer, sans injecteur graphique externe ni extension de jeu. Il peut traiter des images fixes, des vidéos et la lecture en direct.

Les commandes comprennent :

  • Style NR : Par défaut, Naturel ou Cinématique
  • Intensité NR : 0.00–2.00
  • Intensité du ton local : 0.00–2.00
  • Intensité de la structure locale : 0.00–2.00
  • Intensité de la structure de la peau : -1.00–2.00
  • Masque automatique : masquage facultatif des visages et de la peau
  • Passes NR : une à quatre passes
  • Intensité des couleurs NR, Préservation des tons, Protection du visage/de la peau et Préservation du grain
  • Adoucissement du masque : 0–128 pixels de sortie
  • Suppression du scintillement : 0.00–1.00 pour la vidéo et le mode Live

L’étape de rendu neuronal fonctionne avec les dimensions fournies par les étapes précédentes. Son entrée doit mesurer au moins 64×64, tandis que le traitement par rendu neuronal est limité à 7680×4320. Utilisez l’étape de mise à l’échelle distincte si vous souhaitez modifier les dimensions avant le rendu.

Le préréglage Détails uniquement est utile lorsque vous souhaitez reconstruire la structure sans appliquer une forte transformation des couleurs. Il définit Intensité des couleurs NR sur 0.00 et Préservation des tons sur 1.00, tout en laissant les autres commandes modifiables. Un masque d’image personnalisé peut limiter les zones auxquelles le rendu neuronal est appliqué ; ce même masque est disponible dans Live pendant la session actuelle de l’application.

Des passes supplémentaires peuvent produire un effet cumulatif plus marqué, mais elles augmentent le temps de traitement. Pour la vidéo, la suppression du scintillement aide à stabiliser les détails fins entre les images et à réduire les scintillements temporels gênants.

Les options de mise à l’échelle sont volontairement séparées

Visual Enhancer inclut trois approches différentes qu’il ne faut pas confondre :

  1. La mise à l’échelle conventionnelle modifie les dimensions à l’aide de filtres tels que Lanczos4, Area, Bicubic, Bilinear ou Nearest pour les images, et Spline36, Lanczos, Bicubic, Area, Bilinear ou EWA Lanczos pour les vidéos.
  2. DLSS Super Resolution propose DLAA à 1×, Qualité à 1.5×, Équilibré à environ 1.72×, Performances à 2× et Ultra Performances à 3×. Les préréglages J, K, L et M sont disponibles en plus du préréglage par défaut.
  3. RTX Video Super Resolution propose des niveaux de qualité de 1 à 4 et une mise à l’échelle de sortie de 1× à 4×, ainsi que des dimensions personnalisées.

RTX Video Super Resolution peut améliorer une image à sa résolution native avec un facteur de 1×, ou l’agrandir tout en appliquant une reconstruction. Les dimensions de sortie sont limitées à 16384 pixels par dimension, et les dimensions personnalisées ne peuvent pas être inférieures à celles de l’image entrante lorsque VSR est activé.

Conversion HDR et sortie vidéo

L’étape vidéo RTX Super Resolution contient également RTX Video HDR. VSR et HDR peuvent fonctionner ensemble, ou VSR peut être désactivé pour un traitement HDR uniquement. Les commandes HDR incluent le contraste et la saturation de 0–200, le gris moyen de 10–100, la luminance maximale de 400–2000 nits, ainsi que le traitement Packed 10 bits ou Packed 10 bits FP16.

RTX Video HDR accepte une entrée SDR, et non une vidéo déjà en HDR. Pour exporter en HDR, activez le mode HDR 10 bits et sélectionnez un codec compatible. Les sorties compatibles HDR comprennent H.265, AV1, ProRes Proxy, ProRes HQ et FFV1 Lossless RGB 10 bits.

Les sorties vidéo disponibles sont les suivantes :

Codec Conteneur Remarques
H.264 MP4 CPU ou NVIDIA NVENC, SDR 8 bits
H.265 MKV CPU ou NVENC, prend en charge le HDR 10 bits
AV1 MKV CPU ou NVENC, prend en charge le HDR 10 bits
ProRes Proxy MOV 10 bits 4:2:2 basé sur le CPU
ProRes HQ MOV 10 bits 4:2:2 basé sur le CPU
FFV1 Lossless RGB 10-bit MKV RGB 10 bits sans perte, basé sur le CPU

Le codec par défaut est H.264 avec NVIDIA NVENC. La qualité d’encodage peut être Auto, Bonne, Optimale ou Maximale ; ProRes HQ et FFV1 utilisent une qualité fixée par le codec.

Génération d’images de 23,976 à 480 FPS

La génération d’images intermédiaires DLSS est une étape vidéo réorganisable. Elle peut créer des images intermédiaires à des fréquences cibles allant de 23.976 à 480 FPS, notamment 60, 120, 144, 240 et 360 FPS. La cible sélectionnée doit être supérieure à la fréquence d’images entrant dans l’étape ; sinon, la vérification préalable rejette le pipeline.

Le moteur DLSSG propose les modes Auto, DLSSG natif et Cascade. Avant de lancer une exportation complète, générez un aperçu de trois, cinq, dix, vingt ou trente secondes à partir de la position vidéo sélectionnée. Cela est particulièrement utile pour vérifier les artefacts de mouvement et s’assurer que la fréquence cible est appropriée.

Lecture en direct

Le mode Live applique le rendu neuronal pendant le visionnage de vidéos locales ou de sources en ligne prises en charge. Il accepte les flux réseau directs, YouTube et Twitch, avec des commandes de lecture, de volume, de sourdine, d’affichage étendu et de plein écran.

Les paramètres Live importants comprennent :

  • Qualité de la source, d’Auto à 2160p
  • Résolution d’entrée maximale, de 480p à 2160p
  • Segments d’une, deux ou quatre secondes
  • Modes Auto, Source, 60, 30 ou 24 FPS
  • Tampon de lecture de 2 à 30 secondes
  • Mise à l’échelle Live indépendante de 25 % à 200 %

Live conserve ses propres paramètres de rendu neuronal ; le réglage de la lecture ne remplace donc pas la configuration principale Image ou Vidéo. La plupart des commandes de rendu neuronal peuvent être modifiées pendant la lecture. Les modifications de la source, de la qualité, de la résolution, de la longueur des segments, de la fréquence cible, du tampon et de la mise à l’échelle Live prennent effet au prochain démarrage de Live.

Aperçu, traitement par lots et sécurité de l’exportation

Le visualiseur multimédia unifié prend en charge les comparaisons Séparé, 2-Up et Sortie, l’inspection à 100 %, l’ajustement des images et le déplacement sur la timeline vidéo. L’aperçu en temps réel peut actualiser automatiquement les modifications prises en charge, tandis qu’un cache d’aperçu intelligent réutilise les résultats intermédiaires inchangés lorsque vous ajustez les étapes suivantes.

Pour les travaux de production, la file d’attente par lots accepte les fichiers, les dossiers, les médias glissés-déposés, les images bitmap du presse-papiers, les fichiers locaux copiés et les URL d’images prises en charge provenant d’un navigateur. Les éléments échoués peuvent être relancés, les éléments terminés supprimés et les fichiers finaux affichés dans l’Explorateur. Chaque élément de la file indique son état, sa progression, le temps écoulé, ses dimensions, les détails du traitement et le chemin de sortie.

Les images peuvent être exportées aux formats PNG, JPEG, WebP, AVIF ou TIFF. PNG et TIFF prennent en charge la sortie 16 bits. Les exportations vidéo préservent l’audio, les métadonnées et les chapitres de la source lorsque le conteneur et le codec le permettent, mais les flux de sous-titres ne sont pas mappés par l’exportateur unifié. Les exportations d’images ne préservent pas les métadonnées EXIF d’origine, bien que le décodage applique l’orientation EXIF, gère les profils colorimétriques pris en charge et conserve la transparence lorsque le format l’autorise.

Par défaut, les fichiers terminés sont écrits dans outputs/, tandis que les journaux de dépannage sont stockés dans logs/. Les fichiers existants ne sont pas écrasés silencieusement et les sorties incomplètes sont supprimées si nécessaire.

Configurations de départ pratiques

Pour améliorer proprement une image fixe, commencez par la réduction du bruit, le rendu neuronal DLSS et une netteté modérée. Ajoutez la mise à l’échelle ou RTX Super Resolution uniquement si la sortie nécessite une résolution supérieure.

Pour une ancienne vidéo SDR, un ordre raisonnable est le suivant :

Réduction du bruit → Rendu neuronal DLSS → RTX Super Resolution/HDR
→ Génération d’images intermédiaires DLSS → Colorisation → Netteté

Adaptez cet ordre à la source et aux exigences de la vérification préalable. Si l’objectif est la conversion HDR plutôt que l’agrandissement, désactivez VSR tout en laissant RTX Video HDR activé. Pour la lecture à fréquence d’images élevée, prévisualisez la génération d’images intermédiaires avant l’exportation et vérifiez que le codec choisi et le mode HDR correspondent au flux de travail d’affichage prévu.

État du projet et licence

Le dépôt est principalement développé en Python (81.7%) et en QML (18.2%), Lua représentant 0.1%. Au moment de l’instantané du dépôt fourni, il comptait 1,1 k étoiles, 90 forks, 16 observateurs, 68 commits, 14 versions et un contributeur répertorié. La dernière version est Visual Enhancer v11.0.

Les éléments appartenant au projet sont distribués sous la Merserk Source License 1.0. L’utilisation personnelle, professionnelle et commerciale est autorisée, y compris l’utilisation commerciale des sorties traitées. La redistribution, le reconditionnement, le changement de marque, la revente, la sous-licence, la publication de versions modifiées et les activités similaires nécessitent une autorisation écrite préalable, sauf indication contraire de la licence. Les composants tiers restent régis par leurs propres licences ; consultez LICENSE et THIRD-PARTY-NOTICES avant de redistribuer l’application.

Visual Enhancer est un projet communautaire indépendant et n’est ni affilié à NVIDIA, ni parrainé ou approuvé par NVIDIA. NVIDIA, GeForce RTX, DLSS et RTX Video sont des marques commerciales ou des marques déposées de NVIDIA Corporation.

Source

Merserk/dlss5-visual-enhancer : rendu neuronal DLSS 5 pour les images et les vidéos avec génération d’images intermédiaires, RTX Video Super Resolution, HDR et lecture en direct