Visual Enhancer:适用于图像、视频和实时播放的 DLSS 5 超分辨率

探索 Visual Enhancer:一款便携式 Windows 工具,集成 DLSS 5、RTX Video Super Resolution、HDR、帧生成和实时播放功能。

Visual Enhancer 的意义

将低分辨率图像放大很容易展示,但要让效果始终实用却很难。不同媒体需要不同的处理方式:照片可能受益于降噪和细节重建,而压缩视频则需要时域清理、帧插值、HDR 转换以及保留音频的导出。Visual Enhancer 将这些操作整合到一个适用于 NVIDIA RTX GPU 的便携式 Windows 应用中。

该项目围绕可配置管线构建,而不是单一的“增强”按钮。你可以排列各个阶段,仅启用任务所需的操作,预览结果,并导出单个文件或整个批次。同一应用还提供 Live 播放功能,支持本地视频、直接流、YouTube 和 Twitch。

安装

Visual Enhancer 以便携式应用形式发布:

  1. 从 GitHub 仓库 下载最新版本。
  2. 将完整的 ZIP 压缩包解压到文件夹中。
  3. 运行 Visual Enhancer.exe。

应用需要 64 位 Windows 11、Direct3D 12 以及兼容的 NVIDIA GeForce RTX GPU。使用 NVIDIA 加速阶段时,需要当前版本的 NVIDIA 驱动程序。DLSS 5 Neural Rendering 是否可用,取决于受支持的硬件、驱动程序支持,以及在所选 AI Processing GPU 上能否成功初始化。

使用 DLSS Frame Generation 时,应启用硬件加速 GPU 计划。RTX Video Super Resolution 和 RTX Video HDR 需要各自对应的运行时。视频 EWA Lanczos 缩放还需要可用的 Vulkan 设备,以及支持 libplacebo 的 FFmpeg 构建版本。

为实验而设计的管线

Image 和 Video 拥有相互独立的阶段列表。阶段从上到下执行,每张卡片都可以启用、禁用或拖动到其他位置。初始图像顺序为:

Denoising → DLSS Neural Rendering → Scaling → DLSS Super Resolution
→ RTX Super Resolution → Coloring → Sharpening

视频管线还会在 Coloring 之前加入 DLSS Frame Generation。这些是可用阶段,并非强制效果。每个启用的阶段执行后,渲染都会进行预检,验证尺寸、帧率、硬件能力和 HDR 兼容性。

阶段顺序很重要。Video Scaling、DLSS Super Resolution 和 RTX Super Resolution 不能在任意位置处理 HDR 视频,因此通常应在 HDR 转换前运行。非零的视频锐化也必须先于 HDR 转换。Frame Generation 的目标帧率必须高于进入该阶段的帧率。

DLSS 5 Neural Rendering

Neuroframe Engine 让 Visual Enhancer 可以直接使用 DLSS 5 Neural Rendering,无需外部图形注入器或游戏附加组件。它可以处理静态图像、视频和 Live 播放内容。

可用控制项包括:

  • NR Style: Default、Natural 或 Cinematic
  • NR Intensity: 0.00–2.00
  • Local Tone Strength: 0.00–2.00
  • Local Structure Strength: 0.00–2.00
  • Skin Structure Strength: -1.00–2.00
  • Automatic Mask: 可选的人脸和皮肤蒙版
  • NR Passes: 一到四次处理
  • NR Color Strength、Tone Preservation、Face/Skin Protection 和 Grain Preservation
  • Mask Feather: 0–128 个输出像素
  • Shimmer Suppression: 视频和 Live 使用的 0.00–1.00

Neural Rendering 阶段会以此前阶段提供的尺寸运行。输入至少必须为 64×64,而受支持的 Neural Rendering 处理范围上限为 7680×4320。如果想在渲染前改变尺寸,请使用独立的 Scaling 阶段。

当你希望重建结构而不进行明显的色彩变换时,Detail-Only 预设非常有用。它会将 NR Color Strength 设为 0.00,将 Tone Preservation 设为 1.00,其他控制项仍可编辑。自定义图像蒙版可以限制 Neural Rendering 的应用区域;在当前应用会话中,Live 也可以使用同一蒙版。

增加处理次数可以产生更强的累积效果,但会延长处理时间。对于视频,Shimmer Suppression 有助于稳定帧间的细节,减少令人分心的时域闪烁。

放大选项刻意分开

Visual Enhancer 包含三种不同的方法,不应将它们混为一谈:

  1. Conventional Scaling 使用 Lanczos4、Area、Bicubic、Bilinear 或 Nearest 等滤镜改变图像尺寸;视频则支持 Spline36、Lanczos、Bicubic、Area、Bilinear 或 EWA Lanczos。
  2. DLSS Super Resolution 提供 1× 的 DLAA、1.5× 的 Quality、约 1.72× 的 Balanced、2× 的 Performance,以及 3× 的 Ultra Performance。除 Default 预设外,还提供 J、K、L 和 M 预设。
  3. RTX Video Super Resolution 提供 1 至 4 级质量,以及从 1× 到 4× 的输出缩放和自定义尺寸。

RTX Video Super Resolution 可以在 1× 尺寸下以原始分辨率增强图像,也可以在应用重建的同时放大图像。每个维度的输出尺寸上限为 16384 像素;启用 VSR 时,自定义尺寸不能小于输入图像。

HDR 转换和视频输出

RTX Super Resolution 视频阶段还包含 RTX Video HDR。VSR 和 HDR 可以同时运行,也可以禁用 VSR,仅进行 HDR 处理。HDR 控制项包括 0–200 的对比度和饱和度、10–100 的中间灰度、400–2000 尼特的峰值亮度,以及 Packed 10-bit 或 Packed 10-bit FP16 处理模式。

RTX Video HDR 接受 SDR 输入,而不是已经为 HDR 的视频。要导出 HDR,请启用 10-bit HDR Mode 并选择兼容的编码器。支持 HDR 的输出包括 H.265、AV1、ProRes Proxy、ProRes HQ 和 FFV1 Lossless RGB 10-bit。

可用的视频输出格式如下:

编码器 容器 说明
H.264 MP4 CPU 或 NVIDIA NVENC,8 位 SDR
H.265 MKV CPU 或 NVENC,支持 10 位 HDR
AV1 MKV CPU 或 NVENC,支持 10 位 HDR
ProRes Proxy MOV 基于 CPU 的 10 位 4:2:2
ProRes HQ MOV 基于 CPU 的 10 位 4:2:2
FFV1 Lossless RGB 10-bit MKV 基于 CPU 的无损 10 位 RGB

默认编码器为使用 NVIDIA NVENC 的 H.264。编码质量可以选择 Auto、Good、Best 或 Max;ProRes HQ 和 FFV1 使用编码器固定的质量设置。

从 23.976 到 480 FPS 的帧生成

DLSS Frame Generation 是一个可以重新排序的视频阶段。它可以按 23.976 至 480 FPS 的目标生成中间帧,包括 60、120、144、240 和 360 FPS。所选目标必须高于进入该阶段的帧率,否则预检会拒绝该管线。

DLSSG 引擎提供 Auto、Native DLSSG 和 Cascade 模式。在进行完整导出前,可以从选定的视频位置渲染三秒、五秒、十秒、二十秒或三十秒的预览。这对于检查运动伪影并确认目标帧率是否合适尤其有用。

Live 播放

Live 模式会在观看本地视频或受支持的在线来源时应用 Neural Rendering。它支持直接网络流、YouTube 和 Twitch,并提供播放、音量、静音、扩展视图和全屏模式控制。

Live 的重要设置包括:

  • 从 Auto 到 2160p 的来源质量
  • 从 480p 到 2160p 的最大输入分辨率
  • 一秒、两秒或四秒的分段长度
  • Auto、Source、60、30 或 24 FPS 模式
  • 2 到 30 秒的播放缓冲
  • 从 25% 到 200% 的独立 Live Scale

Live 使用独立的 Neural Rendering 设置,因此调整播放不会覆盖主要的 Image 或 Video 配置。大多数 Neural Rendering 控制项都可以在播放过程中更改。来源、质量、分辨率、分段长度、目标 FPS、缓冲和 Live Scale 的更改会在下一次启动 Live 时生效。

预览、批处理和导出安全

统一媒体查看器支持 Split、2-Up 和 Output 对比、100% 检查、图像适配以及视频时间线拖动。Realtime Preview 可以自动刷新受支持的更改,而智能预览缓存会在你调整后续阶段时复用未改变的中间结果。

在生产工作中,批处理队列接受文件、文件夹、拖放媒体、剪贴板位图图像、复制的本地文件以及受支持的浏览器图像 URL。失败项目可以重试,已完成项目可以清除,完成的文件可以在资源管理器中显示。每个队列项目都会报告状态、进度、耗时、尺寸、处理详情和输出路径。

图像可以导出为 PNG、JPEG、WebP、AVIF 或 TIFF。PNG 和 TIFF 支持 16 位输出。在容器和编码器允许的情况下,视频导出会保留源音频、元数据和章节,但统一导出器不会映射字幕流。图像导出不会保留原始 EXIF 元数据,不过解码时会应用 EXIF 方向、处理受支持的色彩配置文件,并在格式支持的情况下保留透明度。

默认情况下,完成的文件会写入 outputs/,故障排查日志存储在 logs/。已有文件不会被静默覆盖,必要时会清理未完成的输出。

实用的起始配置

对于清晰的静态图像增强,可以从 Denoising、DLSS Neural Rendering 和适度锐化开始。只有当输出需要更大分辨率时,再添加 Scaling 或 RTX Super Resolution。

对于较旧的 SDR 视频,一个合理的顺序是:

Denoising → DLSS Neural Rendering → RTX Super Resolution/HDR
→ DLSS Frame Generation → Coloring → Sharpening

请根据来源和预检要求进行调整。如果目标是 HDR 转换而不是放大,请禁用 VSR,同时保留 RTX Video HDR。对于高帧率播放,请在导出前预览 Frame Generation,并确认所选编码器和 HDR 模式符合目标显示工作流。

项目状态和许可

该仓库主要使用 Python(81.7%)和 QML(18.2%)实现,Lua 占 0.1%。在所提供的仓库快照中,它拥有 1.1k 个 star、90 个 fork、16 位关注者、68 次提交、14 个版本发布,以及一位列出的贡献者。最新版本为 Visual Enhancer v11.0。

项目自有材料依据 Merserk Source License 1.0 发布。允许个人、专业和商业使用,包括对处理后输出的商业使用。除非许可证另有规定,重新分发、重新打包、重新品牌化、转售、再许可、发布修改后的构建版本及类似活动均需事先获得书面许可。第三方组件仍受其各自许可证约束;重新分发应用前,请查阅 LICENSE 和 THIRD-PARTY-NOTICES。

Visual Enhancer 是一个独立的社区项目,与 NVIDIA 没有关联,也未获 NVIDIA 赞助或认可。NVIDIA、GeForce RTX、DLSS 和 RTX Video 是 NVIDIA Corporation 的商标或注册商标。

来源

Merserk/dlss5-visual-enhancer:适用于图像和视频的 DLSS 5 Neural Rendering,支持帧生成、RTX Video Super Resolution、HDR 和 Live 播放