本文转自git项目更新时间2026年9月14日17点。
DLSSG for SM86(Proxy)- 0.3.0 版本
在 RTX 30 系列(SM86)上启用 NVIDIA DLSS 帧生成(DLSS-G)。Windows x64 / D3D12,运行文件为 version.dll 和 dlssg_sm86.ini。
本次更新说明
由 native 模式回退到代理模式。native 化(自建 NGX host)在部分游戏上存在难以修复的兼容问题;本版改用代理 DLL 内嵌未修改的原厂运行库,游戏对 NGX 的调用不变,兼容性更好。
310.9 运行库新增 6X(MaxGeneratedFrames 上限由 3 提到 5)。在自身支持 Dynamic MFG 的游戏上,帧生成选「动态 / 自动」时会跑到 6X。
内核最优集(离线基准快约 19~32%)、两档出厂 INI、录制回放与诊断日志等见下文与 docs/。
下一版本计划
重新评估 Vulkan 支持。
重新评估在仅支持 4X 的游戏上强制 6X。本版已确认该做法逐游戏、依赖游戏侧闭源插件、较脆弱(见「6X 说明」),后续另寻更稳的路径。
DLSS L / M 预设的优化:初步测试延迟改善约 1.2 倍,验证后并入。
运行要求
系统与游戏:Windows 10/11 x64、D3D12。
GPU:RTX 30 系列(SM86)。3080 Ti 上完成整套离线基准;3070 上做开发验证。
驱动:带 NGX / NVAPI / CUDA 接口的 NVIDIA 驱动,591.86 与 610.74 实测可用。cubin 需约 R580+ 驱动,更旧的驱动自动回退 PTX(仅首帧多一次 JIT)。
不需要 CUDA Toolkit,不需要 Python。
两个发布包用法一致,仅内嵌运行库与上限不同;310.9 版在 4X 及以下与 310.1 版一致,另支持 6X。根目录下为310.9最新的dlssg版本,310.1为老版本。
不同配置的插帧额外显存参考
帧生成自身的本地显存增量(预热后减去创建特性前,向上取整到 10 MiB,310.9 版、最优内核)。该增量只随输出分辨率变化,与倍率无关:2X 与 6X 占用相同,倍率不额外占用显存。
![]()
同高度不同宽度的占用接近(按输出像素数计)。该值为帧生成自身增量,不含游戏本体与合成输入纹理。
安装与升级
完全退出游戏。
进入游戏的渲染 EXE 目录(如《黑神话:悟空》为 ...\b1\Binaries\Win64\)。
将 version.dll 与 dlssg_sm86.ini 复制进去;该目录已有 version.dll 时先备份原文件。少数游戏不加载 version.dll,改用发布包 alternatives\ 目录下的其它代理名(按游戏实际加载的 DLL 选一个,如 winmm.dll / dxgi.dll / dbghelp.dll 等)。
启动游戏,在图形设置中开启 DLSS 帧生成,选 2X / 3X / 4X(310.9 版且游戏支持时可至 6X)。
升级:退出游戏后用新版 version.dll 覆盖即可,dlssg_sm86.ini 一般无需改动。
卸载:用备份的原 version.dll 覆盖回去(或删除),并删除 dlssg_sm86.ini。
出厂 dlssg_sm86.ini 只保留两个决定性开关:[FrameGeneration] Optimized(1 用最优内核,输出与原厂逐位一致;0 用原厂数值不优化)与 [FrameGeneration] MaxGeneratedFrames(5 对应 6X、3 对应 4X,实际生成帧数由游戏请求、并钳到运行库上限)。其余诊断/兼容项取安全默认、不在出厂文件中,完整清单见 docs/INSTALL.md。
杀软误报与签名
本版发布的代理 DLL(version.dll、winmm.dll 及 alternatives\ 下各代理)均做代码签名。自签名证书仅验证签名者身份与文件完整性,不提供 Windows 默认信任;首次运行 Windows SmartScreen 仍可能提示「未知发布者」——这是基于信誉的提示,与杀软报毒是两回事。本次使用自签证书 CN=DLSSG for SM86 (self-signed),SHA-1 指纹 85BA66762F851E49148D706915D09026281418E6;可在文件属性→数字签名或用 signtool verify /pa 核对签名者与指纹。
性能(RTX 3080 Ti,离线基准)
RTX 3080 Ti,驱动 591.86,SM86,2026-09-13 实测。单位为每个真实帧对应整组帧生成的 GPU 毫秒数,含共用预处理;4 轮 × 每轮 256 组,取各轮中位数的中位数,同一轮内各配置交错运行以共享温度漂移。下表为 310.9 版、16:9 常见分辨率,原厂内核(Optimized=0)与最优内核(Optimized=1)的对比。耗时降低统一按 (原厂 − 最优) / 原厂 计算,使用未取整数据。
本表衡量的是帧生成的 GPU 计算开销,不等于实测游戏 FPS 增幅;如何据此估算显示帧率见下一节。该次测量之后仅有生命周期与工具类改动(内核缓存与重绑定、录制回放、日志、INI 精简等),最优内核集本身未变动(同一组 63 个变体 + 图像补丁 + 跨内核合并),故以上数字适用于本次发布。
![]()
越低分辨率、越低倍率收益越大(更接近启动/延迟受限)。310.1 版在 2X–4X 与上表接近。21:9 / 32:9 / 4:3 各分辨率及「各 Evaluate 跨度之和」一表见 docs/evidence/。3X 及以上单组耗时可能双峰(各实现皆有),中位数或落在两峰之间,原始 min/mean 在数据 JSON 中。
插帧后帧率怎么估算
先在相同场景、输出分辨率、DLSS 超分档位与画质设置下关闭帧生成,得到帧率 F_off。用 1000 / F_off 换算基础帧时间,再从上表按分辨率、倍率与内核配置选整组插帧耗时 T_FG(ms)。
![]()
M 为倍率(2X…6X 对应 2…6)。一组含一个真实帧与 M − 1 个生成帧;上表的 T_FG 已包含整组生成帧与共用预处理,不能再乘 M − 1。开启插帧后的真实帧/帧组速率 G 低于关闭插帧的 F_off。
例:关闭帧生成约 50 FPS(基础帧时间 20 ms),取上表 4K 4X 的 T_FG:
![]()
其他分辨率/倍率换用对应行,F_off 填该设置下自己实测的值。这是把基础渲染时间与插帧组开销相加的粗略估计;GPU 资源争用、同步、CPU 开销、限帧与刷新率都会影响实际结果,估计值不保证等于计数器读数或实际显示帧率。
6X 说明
6X(每真实帧生成 5 帧)为 NVIDIA DLSS 4.5 的 Dynamic Multi Frame Generation。310.9 版内嵌的运行库支持该能力,本项目使其能在 Ampere 上运行;是否得到 6X 取决于游戏:
游戏自身支持 6X(自带较新的 Streamline 帧生成插件、菜单中可选 6X 或 Dynamic MFG):装 310.9 版并置 MaxGeneratedFrames=5 即可,实测可稳定运行 6X。
游戏仅支持 4X(自带较旧的 4X 插件,当前多数游戏如此):上限由游戏侧插件决定,本项目无法将其抬到 6X(该插件在初始化时按 4X 铺设内部呈现队列,强行加帧会越界导致帧生成失效或崩溃)。这类游戏请使用 4X。
实测反馈
《黑神话:悟空》、《赛博朋克 2077》与 FH6 实测可正常开启 4X;《Resonance A Plague Tale Legacy》在 310.9 版、帧生成选「动态 / 自动」时默认跑 6X。插帧观感依赖基础帧率:基础帧率偏低时可能出现画面破坏与边缘效应,倍率越高越明显(6X 比 4X 更吃基础帧率),部分游戏即使 4X 也需适当降低画质设置、把基础帧率抬高后才有较好观感;这是帧生成在帧率余量不足时的固有表现,非本项目缺陷。
诊断与边界
日志写入游戏目录 dlssg_sm86\logs\(loader_<PID>.jsonl / backend_<PID>.jsonl)。默认 [Logging] Level=1 只记错误,排查时改 2 或 3。
帧生成未生效时先看 backend_*.jsonl 是否有 install 且 route active=true;缺失多为驱动/运行库不匹配,会记录原因并回退原厂路径。
本版优化的是帧生成的 GPU 计算开销,不能将离线耗时下降当成实测游戏 FPS 增幅;实际帧率增益取决于游戏与瓶颈所在。
INI 全部键、日志字段与录制回放见 docs/INSTALL.md、docs/CAPTURE.md。
SM75 来源与致谢
Coldwood1026 的 RTX 20 系列 / SM75 适配(实验性 SM75 路由的内核族来源,见 THIRD_PARTY_NOTICES.txt)。
NVIDIA 的 DLSS-G 运行库、模型与前后处理(内嵌、未经修改)。
许可与第三方
本项目源码采用 GPLv3。
内嵌的 nvngx_dlssg.dll(310.1 SHA 前缀 c989c0eb…、310.9.1 SHA 前缀 ff6e90eb…)、提取/重编译的内核资源与 assets/kernels/sm75/ 为 NVIDIA 及上游第三方材料,不随源码转授权,见 THIRD_PARTY_NOTICES.txt。
更多游戏资讯请关注:电玩帮游戏资讯专区
电玩帮图文攻略 www.vgover.com
