不改一行代码,官方 DLSS 跑进 RX 7700 XT:实测 72 帧
不改一行代码,官方 DLSS 跑进 RX 7700 XT:实测 72 帧 AMD 的显卡,这回跑上了英伟达原版的 DLSS。一个网名叫 countervolts 的开发者放出了名叫 d4r 的项目,全称 DLSS 4 Radeon,把英伟达官方的 DLSS 库 nvngx_dlss.dll 原封不
💡 你将学到
不改一行代码,官方 DLSS 跑进 RX 7700 XT:实测 72 帧 AMD 的显卡,这回跑上了英伟达原版的 DLSS。一个网名叫 countervolts 的开发者放出了名叫 d4r 的项目,全称 DLSS 4 Radeon,把英伟达官方的 DLSS 库 nvngx_dlss.dll 原封不
不改一行代码,官方 DLSS 跑进 RX 7700 XT:实测 72 帧
AMD 的显卡,这回跑上了英伟达原版的 DLSS。一个网名叫 countervolts 的开发者放出了名叫 d4r 的项目,全称 DLSS 4 Radeon,把英伟达官方的 DLSS 库 nvngx_dlss.dll 原封不动搬进 RX 7700 XT,在 Linux 下经 Proton 运行。实测《寂静岭 Townfall》2560×1440 质量档,DLSS 3 模式跑出 72.4 帧,三个 DLSS 模型全部正常出图。
库一行没改,CUDA 调用被半路截走
先说这事为什么稀奇。DLSS 的核心是个动态链接库,里面全是 CUDA 代码,天生只认英伟达的显卡,AMD 显卡装上也不认。d4r 的思路是在中间架一座桥:游戏调用 DLSS 时,Wine 把这些 CUDA 调用转交给 ZLUDA。ZLUDA 是一个开源 CUDA 兼容层,GitHub 上攒了 14.9k star,干的活就是把英伟达的 PTX 指令(英伟达为自家 GPU 设计的一种中间指令格式)翻译成 AMD 显卡能执行的指令,底层走 ROCm/HIP。翻译完成后,DLSS 库自己都察觉不到它已经不在英伟达的卡上了。 这套流程整个走下来步骤多到离谱,VideoCardz 的评价是,经过这么多层转换还能有这个性能,本身就很疯狂。
真正的硬骨头:DLSS 4 直接跑是错的
能翻译,不代表能算对。d4r 支持 DLSS 3 的 CNN 模型、DLSS 4 transformer 和 DLSS 4.5 transformer,但 DLSS 4 直接经 ZLUDA 运行时输出结果是错的,DLSS 检测到异常后干脆丢弃整个网络输出。开发者只能动手重写其中开销最大的内核,换成针对 RDNA3 架构手写的定制版本,这才把 DLSS 4 救了回来。 这个定制内核目前只为 gfx1101(Navi 32 核心)完整优化,覆盖四张卡,开发者实测的只有 RX 7700 XT。各核心的支持情况如下:
| 核心代号 | 对应显卡 | DLSS 3 | DLSS 4 | DLSS 4.5 |
|---|---|---|---|---|
| Navi 32(gfx1101) | RX 7700 / 7700 XT / 7800 XT / Pro W7700 | ✅ 全速 | ✅ 全速(定制内核) | ✅ 全速(定制内核) |
| Navi 31 | RX 7900 系列 | ✅ 全速 | ⚠️ 无变压器内核 | 🐢 约半速 |
| Navi 33 | RX 7600 系列 | ✅ 全速 | ⚠️ 无变压器内核 | 🐢 约半速 |
看明白这张表就知道,严格讲这是个 Navi 32 专属的 DLSS 补丁,算不上整个 RDNA3 都能用。
代价都写在数字里
RX 7700 XT 在 2K 分辨率下的实测数据:质量档,DLSS 3 CNN 的 E 预设 72.4 帧,DLSS 4 的 K 预设 69.4 帧,DLSS 4.5 的 M 预设只有 51.5 帧。DLSS 4 的开销基本固定在 2.8ms,因为它的网络按输出分辨率计算;DLSS 4.5 每帧要吃掉 7.5ms 的 GPU 时间,只有在 Ultra Performance 档才反超,94.5 帧对 88.9 帧。 更扎心的是,开发者实测的所有模式下,AMD 自家的 FSR 4 都比这套 DLSS 快。折腾一圈把英伟达的库搬进来,最快的还是苏妈自己的方案。
想上手,先过三道门槛
第一,目前只在 Linux 和 Proton 下能跑,Windows 玩家用不了。第二,DLSS 5 明确不支持,能用的只有 DLSS 3、DLSS 4 和 DLSS 4.5 三个模型。第三,全部数据来自开发者一人实测,还没有第三方复现,VideoCardz 也是转述他的投稿。按 VideoCardz 的猜测,后续可能有人把它移植成 OptiScaler 的插件,到那时才是普通玩家能直接装的版本。 最近几个月 mod 圈很热闹。有人给 RTX 20/30/40 系老卡解锁 DLSS 5 和帧生成,有人让 DLSS 5 在集成显卡甚至浏览器里跑起来,但那些折腾的都是英伟达自家的硬件。这次不一样,d4r 动的是 CUDA 兼容层,等于把英伟达最核心的软件护城河撬开了一条缝。CUDA 生态里躺着十几年的闭源 AI 库,理论上现在都有了一条搬进 A 卡的路。 你手里如果是 7800 XT,会为了一套 DLSS 折腾 Linux 环境吗?
本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。
