现在有一位开发者, 他让使用AMD牌子的显卡去跑那个叫DLSS 4.5的东西, 这是英伟达家的技术。
这一件事情本身来说的话, 它就不是特别符合规定的一个状态或者叫做合规的状态, 但是它这样做出来的结果呢, 是戳到了那个GPU人工智能加速生态长期以来都非常封闭的一个痛点问题, 同时它也预示着一种跨平台的那种推理的玩法正在被打破的这个趋势。
不搬源码的野路子
d4r这个项目是由开发者countervolts来维护的。在10月3日推送的那个0.1.2版本里面, 并没有把英伟达DLSS的源代码移植过来。它是通过Linux环境以及Proton环境, 直接去调用官方的nvngx_dlss.dll文件。
接着会利用ZLUDA这个兼容层, 然后把CUDA指令一条条地翻译成为AMD GPU能够执行的代码。这样一来, 整个过程就绕过了那些闭源的限制。
这次更新的一个核心突破是, 它对FP8进行了原生支持。RDNA 4架构在硬件层面上可以直接执行矩阵运算, 而且这些运算是基于FP8这个精度的。DLSS 4和4.5这两个模型恰好需要大量使用这种精度数据。
在新版本里面, 软件就不像以前旧版那样, 必须先将FP8转换为FP16然后再进行计算。这么做的结果是, 省掉了因为中间进行的精度转换所带来的额外性能开销。
覆盖哪些显卡
0.在1.2这个版本里面, 新增了专门针对gfx1201这种架构的原生的DLSS 4以及DLSS 4.5的计算内核。在硬件的覆盖范围方面, 包括了RX 9070 XT这几款产品, 还有RX 9070, 以及RX 9070 GRE, 再加上Radeon AI PRO R9700。
新版将默认启用NativeFp8选项。用户手动关闭后, 回退到16位数学运算路径。这意味着如果当前驱动或显存对FP8支持不完善, 可以降级以避免报错。给不同配置的用户留了缓冲余地。
实测帧率差距
开发者所公布的这些性能基准数据, 原本其实是来自于上一代的那一款名为RX 7700 XT的硬件产品。在涉及到的《寂静岭: 小镇陷落》这款游戏当中, 我们选取的是2560×1440这样一个分辨率档位, 同时将图像质量预设条件锁定在Quality这一级别状态下。
在这种特定的测试环境里, 开启DLSS 4.5功能之后的平均帧率数值, 从前一阶段即0.1.1版本时所记录下的48.4 FPS水平上, 获得了提升, 最终达到了现在的49.3 FPS这样的高一点点的数值。
至于另一组对比数据即关于DLSS 4的表现情况, 其帧率数值则仅仅是从原来的67.9出现了一点极其微小的增加, 变成了如今的68.1这样一个非常接近的数字。由此可见, 整体层面的实际性能提升幅度可以说是相当有限的, 并没有带来明显的感知差异。
拿作参照来看, 把场景保持一样的情况下, AMD官方出的那个FSR 4.1.1B的帧率, 大约在140到150 FPS之间, 原生DLSS 4.5大概是在130 FPS左右, d4r这个方案, 到现在为止, 还存在着大概三成的性能差距, 短时间之内, 很难追上官方弄出来的那些实现效果, 画质表现这块儿, 目前也没有拿得出完整的比对报告来。
尚未落地的风险
开发者给出了明确的提示, 说明当前gfx1201的路径仅仅是通过仿真器进行了验证工作, 而gfx1200的架构仅仅完成了编译这一过程, 这两种情况都没有在实体RX 9000显卡上进行通盘的完整性能测试以及画质方面的测试, 因此实际游戏表现会存在较大的不确定性。
在功能层面这一点上, d4r当前仅仅实现了超分辨率这一项功能, 而像帧生成、光线重建以及DLSS 5这一类叫做神经渲染的技术手段, 全都处于不被支持的范围之内, 因此, 对于想要完整地去体验英伟达AI加速套件这种情况, 如果是在AMD平台之上进行的操作的话, 就仍然属于不现实的状态。
普通用户该选谁
对于绝大多数RX 9000用户而言, 坚持使用AMD官方FSR 4仍然是当下最为务实并且也最为直接的选择。这是因为d4r存在着帧率方面的损失, 同时还伴随着部分功能上的缺失,这样的特点意味着它只适合极少数极客以及研究人员把它当作一种把玩的东西, 而绝对不适合作为日常的生产力工具来使用。
但是d4r的这个推进, 给整个行业释放出了一个特别清楚的信号。这就是说, RDNA 4本身带有的FP8能力, 正在让AMD这个显卡变成跨平台上面跑AI模型的新的主要地方。
如果想要查看那些相关的技术讨论内容、固件更新的日志记录, 还有社区的反馈信息的话, 大家可以去www.ynsdxgs.cn这个地方去看一下, 这样就能很方便地跟踪到该项目后面迭代的节奏情况了。
打破封闭生态的长期意义
英伟达的DLSS生态已经运行了很多年, 其模型权重和计算内核长期锁定在自家GPU上, 开源社区用兼容层硬闯的方式虽然粗糙, 却撕开了一道口子, 迫使下游厂商开始正视跨平台AI推理的现实需求。
假如说以后的时候 D4R 能把那个帧生成还有光线重建的功能都给弄齐全了, 并且还能拿到实体 RX 9000 的那个完整的基准数据, 那么 AMD 平台在 AI 加速这个领域里面, 被当作是“二等公民”的那种标签, 可能就能被真正地给它撕下来了。
AMD显卡使用DLSS这件事, 你认为是“曲线救国”这种做法吗? 还是说这种操作其实是违背了根本目的、抓错了重点的做法? 请你到评论区这个地方来谈谈你自己真实存在的看法。如果你觉得这个帖子内容对你来说是有帮助的, 那么请不要忘记给它点个赞, 顺便把它转发分享出去一下。




