9月15日消息,独立开发者Speedstu近日开源了名为“CUDA-for-AMD-Windows”的项目,在Windows上实现了AMD显卡运行CUDA专属工作负载,无需借助虚拟机或双系统。
实测环节该项目在RX 9060 XT上成功训练了一个220万参数的PPO强化学习网络,全程使用未经修改的CUDA库。
这个项目是一套高度自动化的PowerShell脚本,将ZLUDA翻译层与AMD原生的HIP/ROCm SDK for Windows对接。
脚本会自动检测GPU架构,拉取特定版本的ZLUDA(v6-preview.69),映射到Windows上已有的ROCm数学库。开发者成功拦截并映射了CUDA驱动API以及cuBLAS、cuSPARSE、cuFFT三个核心库,直接转接到AMD的等效实现上。
AMD近期通过ROCm更新为Windows消费级GPU带来了正式的PyTorch和HIP SDK支持,RX 7000和RX 9000系列全面覆盖。
但大量专有应用、老旧代码库和专用AI工具仍然只认CUDA,AMD用户想跑这些工具只能靠WSL2穿透或等原作者写HIP移植版,这个项目就是填这个空,相当于给只认NVIDIA的软件装了一个转接头。
基准测试显示,在RX 9060 XT上跑220万参数强化学习工作负载,走官方ZLUDA加AMD HIP SDK 6.4的路径,吞吐量中位数13278 steps/秒;走从旧版ZLUDA二进制文件中 salvaged 出来的自定义覆盖层,12876 steps/秒,慢约3%。
开发者也坦言,后续重写去掉LibTorch/ZLUDA后吞吐量大幅提升,说明这层翻译栈仍有性能损耗。
不过现在还远不到CUDA护城河被填平的时候,关键AI库cuDNN、TensorRT和NCCL目前均无法解析,如果工具重度依赖cuDNN,这套方案就会直接失效。
但这个项目证明了一件事:在AMD显卡上跑CUDA专属软件的障碍不是硬件层面的硬伤,而是可以解决的翻译工具问题,项目完全开源,社区贡献有望扩展更多硬件支持和CUDA库兼容。
