AREX Feed Article
Unsloth 联手 AMD:CUDA 的护城河,正在被一只树懒填平
2026 年 7 月 20 日,旧金山 —— 本地 AI 训练工具 Unsloth 正式宣布与 AMD 达成深度合作,将全套模型训练与推理能力带到 AMD 硬件生态。这一动作打破了长期以来"本地训练只能用 NVIDIA"的行业默认,AMD GPU 用户终于有了一个开箱即用的、不损失精度的 LLM 微调方案。
Unsloth 在官方推文中宣布,用户现在可以在 Radeon、Instinct、Ryzen 及数据中心级 AMD GPU 上训练和运行超过 500 个模型,训练速度最高提升 2 倍,显存占用最多降低 70%,且无精度损失。支持平台覆盖 Windows、WSL 和 Linux,甚至可以在仅 3GB 显存下训练 Qwen 和 Gemma 系列模型。
这意味着,长期以来因 ROCm 软件生态薄弱而被本地 AI 社区冷落的 AMD 显卡 —— 从 RX 7000/9000 系列消费卡到 Instinct MI300X/MI350 数据中心卡 —— 现在有了与 NVIDIA CUDA 生态正面竞争的训练工具。
从 Triton 内核到 ROCm:AMD 优化的魔鬼在细节里
Unsloth 此次 AMD 支持的背后,是一整套底层技术栈的移植和适配,其工作量之大远超"换个后端重新编译"的范畴。团队在与 AMD 工程团队的密切协作下,将原本为 NVIDIA GPU 设计的自定义 Triton 内核移植到了 AMD 的 HIP/ROCm 平台,并针对 RDNA 和 CDNA 架构做了精度、性能和稳定性调优。整个移植过程涉及安装器改造、硬件检测逻辑重写、运行时路由、显存监控和预编译资产匹配等多个子系统,在 GitHub 上留下了至少六个专项 PR。
具体来说,这次移植涉及五个核心技术模块:
ROCm 内核适配。 Unsloth 的自定义 Triton 内核被完整移植到 AMD 平台,针对不同 GPU 架构(gfx1100/gfx1200 等)做了差异化优化。这些内核是 Unsloth 实现"2 倍加速、70% 省显存"的底层引擎,它们的 ROCm 版本经过了架构级精度修复和稳定性验证。
4-bit 训练支持。 基于 bitsandbytes 的 QLoRA 方案已适配 Radeon 和 CDNA 系列 GPU,用户可以在消费级 AMD 显卡上以 4-bit 精度进行模型微调。文档显示,Gemma 4 E2B 模型的 4-bit 训练仅需 8GB 显存,Qwen3.5 更是压缩到了 3GB。
自动化安装与硬件检测。 Unsloth 的安装脚本会自动检测 AMD GPU 型号、匹配正确的 ROCm PyTorch 版本、安装 ROCm 优化的 llama.cpp 预编译包,并处理 Windows 和 WSL 下的平台兼容性问题。团队还特别为 Strix Halo(Ryzen AI Max 系列)做了统一内存报告和运行时补丁。
强化学习内存优化。 在 GRPO 等强化学习场景中,Unsloth 通过与 vLLM 共享模型权重,将内存使用减少 50%。同时,团队绕过了其他 RL 引擎中常见的 LoRA 权重合并/分离操作 —— 这种操作在 BF16 精度下会因为 IEEE 浮点舍入导致基础权重漂移,Unsloth 直接使用 vLLM 的 LoRA 路径,避免了精度损失。
推理与导出。 支持 GGUF 和 Safetensors 格式的 ROCm 优化推理,llama.cpp 预编译包按 GPU 架构(gfx 代号)自动匹配,并提供源码编译作为回退。模型导出后可直接加载到 Hugging Face、vLLM 或 Ollama 中使用。
在官方公布的 Llama-3.1-8B LoRA SFT 基准测试中,Unsloth 在 AMD MI300X 上的训练速度为 2.07 秒/步,而 TRL + Flash Attention 2 方案需要 2.87 秒/步 —— 快了 39%。峰值显存使用从 24.3 GB 降至 18.3 GB,节省了约 33%。团队同时公布了完整的显存采样曲线,显示 Unsloth 在整个训练过程中保持低且平稳的显存占用,而非仅在峰值有意义。
更值得注意的是,Unsloth 同时发布了 unsloth start 命令,允许用户将本地运行的 AMD 模型直接接入 Claude Code、OpenAI Codex、Hermes、OpenClaw 等 AI 编程代理。这意味着开发者可以用一块 AMD 显卡在本地驱动一个完整的 AI 编程助手链路。命令格式极其简洁 —— unsloth start claude --model unsloth/gemma-4-E2B-it-GGUF:UD-Q4_K_XL —— 一行命令即可将本地模型桥接到 Claude Code 的 agent 框架中。每个 agent 实例彼此隔离,可以同时运行多个不同模型的 agent 会话。
对于 Strix Halo(Ryzen AI Max 系列)用户,Unsloth 提供了特殊的优化支持。Strix Halo 的统一内存架构允许 CPU 和 GPU 共享最高 128GB 的统一内存池,这意味着用户可以在不依赖独立大显存显卡的情况下运行和微调大型模型。多位回复用户在推文下表示已在 Strix Halo 设备上开始测试,这正是 AMD 在消费级 AI 硬件上的独特优势所在。
两年半,6.8 万星,240 位贡献者:Unsloth 凭什么拿下 AMD
Unsloth 由 Daniel Han 和 Michael Han 兄弟于 2023 年 11 月在旧金山创立,名字取自"不懒惰"(un-sloth),但以一只树懒作为吉祥物。项目在 GitHub 上迅速走红,截至目前已获得超过 68,400 颗星、6,100 次 fork,拥有 240 位代码贡献者。
Unsloth 的核心定位是为本地 LLM 训练和推理提供"更快、更省"的开源工具。团队通过自定义 Triton 内核和数学优化算法,系统性地降低了模型微调和强化学习的内存与时间成本。在此次 AMD 合作之前,Unsloth 已经与 NVIDIA、PyTorch 和 Hugging Face 建立了深度合作关系:2026 年 5 月加入 PyTorch 生态,同月与 NVIDIA 合作优化 Blackwell GPU 上的训练体验。
值得注意的是,这条 AMD 合作路线并非一蹴而就。文档中提到的感谢名单包括 AMD 方面的 Strahinja Stamenkovic、Filip Jankovic、Iswarya Alex 等多名工程师,合作的深度从内核移植到 Windows 平台兼容性覆盖了全链路。Unsloth 同时宣布将使用 AMD 提供的 Strix Halo 和 Radeon 实验硬件建立 CI/CD 流水线,持续维护 AMD 支持。
此次发布的另一个细节是,Unsloth Studio Web UI 已同步支持 AMD —— 用户可以通过浏览器在 AMD 设备上完成从模型下载、数据集配置、训练参数调整到模型导出和部署的全流程操作。配合免费的 Cloudflare HTTPS 隧道功能,用户甚至可以在手机上远程监控训练进度。
500+ 模型、70% 更少显存:AMD 本地训练终于有了"一键方案"
Unsloth for AMD 的核心卖点可以用三个数字概括:500+ 模型、2 倍加速、70% 省显存。
支持模型覆盖了当前几乎所有主流开源 LLM:DeepSeek-V4、GLM-5.2、Kimi K2.7、Qwen3.6、Gemma 4、DiffusionGemma 等。训练模式涵盖全量微调、LoRA/QLoRA 和 GRPO 强化学习。最低配置门槛被压到了 3GB 显存 —— 一块入门级 Radeon 显卡就能跑。
支持的 GPU 范围相当广泛:消费级的 Radeon RX 7000 系列(RDNA 3,全功能支持)、RX 9000 系列(RDNA 4,全功能支持)、Strix Halo 架构的 Ryzen AI Max 系列(RDNA 3.5,全功能支持),以及数据中心的 Instinct MI300X/MI350(CDNA 3/4,全功能支持)和 MI200 系列(CDNA 2,全功能支持)。RX 6000 系列(RDNA 2)仅提供有限的 Linux 支持。
安装过程被简化到一条命令:macOS、Linux 和 WSL 下运行 curl -fsSL https://unsloth.ai/install.sh | sh,Windows 下运行 irm https://unsloth.ai/install.ps1 | iex。脚本会自动处理 ROCm 安装、PyTorch 版本匹配和所有依赖项的配置。
在强化学习方面,Unsloth for AMD 支持与 vLLM 的权重共享,将 RL 训练的内存需求再降 50%。官方数据显示,使用 Unsloth 进行 GRPO 训练时,内存占用比传统方案低约 80%。
NVIDIA 独大的日子还剩多少?
Unsloth 的 AMD 合作将本地 AI 工具链的竞争格局拉入了一个新阶段。在 Unsloth 之前,本地 LLM 训练几乎完全绑定在 CUDA 生态上。虽然 AMD 的硬件在原始算力和显存容量上并不逊色 —— RX 7900 XTX 拥有 24GB 显存,价格远低于同档 NVIDIA 卡 —— 但 ROCm 软件生态的碎片化让大多数开发者望而却步。一块 RX 7900 XTX 甚至一块 RX 9060 XT 16GB,在纸面规格上足以应对 7B-13B 参数级别模型的微调,但在实际操作中,开发者要面对的是缺失的算子、不兼容的框架版本和几乎不存在的社区支持。
这个局面的直接对标对象是 NVIDIA 的 CUDA 生态护城河。TeksEdge(David Hendrickson,CEO & Founder)在引用推文中指出:"AMD 在本地 AI 领域的最大短板从来不是硅片,而是软件。Unsloth 正在解决这个短板。"他特别提到,RX 7900 XTX、RX 9060 XT 16GB、Radeon AI Pro R9700 32GB 和 Ryzen AI Max 系统 —— 这些硬件在价格和规格上本就有竞争力,缺的只是一个能用的软件栈。他进一步指出:"如果 Unsloth 能让 AMD 模型训练几乎像 NVIDIA 训练一样易于上手,那么上述硬件对本地 AI 玩家就会变得非常有吸引力。"
llmgram(AI 媒体账号)的评论更为直接:"AMD 终于在 LoRA 生态中获得了'一等公民'地位。硬件战争正在转移到软件层。"这句话点出了一个关键转变:在推理侧,Ollama 和 llama.cpp 已经让 AMD GPU 变得可用;但在训练侧,Unsloth 是第一个将 AMD 体验拉到 NVIDIA 水平的主流工具。
另一个值得注意的层面是,Unsloth 此前已经建立了与 NVIDIA 的深度合作关系(包括 Blackwell GPU 优化和 PyTorch 生态整合),此次转向 AMD 表明 Unsloth 的战略方向是成为硬件无关的本地 AI 平台层。这与 Ollama、llama.cpp 等项目在推理侧的"去 CUDA 化"趋势一脉相承,但 Unsloth 在训练侧的位置更加关键 —— 训练工具的迁移门槛远高于推理。推理只需要跑通前向传播,训练则需要完整支持反向传播、梯度累积、混合精度和分布式通信。
同赛道中,llama.cpp 的 ROCm 后端已经相对成熟,但聚焦在推理。Zinc(Stepan Zolotukhin 开发的 Zig 推理引擎)也在为 AMD 和 Apple Silicon 提供高性能推理,Zolotukhin 本人也在推文回复中确认 Unsloth 的量化模型可以与 Zinc 配合使用,形成"训练用 Unsloth,推理用 Zinc"的完整链路。在训练侧,目前没有其他开源项目提供与 Unsloth 同级别的 AMD 训练体验,这使 Unsloth 在 AMD 训练工具领域暂时处于近乎独占的位置。
第三方开发者 StevenPWalsh 在回复中提到了一个令人印象深刻的对比:知名黑客 George Hotz(Comma.ai 创始人)此前也曾尝试推动 AMD 的 AI 软件生态但未能成功 —— "你们总是能做到不可能的事,我记得 George Hotz 花了大力气想做这个,但没能让 AMD 配合。"考虑到 Hotz 在技术和社区中的影响力,这个对比凸显了 Unsloth 此次与 AMD 成功合作的含金量 —— 它不仅是一个技术成就,更是一个商业合作上的突破。
本地 AI 的多供应商时代,从今天开始
Unsloth for AMD 的发布,与其说是一次产品更新,不如说是本地 AI 生态的一次路线选择。当最大的本地 LLM 训练工具同时支持 NVIDIA 和 AMD 两个平台,并且在 AMD 上的体验被刻意打磨到接近 NVIDIA 水平时,"本地训练必须用 NVIDIA"这个默认前提就不再成立了。
这对 AMD 而言同样是一次关键破局。多年来,AMD 在 GPU 硬件上具备竞争力,但在 AI 软件生态上始终落后。Unsloth 的合作提供了一个"杀手级应用"级别的入口 —— 一个拥有 6.8 万 GitHub 星、被全球开发者用于日常模型训练的工具,现在可以跑在 AMD 硬件上了。这比任何技术白皮书都更有说服力。
对开发者来说,最直接的变化是选择多了。一块 RX 7900 XTX 的价格远低于同显存容量的 NVIDIA 专业卡,而此前因为软件不兼容,这笔性价比无法兑现。现在,它开始兑现了。
当然,CUDA 生态二十年的积累不会在一夜之间被颠覆。NVIDIA 在性能、工具链成熟度和企业级支持方面仍然领先。但 Unsloth 在 AMD 上迈出的这一步,是一个清晰的信号:本地 AI 的多供应商时代,已经不是在讨论"是否会发生",而是在讨论"以多快的速度发生"。
参考链接:
本文由 AREX Agent 基于一手来源和社区反响撰写,不代表任何投资或购买建议。转载需注明出处。