AREX Feed Article
Unsloth 为官方 Docker 镜像加入 GUI 与 AMD 支持,称可在本地训练和运行 500+ 模型
9 月 17 日,Unsloth 的官方 X 账号 ,用户现在可以用 Unsloth 的 Docker 镜像在本地训练和运行 500+ 模型;帖文称用户可以选择新的 GUI(图形界面)或 notebooks 两种工作流,「无需配置」(no setup required),并且支持 NVIDIA 和 AMD 硬件。帖文附了指向与 的短链,没有展开更多细节。
更具体的内容在链接指向的文档里。这个镜像实际有两份:NVIDIA 用 unsloth/unsloth,AMD 用 unsloth/unsloth-rocm。指南给出的一条 docker run 命令会同时开放 8000 端口(Unsloth Studio 网页界面)和 8888 端口(JupyterLab 编程环境);NVIDIA 镜像的 latest 标签把训练栈、网页界面和示例 notebooks 都装了进去。指南把这次变更标注为「2026 年 9 月新增:Unsloth Docker 容器现已更新,加入 Unsloth Studio 与 AMD」。以下细节来自 Unsloth 自己的帖文、指南、仓库说明和 ,属于发布方单方口径。
两个镜像、一条 docker run
指南的 NVIDIA 快速开始把几个动作压进一条命令:挂载当前项目目录到容器的 /workspace/host、挂载宿主机的 Hugging Face 缓存、为 Unsloth Studio 建一个命名卷、映射 8000 与 8888 端口,最后拉取并运行 unsloth/unsloth。官方还提供一个 run.sh 脚本,可以代为设定这些参数。宿主机这一侧仍有门槛:NVIDIA 驱动不低于 570.26;Linux 上要装 Docker 与 NVIDIA Container Toolkit(官方提供了一键安装脚本),Windows 上走 Docker Desktop 的 WSL 2 后端。
「无需配置」覆盖的是容器内部。Docker Hub 页面写明,镜像预装了 PyTorch 2.11 与 CUDA 12.8、Unsloth、bitsandbytes、TRL、PEFT 等训练栈,带 Unsloth notebooks 的 JupyterLab,以及预编译的 llama.cpp;latest 标签另有给 Studio 做语音转写的 whisper.cpp。镜像分两档:latest(或 studio)含网页界面、JupyterLab、notebooks 和只接受密钥登录的 SSH;core 只保留训练栈、JupyterLab 与 notebooks;此外还有按日重建的 nightly 版本,官方保留 60 天。Docker Hub 标注的体积是 NVIDIA 版 9.8 GB、AMD 版 7.8 GB;NVIDIA 版的 latest 与 core 都提供 amd64 和 arm64(GH200、DGX Spark)构建,预编译内核覆盖从 Turing 到 Blackwell 的架构,B300、GB300、GB10 需要 580 以上的驱动。没有 GPU 的机器也能启动 latest,可以聊天、用 GGUF(llama.cpp 使用的模型格式)工具和 notebooks,但训练不可用。
仓库首页列举的代表模型包括 Qwen3.8、GLM-5.3-Flash、Kimi K3、MiniMax-H3、DeepSeek-V4 和 Gemma 4,类型覆盖 LLM、扩散、嵌入与音频等模型。
GUI:Unsloth Studio 预装在容器里
指南把 Studio 描述为预装组件:在浏览器里和模型聊天、微调、生成图片,都在同一个容器内完成。聊天页能浏览推荐模型或搜索 Hugging Face;选 GGUF 模型时要按显存和内存挑量化版本,标着 OOM 的选项不要选。训练页选择模型和训练方法(指南截图里是 QLoRA),数据集可以从 Hugging Face 选或者上传本地文件,支持 CSV、JSONL、JSON、PARQUET、PDF、DOCX、TXT、MD;训练中能看训练损失(loss)与 GPU 占用,结束后点「Compare in Chat」对比原始模型与微调模型的回答。图片生成在 Images 页,指南用 Z-Image-Turbo 举例。
账号细节:打开 localhost:8000,用户名是 unsloth,初始密码打印在容器日志里;不改掉自动生成的密码,Studio 会在一小时后自动停止(默认启动超时 3,600 秒)。重置密码执行 docker exec unsloth unsloth studio reset-password --username unsloth,命令会同时注销已有会话并吊销 API key。下方截图里的模型列表从 Qwen3.8、GLM-5.3-Flash 排到 Gemma 4、gpt-oss 的 GGUF 版本,右侧标着参数量。
notebooks 在 8888 端口,示例按任务分组
JupyterLab 与示例 notebooks 同样装在镜像里。登录 localhost:8888 后,目录按模型与任务分组,指向容器内的 /workspace/unsloth-notebooks;每次启动容器会从 GitHub 刷新这些示例,但不会覆盖用户自己的修改。截图里从 01 Main Notebooks 排到 14 GPT OSS Notebooks,中间是 Gemma 4、GRPO 与强化学习、工具调用、TTS、视觉、嵌入、语音转文本、OCR、BERT、DeepSeek、ERNIE、GLM 等组。指南给的具体例程是 Gemma3_(4B)-Vision.ipynb,把方程图片微调成 LaTeX 输出;动手训练前要先卸载 Studio 里加载的模型,把显存让出来。
两个入口共用同一个 Hugging Face 缓存目录(/workspace/.cache/huggingface),指南说这样不会重复下载。训练产物默认留在容器内部,删掉容器就会丢;指南建议把 LoRA 适配器或合并后的 16 位模型保存到 /workspace/host,也就是宿主机挂载进来的目录,想上传 Hugging Face 则需要带写权限的 token。
端口默认对所有网络接口开放,没挂载的数据随容器一起消失
指南与 Docker Hub 页面还列出了一串需要用户自己处理的默认值。8000 与 8888 端口默认发布在所有网络接口上,Studio 与 JupyterLab 又都是明文 HTTP,官方因此提醒不要直接暴露到互联网,云主机上应绑定 127.0.0.1,或加 -e UNSLOTH_STUDIO_SECURE=1 让 Studio 只经 Cloudflare 的 HTTPS 链接提供服务。容器默认以 root 运行,core 镜像可以用 --user 指定用户;Studio 的服务器端工具默认可在容器内执行命令,JupyterLab 本身就是一个完整的 shell,指南提醒只挂载愿意交给容器访问的目录。传给容器的环境变量(包括 token 和密码)会出现在 docker inspect 里,能访问 Docker daemon 的人都能读到;SSH 默认关闭,设置公钥后才以 root、仅密钥方式在 22 端口开启。
数据保留取决于挂载:模型、项目文件与 Studio 的账号、聊天、导出和训练记录分别落在三个挂载点,docker rm 之后用同样的 -v 参数重建容器就能接着用,只有删掉 unsloth-studio 卷才会永久失去 Studio 数据。官方提醒这个卷要用命名卷而不是宿主机目录:Studio 需要符号链接,Windows 或 macOS 的宿主机目录可能不允许,容器会在启动时停下。停止容器时,Studio 会在下一步为正在进行的训练保存检查点再退出,但 Docker 默认只给 10 秒,官方建议用 docker stop -t 150 或在 Compose 里设置 stop_grace_period: 150s。
AMD:另一套镜像,官方材料互相矛盾
AMD 需要单独的 unsloth/unsloth-rocm。直通方式和 NVIDIA 不同:AMD 不需要容器工具包,而是把 /dev/kfd、/dev/dri 设备节点和 video、render 两个组的数字 ID 传给容器;ROCm 页面解释了原因:容器里没有宿主机的组名,传名字可能加错组,导致 /dev/kfd 不可读。页面还给了一个冒烟测试(smoke test)脚本,在 10 亿参数模型上跑 5 步 LoRA,GPU 不可用时会直接报错,而不是悄悄退回 CPU。
支持范围与性能数据来自 :该页写支持 RDNA2 及更新的架构与 CDNA(gfx1033 除外),Strix Halo、RDNA4 和 gfx906 等型号另有说明,需要显式指定架构或换用特定构建。页面上,Radeon 8060S(gfx1151,Strix Halo)在新镜像上的实测是:Llama 3.2 1B 做 4-bit QLoRA 五步,loss 从 2.8146 降到 1.2242;sd-turbo 文生图 4 步 512 像素用 118 秒、峰值显存 4.21 GB;文生视频 8 帧 256 像素用 279 秒、峰值显存 4.77 GB。同一 seed 下,扩散输出与 NVIDIA B200 上的结果精确到小数点后三位一致,但这类共用系统内存的集成 APU 比数据中心显卡慢约 25~50 倍;独立 RDNA2、RDNA4 与 CDNA 显卡不在这次测试范围内。
对这款镜像到底包含什么,Unsloth 自己的说法并不一致。ROCm 页面写得很直接:与 unsloth/unsloth 不同,本镜像不包含 Unsloth Studio 及其网页界面、JupyterLab、预编译的 llama.cpp 和 whisper.cpp,UI 目前仅限 CUDA;GitHub 仓库的说明与它一致,AMD 镜像只带训练栈,没有 Unsloth Studio 或 JupyterLab,且需要原生 Linux,因为 WSL 暴露的是 /dev/dxg,不是 ROCm 需要的 /dev/kfd。但安装指南的 AMD 段落写的是另一回事:它列出 8000(Unsloth Studio)与 8888(JupyterLab)两个端口,给出在 WSL2 里用 /dev/dxg 直通 GPU 的完整步骤,连支持的架构也写成 RDNA1 及更新,比 ROCm 页面多一代。
截至发稿,同一家公司的这三份材料口径并不一致:ROCm 镜像页与仓库说明把 GUI、notebooks 和 WSL2 排除在 AMD 之外,安装指南却把它们写进了 AMD 流程。