AREX Feed Article
Unsloth 上线 Qwen3.8-27B 免费微调 Notebook:24GB 显存本地训练,宣称快 1.5 倍、省 50% 显存
UTC 时间 8 月 25 日 14 时 20 分(北京时间 22 时 20 分),(@UnslothAI)宣布,其 Notebook 现在可以免费微调 Qwen3.8-27B:本地训练只需要 24GB 显存,官方称训练速度快约 1.5 倍、显存占用减少约 50%。推文附上了 和 两个链接。
24GB 正好是一块 RTX 3090 的显存容量。单卡用户可以据此在本地微调一个 27B 参数的视觉语言模型,也可以完全不碰自己的显卡,改用指南页提供的 Kaggle Notebook,那里附赠 30 小时、2×Tesla T4 的免费 GPU 额度。"快 1.5 倍、省 50% 显存"目前是 Unsloth 的自述口径。
免费 Notebook 上线:27B 微调门槛压到 24GB 显存
写明,Qwen3.8-27B 是 dense 27B 统一视觉语言模型,原生支持文本、图像和视频输入,带思考控制,上下文窗口 262K。免费路径有两条:Conversational Notebook 可开启视觉微调,RL GRPO Notebook 走强化学习路线,两者都跑在 Kaggle 上;其中 GRPO 笔记本目前以 Muse Glimmer (30B) 为模板,需要自行把模型换成 Qwen3.8。
指南页的说明框写道,Kaggle 提供 30 小时免费 GPU 用量,每次 2×Tesla T4;Kaggle 是 Google 的产品,类似 Google Colab。微调产物可以导出为 NVFP4、FP8、GGUF 等格式,也可以合并回 16 位权重部署到 vLLM。发布约两小时后,这条推文已获得 625 次点赞、67 次转发、362 次收藏和约 2.27 万次浏览(发稿时快照)。
7.46 万 star 的本地训练工具,盯上了 Qwen 新家族
Unsloth 以"本地跑模型、本地训模型"为卖点。建于 2023 年 11 月,目前 7.46 万 star、Apache 2.0 许可,自我定位是"本地运行和训练 LLM 与扩散模型的桌面应用",支持 Windows、macOS、Linux,以及 NVIDIA、AMD、Intel 和 CPU。仓库 README 的通用口径是微调"快 2 倍、省 70% 显存、无精度损失"。
(@danielhanchen,仓库头号贡献者,简介自称 YC S24、前 NVIDIA ML 工程师)在转发中补充:只需一个 Google 账号就能完全免费微调 Qwen3.8-27B,用 QLoRA 和 Unsloth 的 kernels,27B 模型可以装进 24GB 显存,无精度损失。
按 ,Qwen3.8 家族包含 27B、2.4T-A95B 和 Max 三个型号;27B 具备视觉与推理能力,4-bit 量化推理只需 16 到 19GB 显存(如 RTX 5080、RTX 4090)。推理门槛不到 20GB,微调门槛定在 24GB,这次发布补的正是中间这段落差。
24GB 对应 QLoRA:LoRA 要 36GB 以上,全参微调再翻四倍
把 24GB 的适用范围写得很细:QLoRA 微调可在 24GB 显存内完成,普通 LoRA 需要 36GB 以上,全参数微调(FFT)的显存占用再乘 4 倍。官方推荐 4-bit 量化基座 Qwen3.8-27B-unsloth-bnb-4bit 加 LoRA 适配器的路径,训练依赖 Unsloth 的 Flash Linear Attention kernels;Qwen3.8 使用 qwen3_5 架构,需要 Transformers v5,首次运行要等 Gated DeltaNet kernels 编译。显存不够时,可以开启 offload_embedding 把词嵌入放到内存,或缩短 max_seq_length、把 batch size 设为 1。
社区也注意到了这行小字。创业者 David Hendrickson(@TeksEdge,自称 CEO、PhD)在时提醒:"24GB 路径是 QLoRA,不是全参微调;4-bit 基座权重基本冻结,训练的是轻量 LoRA 适配器。"AI 资讯博主 Josh(@JustJorshin)在里给出同样的拆解:QLoRA 实际约 22GB,LoRA 要 36GB 以上,全参微调是它的 4 倍,"而且 262K 上下文下,KV cache 会先于权重吃满一张 4090"。
"快 1.5 倍、省 50% 显存":Unsloth 自述,对照基线是 FA2
推文里"1.5x faster with 50% less VRAM"的表述,在有更完整的版本:比 FA2(FlashAttention 2)方案快约 1.5 倍、省约 50% 显存,且无精度损失。对照对象是 FA2 训练方案,"无精度损失"的说法同样出自指南页自述。仓库 README 的免费笔记本清单里,对 Gemma 4、Qwen3.5、gpt-oss 等模型也标注了同类提速与省显存数字。
开发者想看的是疗效。印度开发者 Ankit Agarwal(@kumarumt)在里写道:"24GB 免费 Notebook 是 27B 不再是实验室玩具的原因;快 1.5 倍、省 50% 显存,只有在你真能在 4090 上不靠 offload 跑完才有意义。把 Notebook 拿出来,别只写博客。"
3090 用户排队开跑,也有人追问 24GB 的适用范围
回复区最先沸腾的是单卡用户。个人开发者 Jeheskiel Sunloy(@LumbeePrincess8)说;西班牙 AI 社区账号 Buswe 总结,;NousResearch 社区成员 witcheer 只回了一句:"that's HUGE"。开发者"实践哥 MinLi"(@MinLiBuilds):"干得漂亮,值得尝试。"回复区里,不少用户同时 @ 了 @UnslothAI 和 Qwen 官方账号 @Alibaba_Qwen。
讨论里也有没被回答的问题。开发者 Rimas(@RimasXYZ)在发布约 50 分钟后:"24GB 对全参微调也成立,还是只针对 LoRA?"指南页能确认的边界是:QLoRA 24GB、LoRA 36GB 以上、全参微调再翻四倍。"快 1.5 倍、省 50% 显存"仍是 Unsloth 的声明,能否在真实 3090 上兑现,要看社区跑出的第一批复现结果。
参考链接