Unsloth:跑本地 DeepSeek-V4 的桌面应用
白物集整条内容管线的引擎,是一张 DeepSeek 模型。每天凌晨 8 点的早报、上午 9 点和下午 5 点的热点深度文章、9 点半的建站系列,走的都是同一条路:DeepSeek 生成 Markdown,转成 HTML,POST 到内容 API,再由 Astro 服务端渲染出来。我们跟模型的全部接触都隔着 API,模型本身长什么样、跑起来是什么状态,一直是个黑盒。
这一篇想聊的,是把这个黑盒搬到桌面上的那个工具——unsloth。
项目是什么
unsloth(unslothai/unsloth)是 GitHub 上 7.4 万 stars 的开源项目,Python 编写,8 月 24 日还在持续提交。它的定位很直接:第一个能「运行模型」和「训练模型」的桌面应用。注意,它不再只是给训练框架加加速补丁的老 unsloth,现在的形态是一套本地全家桶——Tauri 打包的桌面应用、Web 版 Studio、以及给开发者用的 Core 代码库。
支持的模型清单很务实:DeepSeek-V4、Qwen3.8、Kimi K3、MiniMax-H3、Gemma 4 这些大模型,加上扩散图像、视频、嵌入、音频模型。换句话说,白物集管线里那款我们每天都在 API 上调用的 DeepSeek,在 unsloth 里可以直接本地跑起来,而且能微调成自己的版本。
三个最惊艳的点
第一个,是「低显存微调」这件事被做成了常态。 LoRA 和 QLoRA 是它训练侧的主力,官方口径是训练速度快 2 倍、省 70% 显存、且精度不掉。这个数字对个人开发者很关键:它把「微调一张开源模型」从服务器级别的门槛,拉回到了消费级显卡的可接受范围。多数独立开发者没有 8 卡集群,省下七成显存,意味着单张消费级卡也能试一把 QLoRA,这件事两年前还属于实验室脚本的范畴。
第二个,是导出和接入的开放性。 微调完的模型可以直接导出 GGUF、FP8、NVFP4 这些格式,还能通过一个 OpenAI 兼容的 API 接口挂出去。这意味着你本地微调的模型,能无缝顶替掉现在这个环境里所有走 API 的调用点——接口协议不变,背后换成你自己的模型。对已经习惯在 API 协议上做工程的人来说,这是最省心的一种「替换」。
第三个,是它开始把「本地模型」和「编码智能体」串起来了。 支持用 Claude Code、Codex 这类编码智能体直接接本地模型,通过 Cloudflare 加密的 HTTPS 实现远程访问。这一层把本地模型从「跑个演示」抬升成了「能进真实工作流」的组件。数据不用出本机,模型却能进到编码、检索、深度研究这些日常任务里。
白物集实际怎么用到的
诚实地说,白物集目前走的是 API,没做本地微调。但 unsloth 跟我们有一个真实的连接点:
白物集是 DeepSeek 的「重度消费者」,却不是「本地持有者」。内容管线每天产出多篇文章,全部由模型生成,经过「采集知识卡片 → 热点聚类 → 生成深度文章 → Markdown 转 HTML → POST 入库 → Astro SSR 展示」这条路,数据落在 Supabase,页面由服务端渲染。这一整套我们熟得要命,几乎每天在每个环节上打磨。
缺的恰恰是底层那层——模型本身。如果哪天想在本地、离线、或者用私有语料微调一张专属的 DeepSeek,unsloth 就是那个入口。它把「持有模型」这件事从云端搬回桌面,正好补上白物集「消费模型」之外的另一半。这也是它最打动人的地方:不是帮你多跑一个 demo,而是把你作为模型使用者,变成一个模型的主人。
一点权衡
本地化不是免费的。跑模型要硬件,维护要精力,模型升级要自己跟上。对白物集这种「内容管线为重」的场景,API 的省心程度无可替代——不用管显卡、不用管推理服务、不用管模型换代。所以更现实的用法不是「用本地替换 API」,而是「用本地补 API 做不到的事」:私有数据微调、离线环境、数据不出本机、以及把低频但敏感的任务交给本地模型。两者各司其职,比单押一边更健康。
适合什么、不适合什么
适合: 想离线跑模型的人;手上有私有数据、要微调专属模型的人;显存吃紧、想靠 QLoRA 省 70% 显存的人;以及想把本地模型接进编码工作流、做 AI 应用兜底的独立开发者。
不适合: 没有数据敏感需求、纯靠 API 就行的人——API 更省事,别为了本地化而本地化;没有像样显卡、只是图个新鲜的人;以及必须追最新前沿模型的人——本地模型版本天然滞后于 API 上新。本地化不是目的,能实实在在把手里的卡和模型用起来才是。
快速上手
三步能跑起来,五步能微调:
- 装。 下载官方 Desktop 应用(macOS 是 dmg,Windows 是 exe,Linux 是 deb 或 AppImage),或者一行脚本:
curl -fsSL https://unsloth.ai/install.sh | sh - 选模型。 在 Studio 里挑一张,比如 DeepSeek-V4、Qwen3.8、Gemma 4。Studio 支持 Windows、Linux、macOS,macOS 上训练、MLX、GGUF 推理都可用。
- 跑起来。 选好 CPU、CUDA、ROCm、Vulkan 后端,直接对话;或用 Data Recipes 从 PDF、CSV、DOCX 建数据集。后端可以在 Settings 里切,安装时也可用环境变量固定。
- 微调。 选 LoRA 或 QLoRA,喂自己的数据,享受 2 倍速度和 70% 的显存减负。支持强化学习、GRPO、DPO、FP8 这些训练路线。
- 接出去。 导出 GGUF,或通过 OpenAI 兼容 API、
unsloth start codex挂到你的编码智能体上,远程访问还能走 Cloudflare 加密 HTTPS。
对一个每天都在消费 DeepSeek 的团队来说,unsloth 最有价值的不是「跑一个模型」,而是「把模型的主动权拿回自己手里」。下一篇,聊聊本地模型和 API 模型各自该放在管线里的哪一格。