• 正文
  • 相关推荐
申请入驻 产业图谱

Mac M5 32G实测Qwen3.8 27B!用Unsloth Desktop本地部署踩坑全记录

09/29 09:55
1274
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

各位小伙伴们大家好,我是 cxuan。

上次写过一篇 Qwen3.8 27B 的教程,但我还没有本地跑。

今天就把 Qwen 3.8 27B 本地实际的跑一下。先说下机器,Mac M5 ,32 G,10 x 10 CPU/GPU。

我是直接用的 Unsloth Desktop 。直接去官网 unsloth.ai 上下载即可。

官方提供 Mac 、Windows 和 Linux 版本。

下载完成后直接安装。

也可以使用 CLI 的方式进行安装

Mac、Linux 和 WSL 打开终端:

curl -fsSL https://unsloth.ai/install.sh | sh
unsloth studio -p 8888

Windows 用 PowerShell:

irm https://unsloth.ai/install.ps1 | iex
unsloth studio -p 8888

然后在浏览器打开:

http://127.0.0.1:8888

安装完成后直接进入 Unsloth 主页,感觉这个主页看起来跟大多数 Coding Agent 长得差不多。

点开左侧的 Model hub ,你会发现这里有非常多量化版本的本地模型可以跑。

除了 Qwen3.8 27B 之外,你会发现还有最新 Qwen 的新图片模型 Qwen-Image 2.1 ,还有 GLM-5.3 和 GLM-5.3 Flash 。

然后你会发现很多模型都加了一个 GGUF 后缀。

GGUF 可以理解成一种装模型的文件格式,里面放着模型参数和加载它需要的信息。像 llama.cpp 这样的本地推理工具,就能读取这种文件。

我们这次下载的,就是别人已经转换好的 GGUF 文件,交给 Unsloth 加载即可。

后面那些 Q3、Q4、Q8,才是在说量化精度。GGUF 是文件格式,量化是让模型占用更小的一种处理方式。 同一个模型可以有好几个量化版本,下面就要根据自己电脑的内存来选。

除此之外,你会发现 Unsloth 上面会把你的机器硬件直接列出来了。

我们可以搜索 Qwen3.8-27B-GGUF 来找到对应的模型。

下拉你会发现 Qwen 3.8 27B 有非常多的量化版本。

这里直接给大家一张量化版本配置表,直接选择对应的量化版本即可。

这里的总内存,是系统 RAM 加显存,或者 Mac 的统一内存。

量化版本 建议总内存 怎么选
2-bit 11~13GB 能跑,质量损失更明显
3-bit 13~16GB 16GB 机器从这里开始
4-bit 17~19GB 24GB 机器优先选它
6-bit 24GB 需要给系统和上下文继续留空间
8-bit 31GB 48GB 以上更合适
BF16 56GB 原始精度,工作站路线

我第一开始不太理解量化是啥意思,没关系,你只要记住一句话就行了:位数越低,占用越小,质量损失通常也越明显。

• 16GB 机器,选 UD-Q3_K_XL,文件大约 13.4GB。

• 24GB 机器,选 UD-Q4_K_XL,文件大约 17.9GB。

• 32GB 机器,还是建议先跑 Q4,把空间留给系统和上下文。

• 48GB~64GB 机器,可以考虑 UD-Q8_K_XL,文件大约 31.5GB。

另外,在 Unsloth 上面,你可以使用的模型和无法跑起来的模型,它们都做了提示。

像是我这台 Mac ,配置最高能跑到 UD-Q6_K_XL,但是不建议 Q6 ,因为如果长期使用的话,需要考虑给系统、其他应用和上下文留有足够的空间。

这么看来 ,32 G 也就是个裸机中的裸机,想本地玩至少 64G 起。

下面我们实际下载一下。

下载完了实际跑一下。

实际跑起来了,然后需要 load Qwen 3.8 27B ,这里加载的时候有个配置问题得说一下。

这里最容易踩坑的其实就是两个参数:上下文长度和思考设置。

针对不同的配置,我绘制了一张图,来说一下我的建议。

24G ,32G,36 G 统一直接 Q4 了,48G 再上 Q6 。像我这台 32G 的机器,初始上下文先老老实实设成 8192。

针对日常使用的不同场景,这里我也给大家提供一份配置说明。

平时聊天、改文案,把「思考」直接关掉或者调成 low 就够了;改代码再开 medium。

OK,下面来做第一轮测试,看一下 token 的吐露情况。

大概有 11 tok/s,然而我现在的内存基本上已经快拉满了。

这一轮的回复很短,不太能够说明问题,下面我们让 Qwen 3.8 27B 画个鹈鹕试试。

任务执行过程中风扇一直狂转,看了下活动监视器,果然内存直接拉满了。

查了一下,我这台 M5 用的是统一内存。CPU 和 GPU 共用这 32GB,模型交给 GPU 来跑。下载的模型有十几 GB,运行时还要给对话缓存、计算过程留空间。再加上 macOS 和其他软件,32GB 很快就用完了。

实际负责模型推理的进程叫 llama-server,一个推理过程直接用掉 95% 的 GPU 。

GPU 使用情况,基本上也是拉满。

而我现在基本上没开啥进程,就开了个 wechat 、unsloth、typora 和一个图片上传工具,浏览器页签我都没开。

来看一下任务情况。

6251s ,大概是 1.7 个小时。

prompt speed 的速度还可以,144 tok/s ,但是到了生成阶段只有 7 tok/s 了。

为啥比第一轮的 11 tok/s 还慢,甚至跑了快俩小时?

我研究了一下整个过程。

一来是画鹈鹕触发了超长的思考过程(Thinking),它在后台硬生生吐了几万个 token;

二来是随着上下文越来越长,32G 内存彻底被撑爆了,系统开始动用硬盘做内存交换(Swap),一旦开始读写硬盘,速度明显降下来了。

所以本地跑,我还是那句话,能跑和能用,能用和好用是俩回事。

能跑和能用其实不需要太大内存,但是上到好用这个阶段,我觉得至少得 64 G 起了。

虽然但是,也希望各个本地部署的量化社区再给点力,或者 Qwen 再给点力,出一个让我们这种穷逼本地也能爽玩的模型。

 

如果这篇文章你觉得还不错,谢谢你的三连,也希望可以转发给同样关注 AI / 科技 / 开发效率的朋友。 我是 cxuan,我们下期再见。

相关推荐

cxuan 写的文章还不错。会分享计算机底层、计算机网络、操作系统,Java基础、框架、源码等文章。