阿里开源的 Qwen3.8-27B 模型在 Hugging Face 下载量破 230 万,测评显示其代码能力超 Claude Opus 4.6 Max。作者实测在 24G 内存的 MacBook Pro(M4 Pro 芯片)上,通过 4bit、3bit 量化版本成功加载模型,但实际使用体验不佳。生成速度慢,内存占用高,上下文长度受限,难以流畅运行 Coding Agent。作者建议小内存设备更适合 Qwen3.5-9B,并发现 Empero 实验室推出的 Qwen3.8-9B-Distill 模型或可替代。


8 月 14 号,阿里终于开源了社区千呼万唤的 Qwen3.8-27B 模型,开源社区里好评如潮,Hugging Face 上 Qwen3.8-27B 模型页显示下载量已破 230 万。

看测评里说:Qwen3.8-27B 在代码能力评测上,已经追平甚至超过了 Claude Opus 4.6 Max。社区里甚至有人喊出“把 Opus 搬回家”。

看得我有点手痒。

但是我手头排得上号的设备,也就是台 M4 Pro 芯片、24G 内存的 MacBook Pro。托苹果这套统一内存架构的福,CPU、GPU 共用一块内存,跑本地模型,理论上可以把 24G 内存的大部分都拿来跑模型。

在 LM Studio 里搜 Qwen3.8-27B,出来的模型不止一个。

27B 这个体量,想在 24G 内存的机器上跑,没得选,只能找量化版。我先后挑了三个:mlx-community 的 4bit,以及 lukaskremla 的两个 3bit 版本,其中一个只保留文本能力。量化可以简单理解成把模型压小,用一部分精度换内存空间。

下载… 加载… 输入几个简单问题,三个模型都能正常出结果。

这台 24G 的 Mac,确实把 Qwen3.8-27B 塞进去了。

但能加载,和好用,中间还隔着一段距离。

01 先把 27B 塞进 24G

先看模型文件大小:

  • mlx-community/Qwen3.8-27B-4bit:16.1GB
  • lukaskremla/Qwen3.8-27B-3bit:12.7GB
  • lukaskremla/Qwen3.8-27B-3bit-TextOnly:11.8GB

三个模型都是 MLX 格式,也就是苹果专为 M 系列芯片推出的模型格式。4bit 和 3bit 的区别,可以简单理解成模型压缩程度不同,bit 数越小,模型体积越小。

再把条件固定下来:4K token 上下文,问简单问题,看生成速度,以及 macOS 系统、LM Studio 和对应模型加起来的整机总内存占用。

4bit 版

  • 整机总内存占用:21.5G
  • 24G 内存占比:90%
  • 生成速度:15 tok/s

3bit 版

  • 整机总内存占用:20.5G
  • 24G 内存占比:85%
  • 生成速度:18 tok/s

3bit TextOnly 版

  • 整机总内存占用:19.5G
  • 24G 内存占比:81%
  • 生成速度:18 tok/s

这里的 21.5G 不是模型单独占用的内存,而是 macOS、LM Studio 和模型加起来的总数。

结果不意外:4bit 模型文件更大,内存占用更高,速度也慢一些。真正值得留意的是,16.1GB 的 4bit 模型加载后,已经把这台 Mac 的整机内存吃到了 90%,余量已经很少。

15~18 tok/s,是什么感觉?

问简单问题,等它慢慢吐字,基本还能聊,字是一个一个往外蹦。

真正让人不踏实的是内存。24G 只剩下不到 2.5G,这台 MacBook Pro 基本没法再开别的软件了,多开几个浏览器窗口,内存就见底了。

02 能跑,但离好用还远

所以它不是不能用,而是只能在一个很窄的范围里用:打开 LM Studio,问几个简单问题,聊完就关。想让它长时间干活,或者把它接进 Agent,速度和内存都会马上变成问题。

这里还得补一个背景:Qwen3.8-27B 是稠密模型。简单说,每生成一个 token,都要调动模型里很大一部分参数,不像 MoE,也就是“混合专家”模型那样只调用其中一部分。

我这台 M4 Pro 24G 版本官方标称内存带宽是 273GB/s。24G 说的是内存容量,273GB/s 说的是 CPU 和 GPU 从统一内存里搬运数据的速度。容量决定模型能不能装下,带宽则影响模型装下之后跑得快不快。

Qwen3.8-27B 这种稠密模型,对内存带宽特别敏感。模型参数要不断从内存里搬出来参与计算,4bit 模型更大,每次要搬的数据也更多;3bit 模型小一些,搬数据的压力就低一些。

在这台 Mac 上,真正的瓶颈不是能不能把模型加载进来,而是内存带宽能不能跟上。

4K 上下文,问几个简单问题还行。真拿来日常聊天,用不了几轮,上下文就满了。

我逐步把 LM Studio 的模型上下文拉到了 8K、16K。

到 16K 时,设备开始出现花屏,界面抖动,估计是内存压力太大,已经影响到 macOS 的桌面显示了。

4bit 模型开 16K 上下文,大概已经接近这台 M4 Pro、24G 内存 MacBook Pro 的极限了。

单独聊天大概就这样了,出字慢、上下文短,凑合能用。

03 接上 Agent,立刻摆烂

再试试接 Coding Agent:

我把 Pi Agent 接到了 LM Studio 的 API,模型上下文先设成 4K,结果发第一条消息就直接报:上下文不足,没法开始工作。

Pi Agent 启动时,默认带着它的系统提示词、工具说明、AGENTS.md、Skills 头信息、Plugins、pi-memory 记忆等内容,这些一起塞进上下文,Pi 还没开始干活,这些默认携带的内容已经超出 4K 上下文了。

还好 Pi 的启动参数很灵活,可以直接不加载 Skills、Plugins 启动:“pi --no-skills --no-extensions”。这样总算能工作了,但交互速度很慢,问个问题通常要等 20~30 秒,回答长了还可能因为到了上下文上限被截断,直接报:“Response was truncated before completion”。

看来,Coding Agent 连接本地模型,不只是模型能加载就行,重要的是它有没有足够的上下文装下 Agent 的多轮交互。

上下文不够的问题,我看到 LM Studio 里有个 KV Cache 量化的选项,似乎可以节省内存。

查了下相关资料,KV Cache 可以理解成模型对前面内容的缓存。把这部分缓存压缩后,可以省出一些内存,留给更长的上下文。

我尝试打开了 KV Cache 量化选项,使用 8bit 量化试了下,效果确实有,能让内存紧张的设备拉高上下文。

但生成速度没有变,还是只有 18 tok/s。KV Cache 量化只能部分解决“模型上下文太小”的问题,不解决“模型吐字不够快”的问题。

04 27B 劝退,9B 接班

折腾到这里,阶段性结论已经很清楚了。

M4 Pro、24G 内存的 MacBook Pro,确实能跑 Qwen3.8-27B。但也就停留在“能跑”:在 LM Studio 里问几个简单问题,出字慢一点,上下文短一点,凑合还能用。

接 Coding Agent 就不行了。4K 上下文装不下 Agent 的工作环境,16K 又已经逼近机器极限,KV Cache 量化只能多挤出一些上下文空间,解决不了输出速度慢的问题。

原本我还想验证一下它传说中的代码能力。现在看来,别说代码能力了,光是让它在这台 Mac 上舒服地工作,都已经很勉强。

不过,不能在 Coding Agent 上用,不等于只剩简单聊聊天了。

我之前做过一个小项目,用 Qwen3.5-9B 处理旅行照片。晚上睡觉前,把一次旅行的照片一股脑丢进去,它会一张张分析照片内容、识别人物、判断照片质量,再给照片分组,最后串成一篇旅行小札。

这种任务,不需要模型快速响应,慢慢处理就行。照片留在本地,隐私不离开本地设备,最后还能得到一份有趣的旅行记录。

这可能才是小内存设备跑 Qwen3.8-27B 这类本地模型更适合的场景。

这次折腾下来的体会是:小内存(显存)设备,真的不要眼馋 Qwen3.8-27B 这种尺寸的模型。哪怕是量化版本,这类模型在小内存(显存)设备上的日常使用体验也很差,能用的场景非常有限。

像这种 24G 内存的设备,还是乖乖用回 Qwen3.5-9B。9B 大小的模型,才是这类设备的甜点位。

有趣的是,虽然阿里官方目前还没有为 Qwen3.8 推出 9B 尺寸的模型,但在 Hugging Face 上,我却看到一个叫 Empero 的实验室,把 Qwen3.8-Max 所基于的开源权重模型 Qwen3.8-2.4T-A95B 当作教师模型,通过蒸馏把它的推理能力压进了一个 9B 模型里:empero-ai/Qwen3.8-9B-Distill。

我准备试试这个模型,看看它能不能接替现在的 Qwen3.5-9B。

最后

对于正在迷茫择业、想转行提升,或是刚入门的程序员、编程小白来说,有一个问题几乎人人都在问:未来10年,什么领域的职业发展潜力最大?

答案只有一个:人工智能(尤其是大模型方向)

当下,人工智能行业正处于爆发式增长期,其中大模型相关岗位更是供不应求,薪资待遇直接拉满——字节跳动作为AI领域的头部玩家,给硕士毕业的优质AI人才(含大模型相关方向)开出的月基础工资高达5万—6万元;即便是非“人才计划”的普通应聘者,月基础工资也能稳定在4万元左右

再看阿里、腾讯两大互联网大厂,非“人才计划”的AI相关岗位应聘者,月基础工资也约有3万元,远超其他行业同资历岗位的薪资水平,对于程序员、小白来说,无疑是绝佳的转型和提升赛道。

如果你还不知道从何开始,我自己整理一套全网最全最细的大模型零基础教程,我也是一路自学走过来的,很清楚小白前期学习的痛楚,你要是没有方向还没有好的资源,根本学不到东西!

下面是我整理的大模型学习资源,希望能帮到你。

👇👇扫码免费领取全部内容👇👇

在这里插入图片描述

最后

1、大模型学习路线

2、从0到进阶大模型学习视频教程

从入门到进阶这里都有,跟着老师学习事半功倍。

3、 入门必看大模型学习书籍&文档.pdf(书面上的技术书籍确实太多了,这些是我精选出来的,还有很多不在图里)

4、 AI大模型最新行业报告

2026最新行业报告,针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估,以了解哪些行业更适合引入大模型的技术和应用,以及在哪些方面可以发挥大模型的优势。

5、面试试题/经验

【大厂 AI 岗位面经分享(107 道)】

【AI 大模型面试真题(102 道)】

【LLMs 面试真题(97 道)】

6、大模型项目实战&配套源码

适用人群

四阶段学习规划(共90天,可落地执行)
第一阶段(10天):初阶应用

该阶段让大家对大模型 AI有一个最前沿的认识,对大模型 AI 的理解超过 95% 的人,可以在相关讨论时发表高级、不跟风、又接地气的见解,别人只会和 AI 聊天,而你能调教 AI,并能用代码将大模型和业务衔接。

  • 大模型 AI 能干什么?
  • 大模型是怎样获得「智能」的?
  • 用好 AI 的核心心法
  • 大模型应用业务架构
  • 大模型应用技术架构
  • 代码示例:向 GPT-3.5 灌入新知识
  • 提示工程的意义和核心思想
  • Prompt 典型构成
  • 指令调优方法论
  • 思维链和思维树
  • Prompt 攻击和防范
第二阶段(30天):高阶应用

该阶段我们正式进入大模型 AI 进阶实战学习,学会构造私有知识库,扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架,抓住最新的技术进展,适合 Python 和 JavaScript 程序员。

  • 为什么要做 RAG
  • 搭建一个简单的 ChatPDF
  • 检索的基础概念
  • 什么是向量表示(Embeddings)
  • 向量数据库与向量检索
  • 基于向量检索的 RAG
  • 搭建 RAG 系统的扩展知识
  • 混合检索与 RAG-Fusion 简介
  • 向量模型本地部署
第三阶段(30天):模型训练

恭喜你,如果学到这里,你基本可以找到一份大模型 AI相关的工作,自己也能训练 GPT 了!通过微调,训练自己的垂直大模型,能独立训练开源多模态大模型,掌握更多技术方案。

到此为止,大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗?

  • 为什么要做 RAG
  • 什么是模型
  • 什么是模型训练
  • 求解器 & 损失函数简介
  • 小实验2:手写一个简单的神经网络并训练它
  • 什么是训练/预训练/微调/轻量化微调
  • Transformer结构简介
  • 轻量化微调
  • 实验数据集的构建
第四阶段(20天):商业闭环

对全球大模型从性能、吞吐量、成本等方面有一定的认知,可以在云端和本地等多种环境下部署大模型,找到适合自己的项目/创业方向,做一名被 AI 武装的产品经理。

  • 硬件选型

  • 带你了解全球大模型

  • 使用国产大模型服务

  • 搭建 OpenAI 代理

  • 热身:基于阿里云 PAI 部署 Stable Diffusion

  • 在本地计算机运行大模型

  • 大模型的私有化部署

  • 基于 vLLM 部署大模型

  • 案例:如何优雅地在阿里云私有部署开源大模型

  • 部署一套开源 LLM 项目

  • 内容安全

  • 互联网信息服务算法备案

  • 👇👇扫码免费领取全部内容👇👇

    在这里插入图片描述

3、这些资料真的有用吗?

这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。

资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

在这里插入图片描述

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐