文章来源说明:本文由 ZeroOne AI 整理发布,官网与 CSDN 双端同步首发,原文见 www.zeroone-ai.com

 

 

一、为什么选择 Apple M3 Max 96GB?

 

随着本地大模型的发展,Apple Silicon 的统一内存架构越来越适合运行中大型 AI 模型。

对于机械设计、工业自动化、MES、ERPNext、SolidWorks 二次开发等场景,本地部署 AI 有一个非常明显的优势:

设计资料、企业知识库、CAD 文件和源代码可以留在本地。

对于拥有 M3 Max 96GB 统一内存的 Mac Studio 来说,与其只把它当作普通开发电脑,不如将它打造成为一台:

本地 AI + SolidWorks + 企业知识库 + Agent 的智能设计工作站。

本文推荐的核心模型为:

Qwen3.6-35B-A3B

它采用 MoE(Mixture of Experts)架构,总参数规模约 35B,但每个 Token 实际激活的参数规模约为 3B,因此非常适合 Apple Silicon 本地推理。

目前已经存在针对 Apple Silicon 优化的 MLX 量化版本,例如 Qwen3.6-35B-A3B-OptiQ-4bit,可以直接使用 MLX 运行,无需将模型转换成 GGUF。

 

二、为什么不是 Qwen3-235B?

 

很多人看到 M3 Max 96GB,会第一时间考虑:

Qwen3-235B-A22B

但是对于实际生产使用,我反而更加推荐:

Qwen3.6-35B-A3B

原因很简单:

1. 运行压力更低

Qwen3.6-35B-A3B 是 MoE 模型。

虽然模型总参数达到 35B,但每次推理只激活其中一小部分参数。

因此:

 

35B 总参数
 ↓
MoE Router
 ↓
少量 Expert 被激活
 ↓
约 3B 级别激活参数

 

这使得它特别适合本地 Agent、代码生成和工具调用。

2. M3 Max 96GB 有充足空间

目前已经有 MLX 4bit 版本。

例如社区提供的 MLX-MXFP4 版本,模型权重约 17~20GB;另一个混合 4/8bit MLX 版本约 20GB。

因此:

 

M3 Max 96GB

 

模型 ≈ 20GB

KV Cache + 操作系统 + SolidWorks/MCP + 知识库 + Embedding + 数据库

仍然有较大的余量

 

这比在 96GB 机器上硬塞超大型模型更加合理。

 

三、推荐的模型版本

 

对于 M3 Max 96GB,我建议优先考虑:

 

Qwen3.6-35B-A3B
 +
MLX 4bit

 

目前可以选择:

 

mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit

 

该版本针对 Apple Silicon 的 MLX 推理进行了量化优化,并提供 mlx-lm 使用方式。

另外也存在:

 

Qwen3.6-35B-A3B-MXFP4

 

这类 MLX 原生 FP4 版本,模型权重约 17GB 左右。

 

四、M3 Max 96GB 推荐软件架构

 

整个 AI 工作站可以设计成:

 

┌─────────────────────────────┐
│         OpenWebUI           │
│        AI 对话入口          │
└─────────────┬───────────────┘
              │
              ↓
┌─────────────────────────────┐
│     Qwen3.6-35B-A3B        │
│           MLX              │
└─────────────┬───────────────┘
              │
┌─────────────┼───────────────┐
↓             ↓               ↓
SolidWorks    知识库          编程开发
   MCP         RAG        Python/C#/Qt
↓             ↓               ↓
SolidWorks    PDF/Word       Git/MES
自动建模      Excel/标准      ERPNext

 

最终目标不是简单地"聊天"。

而是:

让 AI 成为机械设计工程师的数字助手。

 

五、第一步:安装 MLX

 

Apple Silicon 最值得优先考虑的本地推理框架之一就是 MLX。

安装:

 

brew install uv

 

然后:

 

uv tool install mlx-lm

 

验证:

 

mlx_lm --help

 

 

六、直接运行 Qwen3.6

 

安装完成以后,可以直接运行:

 

mlx_lm.chat \
  --model mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit

 

第一次运行时会自动从 Hugging Face 获取模型。

也可以使用 MXFP4 版本:

 

mlx_lm.chat \
  --model majentik/Qwen3.6-35B-A3B-MLX-MXFP4

 

对于 M3 Max 96GB,我建议优先测试 4bit/混合量化版本。

 

七、启动 OpenAI API Server

 

真正做 Agent 时,不建议一直使用命令行聊天。

更好的方式是:

 

Qwen3.6
 ↓
MLX Server
 ↓
OpenAI Compatible API

 

启动:

 

mlx_lm.server \
  --model mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit

 

默认服务:

 

http://127.0.0.1:8000

 

MLX 模型卡提供了 OpenAI-compatible API 的启动方式,因此后面的 OpenWebUI、Agent、MCP 客户端都可以围绕这个接口进行集成。

 

八、测试 API

 

可以通过:

 

curl http://127.0.0.1:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit",
    "messages": [
      {
        "role": "user",
        "content": "设计一个用于输送带的机械张紧机构"
      }
    ]
  }'

 

如果能够正常返回结果:

 

MLX
 ↓
Qwen3.6
 ↓
OpenAI API

 

就部署成功了。

 

九、为什么这个模型特别适合 SolidWorks?

 

SolidWorks 自动设计真正困难的地方,并不是"画一个圆"。

而是:

 

需求
 ↓
机械原理分析
 ↓
结构设计
 ↓
尺寸计算
 ↓
材料选择
 ↓
标准件选择
 ↓
参数化建模
 ↓
装配
 ↓
工程图
 ↓
BOM

 

这其实是一个典型的 Agent 问题。

例如用户输入:

 

设计一个用于滴灌带生产线的导向机构,速度 350m/min,要求减少管带跑偏。

 

AI 可以首先分析:

 

生产速度
材料
张力
摩擦
导向方式
安装空间

 

然后形成设计方案:

 

方案A:滚轮导向
方案B:V型槽导向
方案C:多滚轮限位
方案D:浮动导向

 

接下来调用 SolidWorks MCP。

 

十、SolidWorks + Qwen3.6

 

推荐架构:

 

用户
 │
 ↓
Qwen3.6
 │
 ↓
Agent
 │
 ↓
SolidWorks MCP
 │
 ↓
SolidWorks API
 │
 ↓
SolidWorks

 

AI 不直接操作 SolidWorks。

而是通过工具调用:

 

create_part
create_sketch
create_extrude
create_hole
create_fillet
create_assembly
create_drawing
export_step
export_pdf

 

例如:

 

{
  "tool": "create_part",
  "parameters": {
    "name": "Guide_Roller",
    "diameter": 80,
    "length": 120,
    "material": "45#"
  }
}

 

Agent 负责规划。

MCP 负责执行。

SolidWorks 负责建模。

这比让大模型直接生成一大段 VBA 更可靠。

 

十一、企业知识库

 

机械设计 AI 最重要的部分其实不是模型。

而是:

企业自己的知识。

例如建立:

 

/KnowledgeBase
│
├── 机械设计手册
├── GB国家标准
├── ISO标准
├── 电机选型
├── 减速机选型
├── 轴承选型
├── 螺栓标准
├── 公差标准
├── 企业设计规范
├── SolidWorks API
├── 设备说明书
├── 历史项目
└── MES技术文档

 

然后建立 RAG。

 

十二、RAG 推荐架构

 

 

PDF
Word
Excel
CAD文档
技术规范
历史项目
 │
 ↓
Document Parser
 │
 ↓
Chunk
 │
 ↓
Embedding
 │
 ↓
Vector Database
 │
 ↓
Reranker
 │
 ↓
Qwen3.6

 

Embedding 可以使用:

 

BGE-M3

 

检索结果经过 Reranker 后,再交给 Qwen3.6。

这样 AI 就不是"凭经验回答"。

而是:

 

问题
 ↓
检索企业知识
 ↓
找到相关标准
 ↓
Qwen3.6分析
 ↓
生成设计方案

 

 

十三、一个非常实用的例子

 

以后可以直接问:

 

M8螺栓用于这个铝型材结构,孔径应该怎么设计?

 

Agent:

 

① 查询企业机械设计规范
② 查询GB标准
③ 查询当前结构材料
④ 查询SolidWorks模型
⑤ 判断安装方式
⑥ 给出推荐尺寸
⑦ 调用SolidWorks修改模型

 

最终:

 

AI分析
 ↓
知识库校核
 ↓
SolidWorks修改
 ↓
重新检查

 

这才是真正意义上的:

AI机械设计 Agent

 

十四、M3 Max 96GB 为什么适合这种架构?

 

96GB 统一内存最大的优势不是"只能装一个大模型"。

而是可以同时运行:

 

Qwen3.6
+
Embedding
+
Reranker
+
Vector DB
+
MCP Server
+
SolidWorks
+
Python
+
Docker
+
数据库

 

例如:

 

M3 Max 96GB
             │
┌────────────┼────────────┐
│            │            │
↓            ↓            ↓
Qwen3.6   Vector DB      MCP
│            │            │
│            ↓            ↓
│        企业知识库    SolidWorks
│
↓
Agent
│
├──── Python
├──── C#
├──── Qt
├──── ERPNext
├──── MES
└──── MQTT/OPC

 

这就是 M3 Max 96GB 真正的价值。

 

十五、不要把所有任务都交给一个模型

 

建议建立多模型架构。

主模型:Qwen3.6-35B-A3B

负责:

 

机械设计
Agent
知识库
技术分析
日常编程

 

视觉模型: 后续增加 Qwen3.6-VL 或适合 MLX 的视觉版本。

负责:

 

工程图
装配图
SolidWorks截图
设备照片
检测图片

 

Embedding:BGE-M3

负责知识库向量化。

Reranker

负责:

 

提高知识库检索准确率

 

 

十六、SolidWorks 自动设计的最终形态

 

最终可以形成:

 

用户
 │
 ↓
"设计一个机构"
 │
 ↓
Qwen3.6
 │
┌──────┴──────┐
↓             ↓
知识库       Agent
│             │
↓             ↓
标准校核     MCP工具
              │
              ↓
           SolidWorks
              │
              ↓
            三维模型
              │
┌─────────────┼─────────────┐
↓             ↓             ↓
STEP          PDF           BOM

 

甚至可以进一步加入:

 

有限元分析
运动仿真
干涉检查
材料校核
强度计算
成本分析

 

最终形成一个完整的:

AI CAD Engineer

 

十七、M3 Max 96GB 推荐配置

 

如果现在重新搭建,我推荐:

 

模块 | 推荐

--- | ---

CPU/GPU | Apple M3 Max

统一内存 | 96GB

主模型 | Qwen3.6-35B-A3B

量化 | MLX 4bit / MXFP4

推理框架 | MLX

API | mlx-lm server

Web UI | OpenWebUI

Embedding | BGE-M3

RAG | LlamaIndex

Vector DB | Qdrant / Milvus

Agent | MCP

CAD | SolidWorks

CAD接口 | SolidWorks API + MCP

编程 | Python / C# / Qt

工业系统 | MES / ERPNext

数据接口 | MQTT / OPC / Modbus

 

 

十八、最终推荐

 

对于 M3 Max 96GB,如果目标是:

 

SolidWorks
+
机械设计
+
知识库
+
MES
+
ERPNext
+
Python/C#/Qt
+
Agent

 

我不建议一味追求参数最大的模型。

更合理的方案是:

 

M3 Max 96GB
            │
            ↓
   Qwen3.6-35B-A3B
       MLX 4bit
            │
┌───────────┼───────────┐
↓           ↓           ↓
RAG         MCP        Coding
│           │           │
↓           ↓           ↓
企业知识  SolidWorks   Python/C#/Qt
            │
            ↓
    AI机械设计工作站

 

Qwen3.6-35B-A3B + MLX 4bit 是目前非常适合 M3 Max 96GB 的本地部署路线。

它不追求"最大的参数量",而是追求:

足够强的推理能力 + 较低的本地资源占用 + Agent能力 + 工具调用 + 企业知识库 + SolidWorks自动化。

对于实际工业应用,这种组合比单纯部署一个超大模型更加实用。

 

十九、下一步可以继续升级

 

如果进一步把这个系统做成你前面规划的"小龙虾":

 

小龙虾
 │
 Qwen3.6-35B
 │
┌────────────┼────────────┐
↓            ↓            ↓
SolidWorks   MES        ERPNext
  MCP        MCP          API
│            │            │
↓            ↓            ↓
CAD模型    生产数据      企业数据
│
↓
企业知识库
│
↓
设计规范

 

就可以从"本地聊天机器人"进一步发展成:

面向机械制造企业的本地 AI Agent 平台。

而 M3 Max 96GB 正好可以作为这套系统的本地 AI 主机。

 

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐