智能体开发(5)模型部署
一、模型选择
以deepseek所有模型为例
1.1 模型配置
模型分类
目前来看,大语言模型区别于bert等预训练模型的地方在于是否能生成连贯、长篇的自然语言文本,并具备通用的语言理解和推理能力,而参数并不是决定量(Bert-large参数量为3.4亿)。此外,从transformer拆下来的三种模型架构中,仅编码器即bert只能负责一些以往机器学习的分类,预测任务,如命名实体识别,情感分类,意图识别,仅解码器则负责通过输入句子“预测”下一个字,并没有编码器理解的部分(如bert可通过mask任务和下一句预测任务,以及相关嵌入,来通过训练“理解”输入的相对位置,预测下一个字的最大概率),而编码器-解码器则两种兼具。
| 分类维度 | 类别 | 核心特点 | 代表模型 |
|---|---|---|---|
| 参数量规模 | 小型 (<1B) | 轻量、快速、低耗 | Phi-2, Gemma-2B |
| 中型 (1B~10B) | 能力与效率的平衡 | Llama-8B, DeepSeek-V2-Lite | |
| 大型 (10B~100B) | 强大的通用与推理能力 | Llama-70B, DeepSeek-LLM-67B | |
| 超大型 (>100B) | 顶尖能力,常为MoE | GPT-4, DeepSeek-V2/V3 | |
| 模型架构 | 仅编码器 | 擅长文本理解 | BERT, RoBERTa |
| 仅解码器 | 擅长文本生成 | GPT, Llama, DeepSeek全系 | |
| 编码器-解码器 | 擅长理解后生成 | T5, Gemini | |
| 专家结构 | 密集架构 | 全参数激活,稳定 | Llama 2, DeepSeek-LLM |
| 混合专家 | 稀疏激活,高性价比 | Mixtral, DeepSeek-V2/V3 | |
| 模态能力 | 纯文本 | 仅处理文本 | Llama 2, DeepSeek-LLM |
| 多模态 | 处理图文音视频 | GPT-4V, Gemini, Claude 3 | |
| 文件解析 | 从文件中提取文本处理 | DeepSeek-V2/V3(激活后) | |
| 开放程度 | 封闭模型 | 仅API,不透明 | GPT-4, Claude 3, 文心一言 |
| 开源模型 | 权重公开,可自部署 | DeepSeek全系, Llama 2/3, Mistral |
DeepSeek全家桶
| 模型系列 | 代表型号 | 参数规模 | 核心架构 | 主要特点 | 应用场景 | 工具链支持 |
|---|---|---|---|---|---|---|
| DeepSeek-V1 | DeepSeek-LLM-7B/67B | 7B, 67B | 密集Transformer | 强大的中英双语基础能力 | 通用对话、内容创作 | Hugging Face, vLLM |
| DeepSeek-V2 | DeepSeek-V2 | 236B (MoE) | 混合专家架构 | 超高性价比,128K上下文 | 大规模部署、长文档处理 | 官方推理库, vLLM |
| DeepSeek-V3 | DeepSeek-V3 | 671B (MoE) | 升级版MoE | 顶尖综合能力,高效推理 | 复杂AI应用、企业级部署 | 官方推理库, 优化工具链 |
| DeepSeek-Lite | DeepSeek-V2-Lite | 16B | 密集Transformer | 轻量高效,平衡性能与成本 | 资源受限环境、实时应用 | 同V2系列 |
| DeepSeek-Coder | DeepSeek-Coder-V2 | 236B (MoE) | 混合专家架构 | 代码专精,多语言支持 | 开发工具、编程辅助 | 代码IDE插件兼容 |
| DeepSeek-Multimodal | 集成在各模型中 | - | 文件解析+文本理解 | 文档理解,图文信息提取 | 文档处理、内容分析 | 需特定参数激活 |
1.2 硬件配置
把LLM看作人的大脑,做工作前需要的能力或者环境,大概就有:智慧的大脑、学习工作所需的知识、工作为了让大脑运作起来的配置
大脑:形状(架构)、神经节连接(参数量)、思维模式(注意力机制)、天赋类型(模型类型,如仅解码器)
知识:书本量(输入数据量)、学习方法(训练手段)、学习时长(训练时长)、名师指点(优化算法与损失函数)
配置:心脏(电力)、血液循环(冷却系统)、工作记忆(内存与显存)、感官与四肢(输入输出设备与网络)、后勤保障(存储硬盘)
现实
我现在用的是DeepSeek-R1 (1.5B),大概回答“你好”,需要24秒,回答一个较复杂的问题需要44秒,回答一个Python的加法代码需要105秒
而我使用的电脑配置为 i5-7300HQ / 8G / GTX 1050 Ti 4G / SATA SSD+HDD,大概有以下局限:
GPU (GTX 1050 Ti 4G):核心算力单元。4GB显存是主要瓶颈,加载模型后剩余空间不足,难以高效处理长上下文和复杂计算任务。
系统内存 (8G):关键数据通道。容量紧张导致显存不足时系统被迫使用硬盘交换,造成响应速度急剧下降。
CPU (i5-7300HQ):任务调度中心。负责协调数据在存储、内存和显存间的流动,确保计算流水线持续运转。
存储 (SATA SSD+HDD):模型仓库基地。SSD负责快速加载模型文件,HDD在内存不足时参与数据交换,成为性能瓶颈。
对比
| 维度 | DeepSeek-R1 (1.5B) | DeepSeek-V1 (6.7B) | DeepSeek母公司 (现实服务) |
|---|---|---|---|
| 🧠 大脑:形状 | Transformer仅解码器 | Transformer仅解码器 | 庞大的云端模型集群,可能集成多种先进架构(如MoE) |
| 🧠 大脑:神经节连接 | 15亿 个参数 | 67亿 个参数 | 提供从数十亿到数千亿参数的不同模型服务 |
| 🧠 大脑:思维模式 | 动态稀疏注意力机制 | 经典的多头自注意力机制 | 可能采用创新的MLA注意力等机制,优化长文本处理 |
| 🧠 大脑:天赋类型 | 纯文本模型,专为实时交互优化 | 纯文本模型 | 提供通用对话、代码、多模态、深度推理等多种专长模型 |
| 📚 知识:书本量 | 基于共享的2.3TB多模态训练集的一部分 | 在超过2万亿词元的数据上训练 | 使用海量、多领域、高质量数据进行训练,规模远超公开数据 |
| 📚 知识:学习方法 | 大规模预训练与指令微调 | 海量无监督预训练与指令微调 | 采用包括大规模强化学习在内的前沿训练方法 |
| ⚙️ 配置:心脏 | 功耗极低,在CPU上也可运行 | 需要稳定电力,通常在服务器GPU上运行 | 依赖庞大的数据中心,消耗巨额电力 |
| ⚙️ 配置:血液循环 | 基础风冷即可满足 | 需要高效的散热系统 | 整个数据中心需要强大的冷却系统,可能采用液冷 |
| ⚙️ 配置:工作记忆 | 约3GB 内存/显存 | 约13GB 显存 (FP16) | 将整个大模型加载到多张高端GPU的显存中 |
| ⚙️ 配置:感官与四肢 | 本地设备的输入输出,延迟极低 | 通过服务器网卡和互联网传输 | 通过高速互联网,接收和处理全球用户的海量并发请求 |
全家桶配置
| 模型名称 | 特点 | 应用场景 | CPU要求 | GPU要求 | 内存要求 | 存储要求 | 其他依赖 |
|---|---|---|---|---|---|---|---|
| DeepSeek-V3 | 最新版本,支持复杂推理、多轮对话、代码生成、多语言处理 | 科研、开发、教育、创意写作、多语言任务 | 至少8核 | NVIDIA V100或更高 | 32GB以上 | 100GB以上 SSD | CUDA 11+,PyTorch 1.10+ |
| DeepSeek-V2 | 支持多轮对话、文本生成、基础代码生成、中等复杂度推理 | 客服、内容创作、基础编程、数据分析 | 至少4核 | NVIDIA T4或更高 | 16GB以上 | 50GB以上 SSD | CUDA 10+,PyTorch 1.8+ |
| DeepSeek-V1 | 基础文本生成、问答、简单推理、低资源需求 | 基础问答、文本生成、简单任务 | 至少2核 | 无GPU或低端GPU | 8GB以上 | 20GB以上 HDD | 无特殊依赖 |
| DeepSeek-Lite | 轻量级模型,适合移动端或嵌入式设备,支持基础文本生成和问答 | 移动应用、嵌入式设备、低功耗场景 | 1-2核 | 无GPU | 4GB以上 | 10GB以上 HDD | 无特殊依赖 |
| DeepSeek-Multimodal | 支持多模态输入(文本、图像、音频),适合跨模态任务 | 多媒体分析、跨模态生成、智能助手 | 至少8核 | NVIDIA A100或更高 | 64GB以上 | 200GB以上 SSD | CUDA 11+,PyTorch 1.10+ |
| DeepSeek-Code | 专为代码生成和编程任务优化,支持多种编程语言 | 代码生成、编程辅助、自动化开发 | 至少6核 | NVIDIA V100或更高 | 32GB以上 | 100GB以上 SSD | CUDA 11+,PyTorch 1.10+ |
1.3 个人/企业部署
| 对比维度 | 个人部署 | 企业部署 |
|---|---|---|
| 核心目标 | 个人使用、学习研究、原型验证 | 对外/对内提供商业服务、集成到产品中 |
| 硬件基础 | 单一服务器或高端PC(如配备RTX 4090的工作站) | GPU服务器集群(多台A100/H100服务器通过高速网络互联) |
| 性能焦点 | 低延迟:追求单个请求的响应速度 | 高吞吐、高并发:追求同时处理成千上万个请求的能力 |
| 可用性要求 | 偶尔中断可接受 | 99.9%+ 的高可用性,需要冗余设计,避免单点故障 |
| 成本模型 | 一次性硬件投入,电费成本较低 | 巨大的持续投入(硬件采购/租赁、机房、电费、运维团队) |
| 技术栈 | 简单的推理框架(如Ollama, LM Studio) | 复杂的云原生技术栈(Kubernetes、Docker、模型调度、负载均衡) |
| 安全与合规 | 基础的数据隐私 | 企业级安全(网络隔离、数据加密、访问审计、符合行业法规) |
| 模型维护 | 手动更新,频率低 | 自动化流水线(CI/CD),持续集成、测试和部署新模型 |
| 可扩展性 | 垂直升级(换更好的显卡) | 水平扩展(轻松增加更多服务器节点) |
| 典型场景 | 个人编程助手、离线文档分析 | 智能客服系统、SaaS AI服务、大规模内容审核 |
二、部署步骤
【保姆级教程】DeepSeek 怎么本地化部署?含模型对比、硬件要求,及详细图文步骤 - 程序员小宇 - 博客园
三、使用

更多推荐
所有评论(0)