一、模型选择

以deepseek所有模型为例

1.1 模型配置

模型分类

        目前来看,大语言模型区别于bert等预训练模型的地方在于是否能生成连贯、长篇的自然语言文本,并具备通用的语言理解和推理能力,而参数并不是决定量(Bert-large参数量为3.4亿)。此外,从transformer拆下来的三种模型架构中,仅编码器即bert只能负责一些以往机器学习的分类,预测任务,如命名实体识别,情感分类,意图识别,仅解码器则负责通过输入句子“预测”下一个字,并没有编码器理解的部分(如bert可通过mask任务和下一句预测任务,以及相关嵌入,来通过训练“理解”输入的相对位置,预测下一个字的最大概率),而编码器-解码器则两种兼具。

分类维度 类别 核心特点 代表模型
参数量规模 小型 (<1B) 轻量、快速、低耗 Phi-2, Gemma-2B
中型 (1B~10B) 能力与效率的平衡 Llama-8B, DeepSeek-V2-Lite
大型 (10B~100B) 强大的通用与推理能力 Llama-70B, DeepSeek-LLM-67B
超大型 (>100B) 顶尖能力,常为MoE GPT-4, DeepSeek-V2/V3
模型架构 仅编码器 擅长文本理解 BERT, RoBERTa
仅解码器 擅长文本生成 GPT, Llama, DeepSeek全系
编码器-解码器 擅长理解后生成 T5, Gemini
专家结构 密集架构 全参数激活,稳定 Llama 2, DeepSeek-LLM
混合专家 稀疏激活,高性价比 Mixtral, DeepSeek-V2/V3
模态能力 纯文本 仅处理文本 Llama 2, DeepSeek-LLM
多模态 处理图文音视频 GPT-4V, Gemini, Claude 3
文件解析 从文件中提取文本处理 DeepSeek-V2/V3(激活后)
开放程度 封闭模型 仅API,不透明 GPT-4, Claude 3, 文心一言
开源模型 权重公开,可自部署 DeepSeek全系, Llama 2/3, Mistral

DeepSeek全家桶

模型系列 代表型号 参数规模 核心架构 主要特点 应用场景 工具链支持
DeepSeek-V1 DeepSeek-LLM-7B/67B 7B, 67B 密集Transformer 强大的中英双语基础能力 通用对话、内容创作 Hugging Face, vLLM
DeepSeek-V2 DeepSeek-V2 236B (MoE) 混合专家架构 超高性价比,128K上下文 大规模部署、长文档处理 官方推理库, vLLM
DeepSeek-V3 DeepSeek-V3 671B (MoE) 升级版MoE 顶尖综合能力,高效推理 复杂AI应用、企业级部署 官方推理库, 优化工具链
DeepSeek-Lite DeepSeek-V2-Lite 16B 密集Transformer 轻量高效,平衡性能与成本 资源受限环境、实时应用 同V2系列
DeepSeek-Coder DeepSeek-Coder-V2 236B (MoE) 混合专家架构 代码专精,多语言支持 开发工具、编程辅助 代码IDE插件兼容
DeepSeek-Multimodal 集成在各模型中 - 文件解析+文本理解 文档理解,图文信息提取 文档处理、内容分析 需特定参数激活

1.2 硬件配置

把LLM看作人的大脑,做工作前需要的能力或者环境,大概就有:智慧的大脑、学习工作所需的知识、工作为了让大脑运作起来的配置

大脑:形状(架构)、神经节连接(参数量)、思维模式(注意力机制)、天赋类型(模型类型,如仅解码器)

知识:书本量(输入数据量)、学习方法(训练手段)、学习时长(训练时长)、名师指点(优化算法与损失函数)

配置:心脏(电力)、血液循环(冷却系统)、工作记忆(内存与显存)、感官与四肢(输入输出设备与网络)、后勤保障(存储硬盘)

现实

我现在用的是DeepSeek-R1 (1.5B),大概回答“你好”,需要24秒,回答一个较复杂的问题需要44秒,回答一个Python的加法代码需要105秒

而我使用的电脑配置为 i5-7300HQ / 8G / GTX 1050 Ti 4G / SATA SSD+HDD,大概有以下局限:

GPU (GTX 1050 Ti 4G):核心算力单元。4GB显存是主要瓶颈,加载模型后剩余空间不足,难以高效处理长上下文和复杂计算任务。

系统内存 (8G):关键数据通道。容量紧张导致显存不足时系统被迫使用硬盘交换,造成响应速度急剧下降。

CPU (i5-7300HQ):任务调度中心。负责协调数据在存储、内存和显存间的流动,确保计算流水线持续运转。

存储 (SATA SSD+HDD):模型仓库基地。SSD负责快速加载模型文件,HDD在内存不足时参与数据交换,成为性能瓶颈。

对比

维度 DeepSeek-R1 (1.5B) DeepSeek-V1 (6.7B) DeepSeek母公司 (现实服务)
🧠 大脑:形状 Transformer仅解码器 Transformer仅解码器 庞大的云端模型集群,可能集成多种先进架构(如MoE)
🧠 大脑:神经节连接 15亿 个参数 67亿 个参数 提供从数十亿到数千亿参数的不同模型服务
🧠 大脑:思维模式 动态稀疏注意力机制 经典的多头自注意力机制 可能采用创新的MLA注意力等机制,优化长文本处理
🧠 大脑:天赋类型 纯文本模型,专为实时交互优化 纯文本模型 提供通用对话、代码、多模态、深度推理等多种专长模型
📚 知识:书本量 基于共享的2.3TB多模态训练集的一部分 在超过2万亿词元的数据上训练 使用海量、多领域、高质量数据进行训练,规模远超公开数据
📚 知识:学习方法 大规模预训练与指令微调 海量无监督预训练与指令微调 采用包括大规模强化学习在内的前沿训练方法
⚙️ 配置:心脏 功耗极低,在CPU上也可运行 需要稳定电力,通常在服务器GPU上运行 依赖庞大的数据中心,消耗巨额电力
⚙️ 配置:血液循环 基础风冷即可满足 需要高效的散热系统 整个数据中心需要强大的冷却系统,可能采用液冷
⚙️ 配置:工作记忆 3GB 内存/显存 13GB 显存 (FP16) 将整个大模型加载到多张高端GPU的显存
⚙️ 配置:感官与四肢 本地设备的输入输出,延迟极低 通过服务器网卡和互联网传输 通过高速互联网,接收和处理全球用户的海量并发请求

全家桶配置

模型名称 特点 应用场景 CPU要求 GPU要求 内存要求 存储要求 其他依赖
DeepSeek-V3 最新版本,支持复杂推理、多轮对话、代码生成、多语言处理 科研、开发、教育、创意写作、多语言任务 至少8核 NVIDIA V100或更高 32GB以上 100GB以上 SSD CUDA 11+,PyTorch 1.10+
DeepSeek-V2 支持多轮对话、文本生成、基础代码生成、中等复杂度推理 客服、内容创作、基础编程、数据分析 至少4核 NVIDIA T4或更高 16GB以上 50GB以上 SSD CUDA 10+,PyTorch 1.8+
DeepSeek-V1 基础文本生成、问答、简单推理、低资源需求 基础问答、文本生成、简单任务 至少2核 无GPU或低端GPU 8GB以上 20GB以上 HDD 无特殊依赖
DeepSeek-Lite 轻量级模型,适合移动端或嵌入式设备,支持基础文本生成和问答 移动应用、嵌入式设备、低功耗场景 1-2核 无GPU 4GB以上 10GB以上 HDD 无特殊依赖
DeepSeek-Multimodal 支持多模态输入(文本、图像、音频),适合跨模态任务 多媒体分析、跨模态生成、智能助手 至少8核 NVIDIA A100或更高 64GB以上 200GB以上 SSD CUDA 11+,PyTorch 1.10+
DeepSeek-Code 专为代码生成和编程任务优化,支持多种编程语言 代码生成、编程辅助、自动化开发 至少6核 NVIDIA V100或更高 32GB以上 100GB以上 SSD CUDA 11+,PyTorch 1.10+

1.3 个人/企业部署

对比维度 个人部署 企业部署
核心目标 个人使用、学习研究、原型验证 对外/对内提供商业服务、集成到产品中
硬件基础 单一服务器高端PC(如配备RTX 4090的工作站) GPU服务器集群(多台A100/H100服务器通过高速网络互联)
性能焦点 低延迟:追求单个请求的响应速度 高吞吐、高并发:追求同时处理成千上万个请求的能力
可用性要求 偶尔中断可接受 99.9%+ 的高可用性,需要冗余设计,避免单点故障
成本模型 一次性硬件投入,电费成本较低 巨大的持续投入(硬件采购/租赁、机房、电费、运维团队)
技术栈 简单的推理框架(如Ollama, LM Studio) 复杂的云原生技术栈(Kubernetes、Docker、模型调度、负载均衡)
安全与合规 基础的数据隐私 企业级安全(网络隔离、数据加密、访问审计、符合行业法规)
模型维护 手动更新,频率低 自动化流水线(CI/CD),持续集成、测试和部署新模型
可扩展性 垂直升级(换更好的显卡) 水平扩展(轻松增加更多服务器节点)
典型场景 个人编程助手、离线文档分析 智能客服系统、SaaS AI服务、大规模内容审核

二、部署步骤

【保姆级教程】DeepSeek 怎么本地化部署?含模型对比、硬件要求,及详细图文步骤 - 程序员小宇 - 博客园

三、使用

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐