对于正在把大模型接入应用的团队来说,模型能力固然重要,但 API 调用成本仍是团队最关心的一项。尤其是 AI 编程、客服机器人、内容生成、代码辅助和 AI Agent 这类高频场景,单次请求便宜几厘钱看似不多,乘上每月数千万甚至数亿 Token 后,就会变成一笔不小的支出。

现在,这部分成本有望进一步下降。

DigitalOcean 近期对无服务器推理(Serverless Inference)中的多款模型进行了价格调整。本轮共有多款模型降价,涉及输入、输出和提示缓存三类计费项,整体降幅在 20%—50% 之间。

多款模型降价,最高降幅 50%

本轮价格调整覆盖 Qwen、DeepSeek、Meta、NVIDIA、小米和智谱 AI 等模型供应商。以下价格均以美元计价,单位为每 100 万 Token。

模型 计费项 原价格 新价格 降幅
Qwen 3.5 397B A17B 输入 $0.385 $0.302 21.56%
Qwen 3.5 397B A17B 输出 $2.450 $1.925 21.43%
DeepSeek V4 Flash 输入 $0.112 $0.084 25%
DeepSeek V4 Flash 输出 $0.224 $0.168 25%
DeepSeek V4 Flash 提示缓存 $0.028 $0.017 39.29%
DeepSeek V4 Pro 输入 $1.392 $0.870 37.5%
DeepSeek V4 Pro 输出 $2.784 $1.740 37.5%
DeepSeek V4 Pro 提示缓存 $0.348 $0.174 50%
DeepSeek V3.2 输入 $0.425 $0.250 41.18%
DeepSeek V3.2 输出 $1.360 $0.800 41.18%
DeepSeek V3.2 提示缓存 $0.150 $0.075 50%
Llama 4 Maverick 17B 128E Instruct 输入 $0.250 $0.200 20%
Llama 4 Maverick 17B 128E Instruct 输出 $0.870 $0.696 20%
Nemotron-3-Super-120B 输入 $0.210 $0.165 21.43%
Nemotron-3-Super-120B 输出 $0.455 $0.358 21.32%
MiMo V2.5 Pro 输入 $0.600 $0.400 33.33%
MiMo V2.5 Pro 输出 $3.000 $1.500 50%
MiMo V2.5 Pro 提示缓存 $0.160 $0.080 50%
GLM-5.2 输入 $1.050 $0.700 33.33%
GLM-5.2 输出 $4.400 $2.200 50%
GLM-5.2 提示缓存 $0.210 $0.120 42.86%

从这张表可以看到,这次并不是只调整某一个供应商或某一档模型,而是同时覆盖了高性价比模型、通用大模型和偏高能力的 Pro 模型。开发团队可以根据任务难度,在不同模型之间重新做一次成本与性能的权衡。

除了以上模型,DigitalOcean 无服务器推理还提供多种模型,包括 Claude、GPT、Kimi K3、DeepSeek、Qwen、GLM、Llama 和 Nemotron 等主流模型系列。开发者可以通过统一的 OpenAI 兼容接口调用不同供应商的模型,无需分别注册账号、管理多套 API Key,也能更方便地根据任务效果、响应速度和调用成本切换模型。

注:本文价格来自本次价格调整表,均以美元计价。实际可用模型、功能及账单金额请以 DigitalOcean 控制台和官方定价页面为准。具体也可直接咨询 DigitalOcean 中国区战略合作伙伴卓普云AI Droplet

与模型官方 API 相比,DigitalOcean 的价格如何?

降价之后,DigitalOcean Serverless Inference 的部分模型不仅比此前更便宜,与模型厂商官方 API 相比也出现了明显的价格优势。下面进一步对比部分模型在 DigitalOcean 当前价格与各模型官方的价格。表中金额均为每 100 万 Token 的美元价格,“DO / 官方”表示前者为 DigitalOcean 价格、后者为模型厂商官方价格。

模型 输入:DO / 官方 输出:DO / 官方 缓存:DO / 官方
DeepSeek V4 Flash $0.084 / $0.140 $0.168 / $0.280 $0.017 / $0.0028
GLM 5 $0.750 / $1.000 $2.400 / $3.200 $0.200 / $0.200
GLM-5.1 $0.975 / $1.400 $4.300 / $4.400 $0.260 / $0.260
GLM-5.2 $0.700 / $1.400 $2.200 / $4.400 $0.120 / $0.260
Kimi K2.5 $0.375 / $0.600 $2.025 / $3.000 $0.203 / $0.100
Kimi K2.6 $0.760 / $0.950 $3.200 / $4.000 $0.190 / $0.160
Kimi K3 $3.000 / $3.000 $15.000 / $15.000 $0.300 / $0.300
MiniMax M2.5 $0.225 / $0.300 $0.900 / $1.200 $0.060 / $0.030
Qwen3-32B $0.250 / $0.287 $0.550 / $1.147 无 / 官方不支持

从输入和输出价格来看,表中多款在 DigitalOcean 上低于官方价格。其中,GLM-5.2 的输入和输出价格均比官方低 50%,缓存价格低约 53.85%;Qwen3-32B 的输出价格比官方低约 52.05%;DeepSeek V4 Flash 的输入和输出价格均低 40%。Kimi K3 的三项价格则与官方一致。

哪些应用受益更明显?

首先是输出内容较长的应用,例如文案生成、报告撰写、代码生成和深度问答。MiMo V2.5 Pro 与 GLM-5.2 的输出价格都直接减半;当输出 Token 在总用量中占比较高时,账单下降会非常直观。

其次是使用固定长提示词的 AI Agent 和企业知识助手。这类应用通常会在每次请求中重复发送系统提示词、工具说明、角色设定或较长的公共上下文。如果模型支持并命中提示缓存,缓存价格下降可以进一步压低重复输入的成本。DeepSeek V4 Pro、DeepSeek V3.2 和 MiMo V2.5 Pro 的提示缓存价格此次均下降 50%。

另外,对于需要处理海量轻量任务的业务,例如商品信息整理、工单分类、内容审核、标签提取和批量摘要,DeepSeek V4 Flash 的新输入价格仅为每 100 万 Token 0.084 美元,输出价格为 0.168 美元。这类任务单次调用量不大,但请求规模往往很高,因此单位 Token 成本的下降同样值得关注。

当然,模型价格并不是选型的唯一标准。正式切换前,仍应结合自己的真实数据集,对回答质量、首 Token 延迟、整体响应时间、结构化输出稳定性和工具调用能力进行测试。更合理的做法不是简单选择“最便宜的模型”,而是让不同难度的任务使用与之匹配的模型。

什么是 DigitalOcean 无服务器推理?

这里给一些还不太熟悉 DigitalOcean 云平台的用户介绍一下。

DigitalOcean 无服务器推理是一项托管式模型推理服务。开发者可以直接通过 API 调用基础模型,不需要购买 GPU、部署推理框架,也不需要自己处理扩缩容、模型升级和底层基础设施运维。目前,DigitalOcean Inference 提供 70 多款模型。

简单来说,它把“搭建并维护一套大模型推理服务”变成了“调用一个 API”。

Serverless Inference 按实际使用量计费。对于文本模型,费用通常由输入 Token、输出 Token 以及提示缓存构成;没有请求时,不需要为闲置 GPU 持续付费。因此,它更适合希望快速接入模型、流量存在波峰波谷、需要频繁尝试不同模型,或暂时不想维护推理基础设施的团队。

开发者还可以先在DigitalOcean 的 Model Playground 中测试和比较模型,再通过统一接口接入应用。随着模型目录持续扩展,团队不必为每一家模型供应商分别维护一套调用方式、账号和基础设施,也更容易根据效果、速度与价格调整模型组合。

此外,DigitalOcean 还提供 Inference Router(推理路由器)。开发者可以把多款模型加入同一个路由器,通过统一端点调用,并根据成本、响应速度或任务类型,将请求自动分配给更合适的模型。当首选模型不可用时,还可以切换至备用模型。这样既能避免所有任务都调用价格较高的大模型,也能减少模型切换、故障回退和多套 API 接口带来的开发工作,尤其适合需要同时使用多款模型的 AI Agent 和生产级应用。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐