大模型 API 进入峰谷定价时代:让 Agent 自动错峰的工程方案
大模型 API 的成本优化,过去主要围绕三个变量:模型单价、Prompt 长度和缓存命中率。现在,时间也进入了公式。
DeepSeek 当前官方价格页把工作日 9:00—12:00、14:00—18:00 定义为高峰时段,其余时间执行空闲价格;空闲时段价格为高峰的一半,周末全天落在空闲时段。对聊天产品影响有限,但对批量摘要、数据标注、代码扫描和无人值守 Agent 来说,这相当于增加了一个新的调度维度。

图 1:可延迟任务进入队列,在低谷时段调用;实时请求仍走在线通道。图片为原创示意图。
先区分“实时请求”和“可延迟任务”
错峰不是在所有 API 调用前加一个 sleep()。用户正在等待的客服问答、搜索增强和交互式编程,延迟几小时没有意义。真正适合错峰的是已经脱离用户会话的异步任务,例如:
- 每日知识库重建与向量化;
- 大批量文档摘要、分类和字段抽取;
- 夜间代码审查、日志分析与数据清洗;
- Agent 生成日报、周报和离线评测集。
第一步应给任务增加三个字段:最晚完成时间 deadline、是否允许降级 fallback、预估 Token 数 estimated_tokens。调度器据此决定立即执行、进入低谷队列,还是切换到更便宜的模型。
一个最小可用的错峰判断
下面用北京时间做一个简化示例。真实项目还要处理节假日、价格版本和任务积压,但核心逻辑已经足够清楚:
from datetime import datetime
from zoneinfo import ZoneInfo
def is_off_peak(now=None):
now = now or datetime.now(ZoneInfo("Asia/Shanghai"))
if now.weekday() >= 5: # 周六、周日
return True
hour = now.hour + now.minute / 60
return not (9 <= hour < 12 or 14 <= hour < 18)
def choose_action(task):
if task["realtime"] or is_off_peak():
return "run"
if task["can_delay"]:
return "queue"
return "fallback_model"
不要把峰谷规则永久写死在业务代码里。价格时段可能调整,模型也可能变更。更稳妥的做法是把“模型、价格版本、时区、峰谷窗口”放在配置中心,并在每次执行时记录实际使用的价格档位。
把价格表当成需要版本管理的数据
调度器不能只保存一个“当前价格”。同一任务可能在入队时看到旧规则,执行时已经切换到新规则;跨地区部署还会遇到时区和夏令时差异。建议为价格配置增加生效时间、来源链接、币种和版本号,结算日志同时保存当时使用的快照。
每次价格更新先在影子模式中回放历史任务,观察如果采用新规则,费用、排队时间和模型分布会怎样变化。确认没有大量任务错过截止时间,再正式启用。这样价格变化不会直接变成一次不可控的线上发布。
队列里最怕的不是等待,而是集中爆发
如果所有团队都把任务推迟到低谷开始的一分钟,队列会瞬间形成新的高峰。调度器需要加入随机抖动、并发上限和截止时间优先级,避免成千上万个任务同时出队。
还要考虑失败重试。一个任务在低谷时段启动,却因 429 或 5xx 连续重试到高峰,最终成本可能与预期不同。因此账单统计不能只看入队时间,而应记录服务端接收请求的实际时间、模型名、输入输出 Token、缓存命中与重试次数。
错峰之外,缓存通常更值得先做
峰谷价格只能影响单价,缓存和上下文治理能直接减少 Token 数量。系统提示词、工具定义、稳定知识和多轮历史如果每次重复发送,Agent 的调用链越长,浪费越明显。
优化顺序可以是:先去掉无关上下文,再提高缓存命中;随后按任务难度做模型路由;最后把可延迟任务移到低谷。只做错峰而不减少无效 Token,相当于把浪费搬到了便宜时段。
API 网关正在变成成本控制层
当团队同时调用多个模型,API 中转站或大模型 API 聚合平台不再只是转发请求。网关还需要识别任务类型、记录 Token、执行预算、选择模型,并在峰谷窗口之间调度流量。
近期 F5 公布的企业 AI 网关方案也把模型路由、语义缓存和 Token 归因放在同一控制层;其报告称,77% 的受访组织已把推理而非训练视为主要 AI 活动。这个供应商口径不能代表整个市场,却反映出基础设施关注点正从“能否接入模型”转向“如何管理每一次推理”。
国内项目做验证时,可以把算桥 API 这类统一模型入口接在调度层后面;如果某些夜间任务长期稳定、批量足够大,也可以在算家云这类 GPU 算力环境里部署开源模型。两者只是不同执行通道,路由依据仍应是截止时间、质量和单位成功成本。
如何判断错峰是否真的省钱?
至少观察四个指标:每个成功任务的 Token 成本、按时完成率、P95 排队时间和失败重试率。若费用下降却导致日报第二天仍未生成,或者低谷队列积压到工作时间,优化就没有业务价值。
还要注意,OpenRouter 的公开排名按 Token 量统计,Token 总量并不等于请求数、用户数或实际支出,不同模型的分词方式也不同。行业数据适合观察趋势,自己的调度决策仍要依赖内部日志。
峰谷定价真正改变的,不是“晚上一定更便宜”这条常识,而是让时间成为 AI 架构中的一等变量。下一代 Token 优化,不只会挑模型,也会挑时机。
本文为第三方技术分析,不构成价格或服务承诺。模型价格、峰谷时段和平台规则可能变化,请以官方实时页面为准。
更多推荐

所有评论(0)