
对于正在把大模型接入应用的团队来说,模型能力固然重要,但 API 调用成本仍是团队最关心的一项。尤其是 AI 编程、客服机器人、内容生成、代码辅助和 AI Agent 这类高频场景,单次请求便宜几厘钱看似不多,乘上每月数千万甚至数亿 Token 后,就会变成一笔不小的支出。
现在,这部分成本有望进一步下降。
DigitalOcean 近期对无服务器推理(Serverless Inference)中的多款模型进行了价格调整。本轮共有多款模型降价,涉及输入、输出和提示缓存三类计费项,整体降幅在 20%—50% 之间。
多款模型降价,最高降幅 50%
本轮价格调整覆盖 Qwen、DeepSeek、Meta、NVIDIA、小米和智谱 AI 等模型供应商。以下价格均以美元计价,单位为每 100 万 Token。
| 模型 | 计费项 | 原价格 | 新价格 | 降幅 |
|---|---|---|---|---|
| Qwen 3.5 397B A17B | 输入 | $0.385 | $0.302 | 21.56% |
| Qwen 3.5 397B A17B | 输出 | $2.450 | $1.925 | 21.43% |
| DeepSeek V4 Flash | 输入 | $0.112 | $0.084 | 25% |
| DeepSeek V4 Flash | 输出 | $0.224 | $0.168 | 25% |
| DeepSeek V4 Flash | 提示缓存 | $0.028 | $0.017 | 39.29% |
| DeepSeek V4 Pro | 输入 | $1.392 | $0.870 | 37.5% |
| DeepSeek V4 Pro | 输出 | $2.784 | $1.740 | 37.5% |
| DeepSeek V4 Pro | 提示缓存 | $0.348 | $0.174 | 50% |
| DeepSeek V3.2 | 输入 | $0.425 | $0.250 | 41.18% |
| DeepSeek V3.2 | 输出 | $1.360 | $0.800 | 41.18% |
| DeepSeek V3.2 | 提示缓存 | $0.150 | $0.075 | 50% |
| Llama 4 Maverick 17B 128E Instruct | 输入 | $0.250 | $0.200 | 20% |
| Llama 4 Maverick 17B 128E Instruct | 输出 | $0.870 | $0.696 | 20% |
| Nemotron-3-Super-120B | 输入 | $0.210 | $0.165 | 21.43% |
| Nemotron-3-Super-120B | 输出 | $0.455 | $0.358 | 21.32% |
| MiMo V2.5 Pro | 输入 | $0.600 | $0.400 | 33.33% |
| MiMo V2.5 Pro | 输出 | $3.000 | $1.500 | 50% |
| MiMo V2.5 Pro | 提示缓存 | $0.160 | $0.080 | 50% |
| GLM-5.2 | 输入 | $1.050 | $0.700 | 33.33% |
| GLM-5.2 | 输出 | $4.400 | $2.200 | 50% |
| GLM-5.2 | 提示缓存 | $0.210 | $0.120 | 42.86% |
从这张表可以看到,这次并不是只调整某一个供应商或某一档模型,而是同时覆盖了高性价比模型、通用大模型和偏高能力的 Pro 模型。开发团队可以根据任务难度,在不同模型之间重新做一次成本与性能的权衡。
除了以上模型,DigitalOcean 无服务器推理还提供多种模型,包括 Claude、GPT、Kimi K3、DeepSeek、Qwen、GLM、Llama 和 Nemotron 等主流模型系列。开发者可以通过统一的 OpenAI 兼容接口调用不同供应商的模型,无需分别注册账号、管理多套 API Key,也能更方便地根据任务效果、响应速度和调用成本切换模型。
注:本文价格来自本次价格调整表,均以美元计价。实际可用模型、功能及账单金额请以 DigitalOcean 控制台和官方定价页面为准。具体也可直接咨询 DigitalOcean 中国区战略合作伙伴卓普云AI Droplet。
与模型官方 API 相比,DigitalOcean 的价格如何?
降价之后,DigitalOcean Serverless Inference 的部分模型不仅比此前更便宜,与模型厂商官方 API 相比也出现了明显的价格优势。下面进一步对比部分模型在 DigitalOcean 当前价格与各模型官方的价格。表中金额均为每 100 万 Token 的美元价格,“DO / 官方”表示前者为 DigitalOcean 价格、后者为模型厂商官方价格。
| 模型 | 输入:DO / 官方 | 输出:DO / 官方 | 缓存:DO / 官方 |
|---|---|---|---|
| DeepSeek V4 Flash | $0.084 / $0.140 | $0.168 / $0.280 | $0.017 / $0.0028 |
| GLM 5 | $0.750 / $1.000 | $2.400 / $3.200 | $0.200 / $0.200 |
| GLM-5.1 | $0.975 / $1.400 | $4.300 / $4.400 | $0.260 / $0.260 |
| GLM-5.2 | $0.700 / $1.400 | $2.200 / $4.400 | $0.120 / $0.260 |
| Kimi K2.5 | $0.375 / $0.600 | $2.025 / $3.000 | $0.203 / $0.100 |
| Kimi K2.6 | $0.760 / $0.950 | $3.200 / $4.000 | $0.190 / $0.160 |
| Kimi K3 | $3.000 / $3.000 | $15.000 / $15.000 | $0.300 / $0.300 |
| MiniMax M2.5 | $0.225 / $0.300 | $0.900 / $1.200 | $0.060 / $0.030 |
| Qwen3-32B | $0.250 / $0.287 | $0.550 / $1.147 | 无 / 官方不支持 |
从输入和输出价格来看,表中多款在 DigitalOcean 上低于官方价格。其中,GLM-5.2 的输入和输出价格均比官方低 50%,缓存价格低约 53.85%;Qwen3-32B 的输出价格比官方低约 52.05%;DeepSeek V4 Flash 的输入和输出价格均低 40%。Kimi K3 的三项价格则与官方一致。
哪些应用受益更明显?
首先是输出内容较长的应用,例如文案生成、报告撰写、代码生成和深度问答。MiMo V2.5 Pro 与 GLM-5.2 的输出价格都直接减半;当输出 Token 在总用量中占比较高时,账单下降会非常直观。
其次是使用固定长提示词的 AI Agent 和企业知识助手。这类应用通常会在每次请求中重复发送系统提示词、工具说明、角色设定或较长的公共上下文。如果模型支持并命中提示缓存,缓存价格下降可以进一步压低重复输入的成本。DeepSeek V4 Pro、DeepSeek V3.2 和 MiMo V2.5 Pro 的提示缓存价格此次均下降 50%。
另外,对于需要处理海量轻量任务的业务,例如商品信息整理、工单分类、内容审核、标签提取和批量摘要,DeepSeek V4 Flash 的新输入价格仅为每 100 万 Token 0.084 美元,输出价格为 0.168 美元。这类任务单次调用量不大,但请求规模往往很高,因此单位 Token 成本的下降同样值得关注。
当然,模型价格并不是选型的唯一标准。正式切换前,仍应结合自己的真实数据集,对回答质量、首 Token 延迟、整体响应时间、结构化输出稳定性和工具调用能力进行测试。更合理的做法不是简单选择“最便宜的模型”,而是让不同难度的任务使用与之匹配的模型。
什么是 DigitalOcean 无服务器推理?
这里给一些还不太熟悉 DigitalOcean 云平台的用户介绍一下。
DigitalOcean 无服务器推理是一项托管式模型推理服务。开发者可以直接通过 API 调用基础模型,不需要购买 GPU、部署推理框架,也不需要自己处理扩缩容、模型升级和底层基础设施运维。目前,DigitalOcean Inference 提供 70 多款模型。
简单来说,它把“搭建并维护一套大模型推理服务”变成了“调用一个 API”。
Serverless Inference 按实际使用量计费。对于文本模型,费用通常由输入 Token、输出 Token 以及提示缓存构成;没有请求时,不需要为闲置 GPU 持续付费。因此,它更适合希望快速接入模型、流量存在波峰波谷、需要频繁尝试不同模型,或暂时不想维护推理基础设施的团队。
开发者还可以先在DigitalOcean 的 Model Playground 中测试和比较模型,再通过统一接口接入应用。随着模型目录持续扩展,团队不必为每一家模型供应商分别维护一套调用方式、账号和基础设施,也更容易根据效果、速度与价格调整模型组合。
此外,DigitalOcean 还提供 Inference Router(推理路由器)。开发者可以把多款模型加入同一个路由器,通过统一端点调用,并根据成本、响应速度或任务类型,将请求自动分配给更合适的模型。当首选模型不可用时,还可以切换至备用模型。这样既能避免所有任务都调用价格较高的大模型,也能减少模型切换、故障回退和多套 API 接口带来的开发工作,尤其适合需要同时使用多款模型的 AI Agent 和生产级应用。
相关产品与选型



