卓普云
新闻精选

多款模型最高直降 50%:DigitalOcean 无服务器推理大降价

DigitalOcean Serverless Inference 下调 7 款主流模型价格,覆盖 DeepSeek、Qwen、GLM、Llama、Nemotron 和 MiMo,最高降幅达到 50%。

2026年8月6日
多款模型最高直降 50%:DigitalOcean 无服务器推理大降价

对于正在把大模型接入应用的团队来说,模型能力固然重要,但 API 调用成本仍是团队最关心的一项。尤其是 AI 编程、客服机器人、内容生成、代码辅助和 AI Agent 这类高频场景,单次请求便宜几厘钱看似不多,乘上每月数千万甚至数亿 Token 后,就会变成一笔不小的支出。

现在,这部分成本有望进一步下降。

DigitalOcean 近期对无服务器推理(Serverless Inference)中的多款模型进行了价格调整。本轮共有多款模型降价,涉及输入、输出和提示缓存三类计费项,整体降幅在 20%—50% 之间。

多款模型降价,最高降幅 50%

本轮价格调整覆盖 Qwen、DeepSeek、Meta、NVIDIA、小米和智谱 AI 等模型供应商。以下价格均以美元计价,单位为每 100 万 Token。

模型计费项原价格新价格降幅
Qwen 3.5 397B A17B输入$0.385$0.30221.56%
Qwen 3.5 397B A17B输出$2.450$1.92521.43%
DeepSeek V4 Flash输入$0.112$0.08425%
DeepSeek V4 Flash输出$0.224$0.16825%
DeepSeek V4 Flash提示缓存$0.028$0.01739.29%
DeepSeek V4 Pro输入$1.392$0.87037.5%
DeepSeek V4 Pro输出$2.784$1.74037.5%
DeepSeek V4 Pro提示缓存$0.348$0.17450%
DeepSeek V3.2输入$0.425$0.25041.18%
DeepSeek V3.2输出$1.360$0.80041.18%
DeepSeek V3.2提示缓存$0.150$0.07550%
Llama 4 Maverick 17B 128E Instruct输入$0.250$0.20020%
Llama 4 Maverick 17B 128E Instruct输出$0.870$0.69620%
Nemotron-3-Super-120B输入$0.210$0.16521.43%
Nemotron-3-Super-120B输出$0.455$0.35821.32%
MiMo V2.5 Pro输入$0.600$0.40033.33%
MiMo V2.5 Pro输出$3.000$1.50050%
MiMo V2.5 Pro提示缓存$0.160$0.08050%
GLM-5.2输入$1.050$0.70033.33%
GLM-5.2输出$4.400$2.20050%
GLM-5.2提示缓存$0.210$0.12042.86%

从这张表可以看到,这次并不是只调整某一个供应商或某一档模型,而是同时覆盖了高性价比模型、通用大模型和偏高能力的 Pro 模型。开发团队可以根据任务难度,在不同模型之间重新做一次成本与性能的权衡。

除了以上模型,DigitalOcean 无服务器推理还提供多种模型,包括 Claude、GPT、Kimi K3、DeepSeek、Qwen、GLM、Llama 和 Nemotron 等主流模型系列。开发者可以通过统一的 OpenAI 兼容接口调用不同供应商的模型,无需分别注册账号、管理多套 API Key,也能更方便地根据任务效果、响应速度和调用成本切换模型。

注:本文价格来自本次价格调整表,均以美元计价。实际可用模型、功能及账单金额请以 DigitalOcean 控制台和官方定价页面为准。具体也可直接咨询 DigitalOcean 中国区战略合作伙伴卓普云AI Droplet

与模型官方 API 相比,DigitalOcean 的价格如何?

降价之后,DigitalOcean Serverless Inference 的部分模型不仅比此前更便宜,与模型厂商官方 API 相比也出现了明显的价格优势。下面进一步对比部分模型在 DigitalOcean 当前价格与各模型官方的价格。表中金额均为每 100 万 Token 的美元价格,“DO / 官方”表示前者为 DigitalOcean 价格、后者为模型厂商官方价格。

模型输入:DO / 官方输出:DO / 官方缓存:DO / 官方
DeepSeek V4 Flash$0.084 / $0.140$0.168 / $0.280$0.017 / $0.0028
GLM 5$0.750 / $1.000$2.400 / $3.200$0.200 / $0.200
GLM-5.1$0.975 / $1.400$4.300 / $4.400$0.260 / $0.260
GLM-5.2$0.700 / $1.400$2.200 / $4.400$0.120 / $0.260
Kimi K2.5$0.375 / $0.600$2.025 / $3.000$0.203 / $0.100
Kimi K2.6$0.760 / $0.950$3.200 / $4.000$0.190 / $0.160
Kimi K3$3.000 / $3.000$15.000 / $15.000$0.300 / $0.300
MiniMax M2.5$0.225 / $0.300$0.900 / $1.200$0.060 / $0.030
Qwen3-32B$0.250 / $0.287$0.550 / $1.147无 / 官方不支持

从输入和输出价格来看,表中多款在 DigitalOcean 上低于官方价格。其中,GLM-5.2 的输入和输出价格均比官方低 50%,缓存价格低约 53.85%;Qwen3-32B 的输出价格比官方低约 52.05%;DeepSeek V4 Flash 的输入和输出价格均低 40%。Kimi K3 的三项价格则与官方一致。

哪些应用受益更明显?

首先是输出内容较长的应用,例如文案生成、报告撰写、代码生成和深度问答。MiMo V2.5 Pro 与 GLM-5.2 的输出价格都直接减半;当输出 Token 在总用量中占比较高时,账单下降会非常直观。

其次是使用固定长提示词的 AI Agent 和企业知识助手。这类应用通常会在每次请求中重复发送系统提示词、工具说明、角色设定或较长的公共上下文。如果模型支持并命中提示缓存,缓存价格下降可以进一步压低重复输入的成本。DeepSeek V4 Pro、DeepSeek V3.2 和 MiMo V2.5 Pro 的提示缓存价格此次均下降 50%。

另外,对于需要处理海量轻量任务的业务,例如商品信息整理、工单分类、内容审核、标签提取和批量摘要,DeepSeek V4 Flash 的新输入价格仅为每 100 万 Token 0.084 美元,输出价格为 0.168 美元。这类任务单次调用量不大,但请求规模往往很高,因此单位 Token 成本的下降同样值得关注。

当然,模型价格并不是选型的唯一标准。正式切换前,仍应结合自己的真实数据集,对回答质量、首 Token 延迟、整体响应时间、结构化输出稳定性和工具调用能力进行测试。更合理的做法不是简单选择“最便宜的模型”,而是让不同难度的任务使用与之匹配的模型。

什么是 DigitalOcean 无服务器推理?

这里给一些还不太熟悉 DigitalOcean 云平台的用户介绍一下。

DigitalOcean 无服务器推理是一项托管式模型推理服务。开发者可以直接通过 API 调用基础模型,不需要购买 GPU、部署推理框架,也不需要自己处理扩缩容、模型升级和底层基础设施运维。目前,DigitalOcean Inference 提供 70 多款模型。

简单来说,它把“搭建并维护一套大模型推理服务”变成了“调用一个 API”。

Serverless Inference 按实际使用量计费。对于文本模型,费用通常由输入 Token、输出 Token 以及提示缓存构成;没有请求时,不需要为闲置 GPU 持续付费。因此,它更适合希望快速接入模型、流量存在波峰波谷、需要频繁尝试不同模型,或暂时不想维护推理基础设施的团队。

开发者还可以先在DigitalOcean 的 Model Playground 中测试和比较模型,再通过统一接口接入应用。随着模型目录持续扩展,团队不必为每一家模型供应商分别维护一套调用方式、账号和基础设施,也更容易根据效果、速度与价格调整模型组合。

此外,DigitalOcean 还提供 Inference Router(推理路由器)。开发者可以把多款模型加入同一个路由器,通过统一端点调用,并根据成本、响应速度或任务类型,将请求自动分配给更合适的模型。当首选模型不可用时,还可以切换至备用模型。这样既能避免所有任务都调用价格较高的大模型,也能减少模型切换、故障回退和多套 API 接口带来的开发工作,尤其适合需要同时使用多款模型的 AI Agent 和生产级应用。

相关产品与选型

把教程落到可用的云资源上

相关文章

RadixArk 在 DigitalOcean 上实现 DeepSeek V4 吞吐量提升 10 倍
新闻

RadixArk 在 DigitalOcean 上实现 DeepSeek V4 吞吐量提升 10 倍

每 GPU 每秒 3.5K+ token,吞吐量提升 10 倍:RadixArk 在 DigitalOcean 上的 DeepSeek V4 高性能实践

2026年7月15日
Laravel 开发者已在 DigitalOcean 上开通超过 10 万台服务器
新闻

Laravel 开发者已在 DigitalOcean 上开通超过 10 万台服务器

Laravel 依托 DigitalOcean 基础设施,通过 Forge 和 VPS 为开发者提供快速部署,已开通超 10 万台服务器,并持续深化 AI 工具与托管服务集成。

2026年6月23日
AI 创新先锋 Probably 携手 DigitalOcean 打造“本地优先”可验证智能体架构
新闻

AI 创新先锋 Probably 携手 DigitalOcean 打造“本地优先”可验证智能体架构

依托 DigitalOcean AI 原生云,Probably 实现基础设施成本直降 25% 与天半极速上线,筑牢企业级数据隐私防线

2026年6月16日