卓普云

GLM 5.3 已上线 DigitalOcean AI 推理云平台:Agent 任务的高性价比底座来了

GLM-5.3-Flash 上线 DigitalOcean 推理引擎:3200 亿参数,每 Token 仅激活 180 亿,输入价格低至每百万 0.15 美元,比上代降约 90%,适合 Agent 与多模态任务。

2026年8月28日
GLM 5.3 已上线 DigitalOcean AI 推理云平台:Agent 任务的高性价比底座来了

GLM-5.3-Flash 已上线 DigitalOcean AI 推理云平台:3200 亿参数、每 Token 仅激活 180 亿参数,支持 100 万 Token 上下文与原生图像/视频输入。DigitalOcean 调用价格低至每百万输入 Token 0.15 美元,并支持统一 API、多模型路由与模型评估。

Z.ai 最新发布的 GLM-5.3-Flash 现已上线 DigitalOcean Inference Engine(推理引擎),开发者可以直接通过 DigitalOcean 无服务器推理(Serverless Inference) 调用,无需自己部署和维护 GPU 推理集群。

如果你之前关注过 OpenRouter 和 OpenCode 上那个没有公开身份的 Ox Alpha,现在谜底也揭晓了:它就是 GLM-5.3-Flash。正式发布之后,这款模型在架构、长上下文和 Agent 能力上的定位也更加清晰。

GLM-5.3-Flash 采用 3200 亿参数 MoE(混合专家)架构,但每生成一个 Token 仅激活约 180 亿参数。它同时也是 GLM-5 系列中首款原生多模态模型,可以直接接收文本、图片和视频输入,并支持最高 100 万 Token 上下文

更值得关注的是价格。目前 GLM-5.3-Flash 在 DigitalOcean 无服务器推理上的价格为每百万输入 Token 0.15 美元、输出 Token 0.50 美元。相比 GLM-5.2 的 1.40/4.40 美元,输入和输出价格都下降了接近 90%。

而且,DigitalOcean 并不是只提供一个 GLM-5.3-Flash API。开发者还可以通过同一套 API 接入平台上的 70 多款模型,并将 GLM-5.3-Flash 加入 Inference Router,与 Claude、GPT、DeepSeek、Qwen、Kimi 等模型一起,根据任务、成本和延迟选择更合适的模型。

对于正在做 AI Coding、Agent、长文档处理或者多模态应用的团队来说,这让 GLM-5.3-Flash 不只是一个值得测试的新模型,也可以成为现有多模型架构中的一个高性价比节点。

3200 亿参数,但每个 Token 只激活 180 亿

GLM-5.3-Flash 是一个 Mixture-of-Experts(MoE,混合专家)模型

它拥有约 3200 亿总参数,但处理每个 Token 时只会激活其中约 180 亿参数

这个数字甚至比此前 GLM-4.5 系列的 320 亿激活参数还要低。

对推理服务来说,这一点非常重要。3200 亿总参数、每个 Token 只激活 180 亿”意味着:模型拥有 3200 亿参数的总容量,但每次推理只调用其中一部分专家网络。这样做的核心好处是,可以在保留大模型容量的同时,把每个 Token 的实际计算量压下来

模型总参数量决定了它能够容纳多大的知识和能力,而每次真正参与计算的激活参数,则会直接影响推理所需的算力、显存带宽以及最终成本。

GLM-5.3-Flash 更进一步的地方,在于它针对长上下文推理重新设计了 Attention 架构。

根据 Z.ai 官方介绍,模型采用了稀疏注意力(Sparse Attention)与线性注意力(Linear Attention)结合的混合架构

  • Linear Attention 负责处理局部依赖关系;
  • Sparse Attention 则通过轻量级索引器检索全局上下文中真正相关的信息。

为了进一步减少 100 万 Token 上下文下的内存和延迟开销,GLM-5.3-Flash 还引入了 IndexPool,将四个 Indexer Key Vector 压缩为一个。

根据 Z.ai 公布的数据,与 GLM-5.3 相比,这套架构可以让 Attention 计算量降低约 3 倍,KV Cache 大小减少约 4.4 倍

简单来说,GLM-5.3-Flash 并不是单纯把大模型“做小一点”,而是在模型结构层面专门针对长上下文和低成本推理做了优化。

这也是它名字里“Flash”真正重要的地方。

100 万 Token 上下文,更适合代码库和长周期 Agent

GLM-5.3-Flash 支持最高 1,048,576 Token,也就是约 100 万 Token 的上下文窗口

对于普通聊天应用来说,这么大的上下文可能用不上。但在 AI Coding 和 Agent 场景中,情况完全不同。

例如让一个 Coding Agent 修改真实项目,它可能需要同时读取:

  • 大量源代码文件
  • README 和项目文档
  • API 定义
  • 数据库 Schema
  • 测试代码
  • Git Diff
  • 编译和运行日志
  • Agent 此前几十轮的工具调用结果

如果上下文窗口太小,Agent 就需要不断压缩、裁剪或者重新检索这些信息。一旦关键代码或者早期任务状态被丢掉,后面的判断就容易出现偏差。

100 万 Token 上下文意味着,可以让模型在一次任务过程中保留更多代码、文档和历史信息。

除了 Coding Agent,这种能力也比较适合:

  • 大型技术文档分析
  • 企业知识库
  • 合同与财务文档处理
  • 研究资料分析
  • 长周期 Agent 工作流
  • 大型代码仓库理解

当然,100 万 Token 并不意味着每个请求都应该塞进去 100 万 Token。长上下文仍然会增加延迟和推理费用。

真正重要的是,当任务确实需要完整上下文时,应用不必因为模型窗口太小而被迫提前裁剪大量信息。

GLM-5 系列首款原生多模态模型

相比 GLM-5.2,GLM-5.3-Flash 还有一个很明显的变化:

它不再只是文本模型。

GLM-5.3-Flash 是 Z.ai 在 GLM-5 系列中的首款原生多模态模型,可以同时接收:

文本、图片和视频。

DigitalOcean 无服务器推理中提供的 GLM-5.3-Flash API 同样支持文本、图像和视频输入。

这使得它能够处理一些传统纯文本 Agent 很难完成的任务。

例如,Coding Agent 不仅可以读取代码,还可以查看:

  • UI 截图
  • 网页页面
  • 数据图表
  • 设计稿
  • 视频内容
  • 软件运行结果

Z.ai 甚至展示了一些更加复杂的 Agent 工作流:模型读取设计图之后,通过代码调用 Blender、build123d 等工具生成 3D 场景或者 CAD 模型,随后再查看渲染结果,根据视觉反馈继续修改自己的代码。

这里比较值得关注的并不是“AI 能不能做 3D 建模”本身,而是背后的 Agent 工作方式发生了变化:

模型可以执行任务,然后真正“看见”自己的执行结果,再决定下一步做什么。

这对于 Computer Use、Browser Agent、设计自动化以及需要视觉反馈的 AI Agent 来说,会比单纯的文字输入更加实用。

AI Coding 和 Agent 能力提升明显

从 Z.ai 公布的 Benchmark 来看,GLM-5.3-Flash 的重点也非常明确:AI Coding 和 Agent。

几个比较值得关注的数据如下:

BenchmarkGLM-5.3-FlashGLM-5.2
Terminal-Bench 2.184.381.0
DeepSWE v1.163.446.2
Toolathlon Verified78.459.9
AutomationBench48.826.2
Agents' Last Exam26.320.4

数据来自 Z.ai 官方公布的 GLM-5.3-Flash Benchmark

其中比较明显的是 DeepSWE v1.1

GLM-5.3-Flash 从 GLM-5.2 的 46.2 分提高到了 63.4 分,说明它在真实软件工程任务上的提升并不只是几个百分点。

AutomationBench 的变化甚至更大,从 26.2 提升到了 48.8

这类 Benchmark 更值得 Agent 开发者关注,因为它测试的不只是“一次回答一道编程题”,而是模型在复杂环境里进行规划、使用工具、观察结果、继续执行任务的能力。

当然,Benchmark 并不能直接等同于生产环境体验。

不同 Coding Agent 框架、System Prompt、工具权限、推理参数甚至代码运行环境,都可能明显影响最终结果。

因此,更适合生产环境的做法不是看到某个 Benchmark 第一名就直接换模型,而是使用自己的真实任务进行测试。

这一点恰好也是 DigitalOcean 这次提供 GLM-5.3-Flash 时比较有意思的地方,后面我们还会提到它的 Model Evaluations

每百万输入 Token 仅 0.15 美元

如果说能力提升只是 GLM-5.3-Flash 的一半,那么另一半就是价格。

目前 GLM-5.3-Flash 在 DigitalOcean 无服务器推理上的价格为:

模型输入 / 百万 Token输出 / 百万 Token
GLM-5.3-Flash0.15 美元0.50 美元
GLM-5.21.40 美元4.40 美元

另外,GLM-5.3-Flash 的 Prompt Cache Read 价格目前为每百万 Token 0.15 美元

相比 GLM-5.2,GLM-5.3-Flash 的输入价格下降约 89%,输出价格下降约 89%

这对于 Agent 场景尤其重要。

普通聊天可能只调用模型一次,但一个 Agent 为了完成任务,可能需要连续进行几十次甚至数百次模型调用。

它可能先分析任务,再搜索文件,然后读取代码、修改代码、运行测试、读取错误日志、再次修改……

调用次数一旦上去,每百万 Token 几美元和几毛钱之间的差距就会迅速放大。

也正因为如此,GLM-5.3-Flash 更适合一种越来越常见的需求:

不一定每次都追求最强的旗舰模型,而是希望找到一个能够承担大量日常 Agent 任务,同时成本足够低的模型。

一个 API,可以同时接入 70 多款模型

如果应用只准备使用 GLM-5.3-Flash,一个 Serverless Inference API 就已经够用了。

但实际生产环境往往不会这么简单。

一个 AI 产品里可能同时存在:

  • 简单文本分类
  • 内容摘要
  • 图片理解
  • 长上下文分析
  • Coding
  • Tool Calling
  • 深度推理
  • Agent 自动化

这些任务全部交给同一个模型,通常并不是最优解。

DigitalOcean 推理平台目前提供 70 多款模型,覆盖 OpenAI、Claude、DeepSeek、Qwen、Kimi、GLM、Llama、Nemotron 等多个模型系列。

对于应用开发者来说,一个比较直接的好处是:

可以使用同一套 API 接入这些模型。

不需要为了测试一个新模型,就重新对接一个平台、维护另一套 SDK 和鉴权逻辑。

而如果业务已经开始同时使用多个模型,还可以进一步使用 DigitalOcean Inference Router(推理路由器)

例如:

简单分类和格式转换 → 低成本模型

日常 Coding 和 Agent → GLM-5.3-Flash

超复杂代码任务 → 更强的旗舰模型

长文档任务 → 长上下文模型

DigitalOcean Inference Router 可以根据成本、延迟或者任务类型,把不同请求分配给更加合适的模型。

这样 GLM-5.3-Flash 就不一定需要成为应用里“唯一的模型”,而可以成为整个 AI 推理架构中的一个重要节点。

尤其考虑到它目前每百万输入 Token 0.15 美元、输出 0.50 美元的价格,它很适合承担大量对能力有一定要求、但又没必要每次调用最贵模型的任务。

不确定哪个模型最好?还可以让多个模型一起回答

除了推理路由之外,DigitalOcean 现在还有一种更特别的多模型用法:Model Synthesis(多模型融合)

它的逻辑和路由不太一样。

推理路由是:

从多个模型中选择一个模型处理这次请求。

而 Model Synthesis 则是:

让多个模型同时处理同一个问题,再由一个更高层的模型综合不同结果,最终给出一个答案。

DigitalOcean 当前支持最多选择 8 个分析模型并行处理请求,再由一个顶层模型生成最终结果。

例如,在一个复杂研究任务中,可以同时让 GLM-5.3-Flash、Qwen、DeepSeek 和 Claude 分别分析问题,再综合它们的结果。

当然,这种方法因为一次请求实际上调用了多个模型,所以成本和延迟都会明显高于普通单模型推理,并不适合所有场景。

它更适合高价值、低频率、对答案质量要求比较高的复杂分析和研究任务。

在 DigitalOcean 上,不需要自己部署 3200 亿参数模型

虽然 GLM-5.3-Flash 每次只激活 180 亿参数,但不要把“18B Active Parameters”理解成它就是一个普通 18B 模型。

它仍然拥有 3200 亿总参数

如果自己部署,模型权重、KV Cache、长上下文、多 GPU 并行、推理框架、量化、并发调度以及高可用都需要自己处理。

而且,对于支持图片和视频输入的多模态模型,生产部署还会涉及额外的编码和推理链路。

DigitalOcean 这次提供的是 Serverless Inference(无服务器推理)

也就是说,开发者不需要:

  • 自己租用和配置多张 GPU
  • 下载和维护模型权重
  • 部署 vLLM / SGLang 等推理框架
  • 配置 Tensor Parallel
  • 处理 GPU 扩缩容
  • 维护多模态推理服务
  • 为低谷期闲置的 GPU 持续付费

直接通过 API 调用,按照实际 Token 使用量计费即可。

DigitalOcean 中国区企业用户如果需要测试 GLM-5.3-Flash、评估 Token 成本、迁移现有 OpenAI API 应用,或者规划无服务器推理、推理路由器与 GPU 部署方案,也可以联系 DigitalOcean 中国区战略合作伙伴卓普云 AI Droplet(aidroplet.com)获取中文技术支持。

相关产品与选型

把教程落到可用的云资源上

相关文章

面向 AI 工作负载,单核性能提升 30%:DigitalOcean v5 Droplets 云服务器正式上线
精选
产品更新

面向 AI 工作负载,单核性能提升 30%:DigitalOcean v5 Droplets 云服务器正式上线

DigitalOcean 推出 v5 Droplets,基于第五代 AMD EPYC 处理器,性能提升最高 30%,支持独立选择 CPU、内存和存储,按需付费。

2026年8月27日
DigitalOcean 推理路由器新增缓存感知能力:为什么最便宜的模型不一定最省钱
精选
产品更新

DigitalOcean 推理路由器新增缓存感知能力:为什么最便宜的模型不一定最省钱

在AI支出暴涨背景下,DigitalOcean推理路由器新增缓存感知能力,通过模型亲和性与切换预算保留热缓存价值,避免因模型切换增加成本与延迟,助力企业平衡成本、质量与延迟。

2026年8月24日
Qwen 3.8 已上线 DigitalOcean AI 推理云平台
产品更新

Qwen 3.8 已上线 DigitalOcean AI 推理云平台

Qwen3.8-2.4T-A95B 已上线 DigitalOcean 推理云,支持 100 万 Token 上下文,并可通过统一 API 接入多款模型,结合推理路由器按任务灵活分配模型,兼顾复杂任务能力与整体推理成本。

2026年8月13日