卓普云

Qwen 3.8 已上线 DigitalOcean AI 推理云平台

Qwen3.8-2.4T-A95B 已上线 DigitalOcean 推理云,支持 100 万 Token 上下文,并可通过统一 API 接入多款模型,结合推理路由器按任务灵活分配模型,兼顾复杂任务能力与整体推理成本。

2026年8月13日
Qwen 3.8 已上线 DigitalOcean AI 推理云平台

阿里通义千问新一代旗舰模型 Qwen3.8-2.4T-A95B 现已上线 DigitalOcean Inference Engine(推理引擎),并可通过 DigitalOcean 无服务器推理(Serverless Inference)直接调用。

根据官方所说,这次上线的并不是一款“小修小补”的 Qwen 模型。Qwen3.8-2.4T-A95B 采用 2.4 万亿参数 MoE(混合专家)架构,每次推理激活约 950 亿参数,重点面向长上下文、AI 编程以及 Agent 智能体等复杂工作负载。

尤其值得注意的是,它最高支持 100 万 Token 上下文,在代码、工具调用和智能体任务上的表现已经进入当前前沿大模型梯队,而 DigitalOcean 上的调用价格为每百万输入 Token 2 美元、输出 Token 6 美元

单看价格,Qwen 3.8 未必是市场上最便宜的选择。但 DigitalOcean 的优势并不只是提供一个 Qwen 3.8 API,而是可以让开发者通过同一套 API 接入平台上的多个模型。如果你的应用还需要同时使用 DeepSeek v4、Kimi K3GLM 5.2Claude Fable5GPT-5.6 等不同模型,不需要分别维护多套 SDK、鉴权和调用逻辑,只需要在同一个推理接口中切换模型即可。

进一步来说,Qwen 3.8 还可以加入 DigitalOcean Inference Router(推理路由器)。对于 AI Coding、Agent 这类会频繁调用模型的应用,可以把简单分类、摘要、格式转换等任务交给成本更低的模型,而把复杂代码生成、长上下文分析和多步骤推理交给 Qwen 3.8。这样可以避免所有请求都固定使用旗舰模型,在保证复杂任务效果的同时,把整体推理成本控制在更合理的范围。

对于想尝试超大规模开源模型,但又不准备自己搭建多 GPU 推理集群的团队来说,现在不仅可以直接通过 API 使用 Qwen 3.8,也可以把它作为多模型架构中的一个高能力节点,根据实际任务灵活选择模型。

2.4 万亿参数,Qwen 3.8 更偏向复杂任务和 Agent

Qwen3.8-2.4T-A95B 是一个 Mixture-of-Experts(MoE,混合专家)模型

它拥有约 2.4 万亿总参数,但在处理一次请求时并不会把全部参数都激活,而是根据任务选择其中约 950 亿参数参与计算。

这种设计的意义在于:模型可以继续扩大整体参数规模和知识容量,同时避免每生成一个 Token 都执行完整的 2.4 万亿参数计算。

相比把所有任务都交给一个稠密大模型,MoE 架构更适合在模型能力与推理成本之间寻找平衡。

而从 Qwen 3.8 的能力侧重点来看,它显然也不是主要面向普通聊天场景,而是进一步瞄准了目前大模型最重要的几个生产级方向:

  • AI 编程与代码 Agent
  • 长文档与大型代码库分析
  • 多步骤复杂推理
  • 工具调用
  • Agent 智能体工作流
  • 企业级自动化任务

换句话说,如果你的业务只是简单摘要、分类或者客服问答,未必需要每个请求都使用这样的大模型。

但如果任务开始涉及理解整个代码仓库、操作终端、调用工具、持续执行几十甚至上百步任务,Qwen 3.8 这种模型的优势就会更加明显。

最高 100 万 Token 上下文,可以一次读入更大的代码库和文档

Qwen3.8-2.4T-A95B 最值得关注的一项能力,是最高 100 万 Token 的上下文窗口

对于普通聊天应用来说,几十万甚至 100 万 Token 可能显得有些过剩,但对于 AI Coding 和 Agent 场景,这类长上下文正在变得越来越重要。

例如,让一个代码 Agent 修复 Bug 时,它需要理解的内容可能不只是一个源代码文件,而是:

  • 整个代码仓库
  • README 和技术文档
  • API 定义
  • 数据库 Schema
  • Git 历史
  • 测试代码
  • 错误日志
  • 用户提出的修改要求

过去比较常见的方法,是先通过 RAG、代码索引或者分块检索,从代码库中挑选部分内容发送给模型。

这种架构仍然非常重要,但检索本身也可能漏掉真正关键的上下文。

更大的上下文窗口意味着,在一些任务中可以直接把更多相关代码、文档和历史记录放进一次推理,让模型在更完整的信息环境下进行判断。

类似的优势也适用于合同分析、科研论文、企业知识库、日志分析以及大型技术文档处理。

AI 编程和 Agent 能力进入第一梯队

根据 Qwen 官方公布的 benchmark,Qwen3.8-2.4T-A95B 在多项 Agent 和代码相关测试中已经具备很强的竞争力。

其中几个比较值得关注的数据包括:

BenchmarkQwen3.8-2.4T-A95B
PaperBench93.0
IFBench82.8
Terminal-Bench 2.186.6
SWE-bench Pro67.7

其中 Terminal-Bench 2.1 主要测试模型在真实终端环境中完成复杂任务的能力。

Qwen 3.8 获得 86.6 分,高于 Claude Opus 4.8 / Fable 5 的 84.6,不过仍低于 GPT-5.6 Sol 的 88.8。

这意味着,在 Shell 命令执行、环境操作以及 Agent 自动化任务上,Qwen 3.8 已经进入当前顶级模型的竞争区间。

当然,这并不意味着 Qwen 3.8 在所有编程测试上都已经领先闭源模型。

例如在更强调真实软件工程问题解决能力的 SWE-bench Pro 中,Qwen 3.8 得分为 67.7,而 Fable 5 为 80.0。

因此,更准确的理解应该是:

Qwen 3.8 并不是简单地“全面超过某个闭源模型”,而是在部分 Agent、长上下文和工具使用任务上已经具备非常强的竞争力,同时价格明显更低。

对于生产环境来说,这其实比单纯比较一个综合跑分更加重要。

每百万输入 Token 2 美元,输出仅 6 美元

大模型真正进入生产环境之后,性能只是问题的一半,另一半往往是成本。

目前 Qwen3.8-2.4T-A95B 在 DigitalOcean 无服务器推理上的价格为:

模型输入 / 百万 Token输出 / 百万 Token
Qwen3.8-2.4T-A95B2 美元6 美元
Claude Fable 510 美元50 美元

也就是说,在公开价格下,Qwen 3.8:

输入 Token 价格约为 Fable 5 的 1/5,输出 Token 价格约为其 12%。

对于普通聊天任务,这种价格差距可能只是每次请求几分钱甚至更低。

但在 Agent 场景中,情况会完全不同。

一个 Agent 为了完成任务,可能连续运行几十次甚至几百次模型调用,还会反复读取代码、工具结果和历史上下文。

一旦请求规模扩大到每天数百万、数千万甚至更多 Token,模型之间几倍的单价差异最终就会变成非常明显的基础设施成本。

因此,Qwen 3.8 比较适合一种很现实的需求:

希望获得接近前沿模型的 Agent 和代码能力,同时不希望所有请求都按照顶级闭源模型的价格计费。

在 DigitalOcean 上,不需要自己部署 2.4 万亿参数模型

2.4 万亿参数听起来很强,但另一个问题也随之而来:

自己部署到底需要多少 GPU?

这种规模的模型已经明显不是租一两张 GPU 就能轻松处理的模型。

除了模型权重之外,生产级部署还需要考虑 KV Cache、并发请求、推理框架、跨 GPU 通信、量化方式、显存利用率以及高可用等问题。

而且,把模型“加载起来”和真正提供稳定的生产级 API,也是完全不同的两件事。

DigitalOcean 这次为 Qwen3.8-2.4T-A95B 提供的是无服务器推理

开发者不需要:

  • 自己采购或租用多张 GPU
  • 部署和维护推理框架
  • 配置多 GPU 并行
  • 处理模型更新
  • 管理推理集群扩缩容
  • 为 GPU 空闲时间持续付费

直接通过 API 调用即可,并按照实际消耗的 Token 计费。

对于还处于测试、产品早期或者请求量波动比较明显的团队来说,这通常比一开始就维持一个大型 GPU 集群更加灵活。

DigitalOcean 中国区企业用户如果需要测试 Qwen 3.8、评估 Token 成本、迁移现有 OpenAI API 应用,或者规划 Serverless Inference、Inference Router 与 GPU 部署方案,也可以联系 DigitalOcean 中国区战略合作伙伴卓普云 AI Droplet获取中文技术支持。

相关产品与选型

把教程落到可用的云资源上

相关文章

Kimi K3 现已上线 DigitalOcean 无服务器推理
精选
产品更新

Kimi K3 现已上线 DigitalOcean 无服务器推理

Moonshot AI 最强模型 Kimi K3 已上线 DigitalOcean 无服务器推理服务。作为首个开源的 3T 级模型,Kimi K3 拥有 100 万 Token 上下文窗口、原生多模态能力和长时自主 Agent 工作负载

2026年7月28日
Claude Opus 5 现已上线 DigitalOcean AI 推理云
精选
产品更新

Claude Opus 5 现已上线 DigitalOcean AI 推理云

Claude Opus 5登陆DigitalOcean无服务器推理,专为Agent场景,性能媲美Fable 5,支持按量计费与多模型统一调用。

2026年7月27日
多模型融合推理:花 Fable 5 一半的钱,效果反而更好
产品更新

多模型融合推理:花 Fable 5 一半的钱,效果反而更好

一半成本击败 Fable 5:DigitalOcean 推理引擎上线模型合成工具,让开源模型组合在深度研究任务上质量更高、成本更低。

2026年7月24日