卓普云

DeepSeek V4.1 Flash 现已上线 DigitalOcean:更强 Agent,更低推理成本

DeepSeek-V4.1-Flash 已上线 DigitalOcean AI 推理平台,支持 100 万 Token 上下文、原生多模态和可调推理强度,并通过更小 KV Cache 降低 Agent 长上下文成本。

2026年9月17日
DeepSeek V4.1 Flash 现已上线 DigitalOcean:更强 Agent,更低推理成本

DeepSeek 最新发布的 DeepSeek-V4.1-Flash 现已上线 DigitalOcean AI 推理平台,开发者可以直接通过 DigitalOcean 无服务器推理(Serverless Inference)调用,无需自己部署和维护 GPU 推理集群。

这次的 V4.1 Flash 有点不一样。

它并没有继续简单地追求“参数越大越好”,而是采用了 DeepSeek 新一代 Causal Encoder-Decoder(因果编码器-解码器)架构:模型总参数达到 5520 亿,但处理输入时只激活约 80 亿参数,生成输出时激活约 160 亿参数

更值得关注的是,在 DeepSeek 自己公布的测试中,这个“Flash”版本在不少 Agent 和 Coding Benchmark 上,反而超过了参数规模更大的 DeepSeek-V4-Pro

与此同时,它还支持 100 万 Token 上下文、原生图像输入,以及更精细的 Reasoning Effort 调节,并大幅压缩了 KV Cache 占用。

对于正在做 AI Coding、Agent、长文档处理或者视觉 Agent 的团队来说,DeepSeek-V4.1-Flash 更像是在尝试解决一个越来越现实的问题:

能不能不靠持续增加单 Token 的计算量,也把 Agent 能力继续往上推?

而在 DigitalOcean 上,这款模型也不必单独使用。开发者可以通过同一套 API 接入平台上的多款模型,并把 DeepSeek-V4.1-Flash 加入 Inference Router,根据成本、延迟和任务类型,在 DeepSeek、Claude、GPT、Qwen、Kimi、GLM 等模型之间进行路由。 Inference Router(推理路由)目前是免费面向所有 DigitalOcean 用户的,具体使用方法可咨询 DigitalOcean 中国区战略合作伙伴卓普云(aidroplet.com)

5520 亿参数,输入却只激活 80 亿

DeepSeek-V4.1-Flash 是一款 552B,也就是 5520 亿参数的 MoE 模型

但比较特别的是,它采用了新的 Causal Encoder-Decoder 架构,把“理解输入”和“生成输出”两个阶段需要的计算量做成了不对称设计:

  • 输入阶段:约 8B(80 亿)激活参数
  • 输出阶段:约 16B(160 亿)激活参数

这和很多传统 Decoder-only 大模型有一个明显区别。

对于大模型推理来说,读取一大段 Prompt 和逐 Token 生成答案,其实是两种不同的计算过程。特别是在 Coding Agent、RAG 和长文档应用里,输入往往非常长,而最终输出可能没有那么长。

如果处理输入时仍然使用和输出阶段相同规模的计算,就可能造成大量不必要的算力开销。

DeepSeek-V4.1-Flash 的思路是:

输入阶段尽量用更低的计算成本理解上下文,真正生成答案时再使用更多专家参数。

这也是为什么“5520 亿总参数,但输入只激活 80 亿”并不意味着它是一款普通的 8B 模型。

5520 亿参数决定了模型整体的容量,而 8B / 16B 则代表每个阶段实际参与计算的参数规模。

这类设计的价值,主要在于把模型容量单 Token 计算成本尽可能拆开。

对于高频 Agent 工作负载来说,这一点尤其重要。

KV Cache 更小,缓存读取低至每百万 Token 0.006 美元

DeepSeek-V4.1-Flash 另一个很值得关注的变化,是 KV Cache

与上一代 DeepSeek-V4-Flash 相比,V4.1 Flash 的全局 KV Cache 大约只需要:

1/4 的 HBM 显存空间,以及 1/8 的 SSD 存储空间。

这对于 Agent 场景尤其重要。

一个 Coding Agent 在执行任务时,往往会反复携带:

  • System Prompt
  • 项目说明
  • 代码文件
  • Tool Calling 历史
  • Terminal 输出
  • 测试结果
  • 前面几十轮对话

如果这些内容每一轮都重新计算,不仅会增加延迟,也会快速推高 Token 成本。

Prompt Cache 的作用就是复用已经计算过的上下文。

而 DeepSeek-V4.1-Flash 本身又进一步压缩了 KV Cache 占用,所以它从模型架构层面就在针对长上下文和 Agent 工作流做优化。

目前在 DigitalOcean 无服务器推理中,DeepSeek-V4.1-Flash 的 Standard 模式价格为:

类型价格 / 百万 Token
输入0.30 美元
输出1.20 美元
Cache read0.006 美元

其中 Cache read 的价格只有普通输入 Token 的 2%

换句话说,如果一段重复上下文能够命中缓存,这部分 Token 的读取成本相比普通输入可以降低约 98%

对于一个会持续读取相同 System Prompt、代码库、工具定义和历史上下文的 Agent 来说,这个差距会非常明显。

所以 V4.1 Flash 的 KV Cache 优化,并不只是一个底层技术指标。

它最终会直接影响:

显存占用、推理吞吐、缓存成本,以及长周期 Agent 的整体运行费用。

Flash 版本,Agent 跑分反而超过 V4 Pro

名字里虽然带着“Flash”,但 DeepSeek-V4.1-Flash 并不是简单做了一个缩水版模型。

根据 DeepSeek 公布的测试结果,有两个数据特别值得关注:

BenchmarkDeepSeek-V4.1-FlashDeepSeek-V4-Pro
Terminal-Bench 2.190.687.9
DeepSWE v1.174.262.7

其中 Terminal-Bench 2.1 更偏向测试模型在真实终端环境中执行任务的能力,而 DeepSWE v1.1 更接近真实的软件工程 Agent 场景。

也就是说,至少按照 DeepSeek 自己公布的 Benchmark,V4.1 Flash 在这两项测试上都已经超过了规模更大的 V4 Pro。

这个结果其实比“又出了一个更大的模型”更有意思。

因为它说明模型能力提升并不一定只能靠:

更多参数 → 每个 Token 做更多计算 → 更高推理成本。

新的模型架构、预训练方式以及后训练,同样有机会让一个每 Token 激活参数明显更少的模型,获得更好的 Agent 能力

当然,Benchmark 依然不能直接等同于真实生产环境。

不同 Coding Agent、System Prompt、工具定义、代码仓库和推理参数,都可能影响最终表现。

但至少从目前的数据来看,V4.1 Flash 的定位已经很清楚:

它不是为了便宜而牺牲能力,而是在推理效率和 Agent 能力之间重新做了一次平衡。

100 万 Token,可以一次放进更大的代码库

DeepSeek-V4.1-Flash 支持最高 100 万 Token 上下文窗口

对于普通聊天来说,这个数字可能意义不大。

但对于 Coding Agent 和长周期 Agent,情况完全不同。

一个真实的软件工程任务里,模型可能需要同时理解:

  • 大量代码文件
  • README 和技术文档
  • API 定义
  • 数据库 Schema
  • Git Diff
  • 单元测试
  • 编译日志
  • Terminal 输出
  • 多轮工具调用历史

上下文不够时,就只能不断做摘要、裁剪或者重新检索。

这些操作当然可以解决问题,但也容易把某些关键细节提前丢掉。

100 万 Token 上下文则给 Agent 留出了更大的余量,让它在一次任务中持续保留更多代码和工作状态。

类似的优势也适用于:

  • 大型合同分析
  • 科研材料处理
  • 企业知识库
  • 大型技术文档
  • 复杂日志分析
  • 长周期 Agent 工作流

当然,这并不意味着“上下文越长越好”。

把几十万甚至上百万 Token 全部塞进模型,同样会增加延迟和推理费用。

真正有价值的是:

当任务确实需要完整上下文时,模型不会因为窗口不够而成为瓶颈。

DeepSeek V4.1 Flash 也开始原生“看图”了

V4.1 Flash 还具备原生多模态输入能力

它可以在一次请求中同时处理:

文本和图片。

这对于 Agent 的意义,可能比普通的“图片问答”更大。

例如 Coding Agent 可以直接查看:

  • 网页运行截图
  • UI 界面
  • 错误弹窗
  • 数据图表
  • PDF 页面
  • 产品设计稿

模型不再只能通过文字描述猜测软件运行成了什么样,而是可以直接读取视觉结果,再决定下一步操作。

这也是现在很多 Agent 正在发生的变化:

从“调用工具”,逐渐走向“调用工具 → 查看结果 → 根据结果继续行动”。

对于 Browser Agent、Computer Use、文档理解和视觉自动化来说,原生多模态会越来越重要。

不只是 DeepSeek,一个 API 可以接入多个模型

DeepSeek-V4.1-Flash 目前已经可以通过 DigitalOcean Serverless Inference 直接使用。

开发者不需要自己准备 GPU,也不用部署推理框架或者维护模型权重,通过 API 即可调用。

但 DigitalOcean 在这里更值得关注的地方,并不只是“又多上架了一款 DeepSeek”。

它支持通过同一套 API 接入多个模型,包括 DeepSeek、Claude、GPT、Qwen、Kimi、GLM、Llama 等不同模型系列。

这意味着,同一个 AI 应用并不需要被绑定在 DeepSeek-V4.1-Flash 上。

比如一个 Coding Agent 可以这样分:

简单分类、意图识别
→ 使用更轻量的模型

日常代码分析
→ DeepSeek-V4.1-Flash

超复杂推理
→ 更强的旗舰模型

视觉分析
→ 选择更适合当前任务的多模态模型

这些模型可以通过同一套推理接口调用,不需要为了测试不同模型分别维护多套 SDK、API Key 和业务代码。

这对于现在的 Agent 应用会越来越重要。

因为真正合理的成本优化,往往不是找到一个模型然后“所有任务都用它”,而是:

不同难度的任务,用不同模型处理。

立即体验 DeepSeek-V4.1-Flash

DeepSeek-V4.1-Flash 现已通过 DigitalOcean Serverless Inference 上线。

对于开发者来说,这次更新比较值得关注的不只是“DeepSeek 又发了一款模型”。

V4.1 Flash 展示的是另一条越来越清晰的路线:

不再单纯依赖更大的单 Token 计算量换能力,而是通过新的模型架构、更低的激活参数、更小的 KV Cache 和更灵活的推理控制,把 Agent 能力和推理效率同时往前推。

对于正在做 AI Coding、Agent、视觉理解或者长上下文应用的团队,它值得拿真实业务跑一轮。

而通过 DigitalOcean AI 推理平台,也可以直接把 DeepSeek-V4.1-Flash 加入现有的多模型架构,通过同一个 API 接入多个模型,再利用 Inference Router 根据任务复杂度、成本和延迟选择更合适的模型,而不需要从一开始就把整个产品绑定在单一模型上。

DigitalOcean 中国区企业用户如果需要测试 DeepSeek-V4.1-Flash、评估不同模型的实际效果,或者规划 Serverless Inference、Inference Router 与多模型架构,也可以联系 DigitalOcean 中国区战略合作伙伴 卓普云 AI Droplet 获取中文技术支持。

相关产品与选型

把教程落到可用的云资源上

相关文章

Omarchy 将研发基础设施迁移至 DigitalOcean 云平台
精选
产品更新

Omarchy 将研发基础设施迁移至 DigitalOcean 云平台

Omarchy 是 DHH 发起的 Linux 桌面,其 AI 智能体流水线迁至 DigitalOcean。后者成为赞助方与计算提供商,将推一键 Droplet,为 AI 开发者提供开箱即用的标准化环境。

2026年9月11日
GPT 6 Astra 已上线 DigitalOcean AI 推理云:AGI 时代的计算机操作模型来了
精选
产品更新

GPT 6 Astra 已上线 DigitalOcean AI 推理云:AGI 时代的计算机操作模型来了

GPT-6 Astra 登陆 DigitalOcean 无服务器推理,1.05M 上下文、五档推理强度,能自主操作电脑完成复杂任务。价格分长短两档(最低输入 $10/1M tokens),支持与 70+ 模型集成,为 AI Agent 提供旗舰级能力。

2026年9月7日
GLM 5.3 已上线 DigitalOcean AI 推理云平台:Agent 任务的高性价比底座来了
精选
产品更新

GLM 5.3 已上线 DigitalOcean AI 推理云平台:Agent 任务的高性价比底座来了

GLM-5.3-Flash 上线 DigitalOcean 推理引擎:3200 亿参数,每 Token 仅激活 180 亿,输入价格低至每百万 0.15 美元,比上代降约 90%,适合 Agent 与多模态任务。

2026年8月28日