卓普云

延迟降低 55%,9 台服务器撑起整套 AI 业务:这家公司怎么做到的?

AI-nhancement用DigitalOcean构建可治理AI架构,通过推理路由器统一调度Anthropic、OpenAI等模型,将延迟降低2.2倍。创始人仅凭自学,在Droplet上快速部署Mia个人AI伴侣与Anvil编程Agent,实现低成本、高可靠的多模型路由与混合云部署。

2026年8月19日
延迟降低 55%,9 台服务器撑起整套 AI 业务:这家公司怎么做到的?

AI-nhancement 致力于构建可治理、值得信赖的 AI 基础设施。与其把幻觉和虚构内容当成可以通过 Fine-tuning 消除的训练问题,这家公司更倾向于把它们视为架构问题,并通过系统设计来规避。其平台把身份、记忆和工具治理从底层 AI 模型中拆分出来,因此即使底层模型发生变化,系统行为也能保持一致。这种设计同时也有利于在云端和本地环境之间构建混合 AI 架构。

AI-nhancement 的旗舰系统 AiMe 是一种“有限权限(bounded-authority)”认知架构:语言模型负责生成语言,但系统在设计上不会让模型决定什么是真实、什么应该被记住,以及治理规则应该如何执行。所有这些决策都会在各个边界处由确定性的非 LLM 代码处理,因此模型无法自行把某个信息授权为事实。

“我们设计 AiMe,就是为了让模型无法自行把某件事认定为事实——因为系统根本没有给它这种权限。”Canady 说道。

在这套架构之上,目前运行着两款产品。Mia(NeuroMia)是一款个人 AI 伴侣,用户通过普通电话或短信就能与它交互,而它的记忆和“思维”完全运行在用户自己的家用电脑上,而不是云端。Anvil 则是一款采用 Apache 2.0 协议开源的多平台 AI 终端编程 Agent,每一次代码变更在发布之前,都必须分别经过两个独立模型系列的审查和批准。

AI-nhancement 创始人 John Canady Jr. 原本从事硬件制造,在没有接受过任何正规机器学习或计算机科学教育的情况下,于 2025 年 11 月创办了这家公司。他用自己的 Harley-Davidson 摩托车换来了两块 NVIDIA Quadro RTX 8000 GPU,亲手组装了一台开发主机,并在四天后写下第一批代码。到 2026 年 4 月,Canady 已经完成了超过 133,000 行 Python 代码,分布在 441 个文件和 37 个模块中,同时记录了 21 项发明,并完成多篇论文,其中一篇已经提交至 SSRN。他认为,DigitalOcean 提供的支持和基础设施资源,是这一切能够实现的重要原因之一。

应对超大规模云平台的复杂性

在最终决定把 AI 工作负载放到 DigitalOcean 之前,Canady 曾经尝试过 Azure、AWS 和 Google Cloud。按照他的说法,在真正开始做产品之前,差不多有一半时间都花在研究这些平台到底该怎么用。他表示,这三家平台都提供 Startup Credits,但实际使用起来都比较繁琐,而且为了适配自己的工作流需要做大量配置。以他的实际体验来看,在这些平台上部署前沿模型都比较慢,而且阻力很大。

“我当时在折腾 Azure、AWS 和 Google 的时候,差不多有一半时间都花在搞清楚它们怎么用——Azure 最麻烦,其次是 AWS,然后是 Google。到了 DigitalOcean,Claude Code 可以直接 SSH 到 Droplet 上,然后从我的私有仓库直接在服务器里工作,整个流程一下就顺畅多了。”他说。

在此之前,他已经用 DigitalOcean 运行其他项目接近一年半,从基于 Commodore 64 的复古 BBS 项目到 AI 产品都有涉及。

在 DigitalOcean 上实现快速部署

如今,DigitalOcean 已经成为 Canady 所有项目默认使用的托管层。他目前一共运行着 9 台 Droplet® 云服务器,分别承载 NeuroMia Relay(Mia 的 Twilio 语音 / 短信桥接和 License Activation)、公司网站及 AiMe 产品 API 和 Ethos 推理 API、Corevah 语音 AI SaaS 平台、Anvil 静态站点和开发 Sandbox、一款名为 TrustEazy 的新 SaaS 产品、独立的 Ethos-Verum 推理部署、RetroNet 社区平台,以及 retrolink-host(一个 Commodore 64 BBS 项目)。

AI-nhancement 的 Runtime 会在 Anthropic、OpenAI、DeepSeek 和 NVIDIA 模型之间进行切换,而 DigitalOcean 推理路由器让 Canady 只需要维护一个集成入口,而不是四套不同接口。对于一家从产品设计之初就采用多平台架构的公司来说,这种统一并不只是更方便,而是架构层面的价值。

对他来说,最突出的地方甚至不是某一个具体功能,而是整个工作流。部署可以简单到直接向 Droplet 执行一次 Git Push,而 Claude Code 也可以直接 SSH 进入 Droplet,从私有仓库直接在服务器上工作,不需要再额外维护一套复杂的部署 Pipeline。

Canady 还做了几项不那么常见、但很值得关注的架构选择:

  • 随着时间推移,把一些职责明确的 AI 专家模块从昂贵的前沿模型调用,逐步迁移到更小、在本地训练的模型上。
  • 把一次受治理的模型调用拆分成独立的 Reasoning 和 Expression 两个阶段。(下文还会详细介绍。)
  • Mia 的架构中,Droplet 只负责电话通信和 Provisioning,绝不会接触用户记忆;家用 PC 主动向 Relay 发起连接,而且不开放任何入站端口,从而降低家庭网络暴露在外部攻击面的风险。
  • Anvil 要求两个不同模型系列分别独立批准每一次代码变更,而且第二个 Reviewer 会专门检查第一个 Reviewer 提出的修复是否又引入了新的 Regression。

谈到技术支持时,Canady 的反馈非常直接,而且并不是在被刻意询问后才给出的。“我之前因为一个账单问题联系过 DigitalOcean,他们回复得很快,几乎立刻就解决了。说实话,光凭客户支持这一点,我都会继续用 DigitalOcean。对于 Startup 来说,一次账单错误就可能打乱预算,甚至在你还没反应过来的时候就让整个项目撑不下去——这种响应速度的重要性,其实比很多人想象得更高。”Canady 说道。

获得更快的性能结果

在 Canady 进行的一组受控 Benchmark 中,把一次受治理的模型调用拆成独立的 Reasoning 和 Expression 两个阶段之后,在 56 次真实生产交互中,平均单轮延迟从 7,575ms 降到了 3,417ms,相当于获得了 2.22 倍的速度提升。

Canady 表示,整条 Pipeline 在 5,000 次测试中没有出现任何架构级失败;原始失败率为 0.30%,但这些错误全部在到达用户之前被结构化 Gate 拦截。同时,系统的 Intent Stability 达到了 88.0%。

在生产环境中,据他提供的数据,系统在 36 个 Intent Category 上保持 99.5% 的准确率;在一款 2B 参数 Benchmark 模型上准确率达到 100%;此外,在一个对抗式“Concerns Specialist”评测中得分为 96/100。

Canady 认为,真正的价值在于把所有东西都放在同一家平台上,这样他的工具就可以横跨整套基础设施工作,而不用在不同云平台之间来回切换、浪费时间。他预计,随着规模扩大,这些时间节省最终也会转化成实际的成本节省。

AI-nhancement 的下一步

AI-nhancement 接下来的路线图将更多转向 GPU 和训练投入:使用公司“专家模块升级”流程产生并经过验证的数据集,对开放权重模型进行 Fine-tuning。换句话说,今天还是推理服务客户,未来可能就会变成 GPU 和训练服务客户。

较新的产品 Anvil 接下来也需要训练规模的算力,而且因为它从设计上就是一个多平台系统,所以一套能够与 AI-Native Cloud 整合的统一路由层会从“可选项”变成“必需品”,这也正是 DigitalOcean 推理路由器发挥作用的地方。

Canady 同时还在评估自行托管 Mia 的语音技术栈,以及未来推出一个不再要求用户拥有家用 PC 的“Online Mia”版本,因此 GPU Droplet 也已经进入后续规划。

“我会向所有和我聊过的人推荐 DigitalOcean,原因有两个:客户支持,还有配置和使用起来真的很简单。要是把那些大型云平台和 DigitalOcean 放在一起比较,差距非常明显。”他说。

相关产品与选型

把教程落到可用的云资源上

相关标签

相关文章

多款模型最高直降 50%:DigitalOcean 无服务器推理大降价
精选
新闻

多款模型最高直降 50%:DigitalOcean 无服务器推理大降价

DigitalOcean Serverless Inference 下调 7 款主流模型价格,覆盖 DeepSeek、Qwen、GLM、Llama、Nemotron 和 MiMo,最高降幅达到 50%。

2026年8月6日
RadixArk 在 DigitalOcean 上实现 DeepSeek V4 吞吐量提升 10 倍
新闻

RadixArk 在 DigitalOcean 上实现 DeepSeek V4 吞吐量提升 10 倍

每 GPU 每秒 3.5K+ token,吞吐量提升 10 倍:RadixArk 在 DigitalOcean 上的 DeepSeek V4 高性能实践

2026年7月15日
Laravel 开发者已在 DigitalOcean 上开通超过 10 万台服务器
新闻

Laravel 开发者已在 DigitalOcean 上开通超过 10 万台服务器

Laravel 依托 DigitalOcean 基础设施,通过 Forge 和 VPS 为开发者提供快速部署,已开通超 10 万台服务器,并持续深化 AI 工具与托管服务集成。

2026年6月23日