← LeisureLinux 文章索引
LeisureLinux · 微信公众号文章

Token狂欢结束,谁来收拾烂摊子?—— Revenium的AI成本可观测之道

AI/Agent 阅读原文(微信)↗

本文基于 The New Stack 对 Revenium 的深度报道,原文链接见文末参考文献。

━━━ ━━━ ━━━

一、从一场「Token 狂欢」说起

过去 18 个月,企业 AI 的策略像极了一场毫无节制的淘金热。指令简单粗暴:采用、集成、规模扩张。工程团队获得对大型语言模型(Large Language Model,LLM)的几乎无限访问权限,结果催生了一个匪夷所思的竞争现象——内部排行榜上,比拼的不是业务产出,而是哪个部门、哪位工程师消耗的 token 最多

Token(词元)是 LLM 处理文本的基本单位——在英文中,1 个 token 约等于 3/4 个单词或 4 个字符。它决定了 AI 的上下文窗口(context window)、推理性能和 API 计费。你能\"拉满\"多少 token,似乎就成了衡量 AI\"努力\"的 KPI。

我们把这种现象叫作 Tokenmaxxing(Token 拉满)——一种完全与业务价值脱钩的狂热指标。

但这场派对,正在结束。

宿醉以最直接、最痛苦的方式降临:巨额且完全无法预测的云账单。

\"全世界先疯了一样冲出去,然后又摔回地面。我们看着这一切,只能说:这太疯狂了。你完全可以花大钱却什么有用的事都没做。\"

>

——Jason Cumberland,Revenium 联合创始人兼 CPO(首席产品官)

Revenium(官网),一家诞生于弗吉尼亚州赫恩登的软件公司,正是在这个转折点上,凭借六年前积累的 API 计量基础设施,切入了 AI 成本可观测性(AI Cost Observability)这个全新赛道。

━━━ ━━━ ━━━

二、冰山之下:你看不见的 AI 真实成本

大多数企业审视 AI 开支时,视角极其狭窄:只看 token 的单价。

那是冰山的尖顶。水面之下,隐藏着冰冷而庞大的黑暗区域——下游成本(downstream costs)。

当今的 AI Agent 极少是独立运行的。它们会连接数据库(如 Snowflake)、第三方身份认证服务、支付网关(如 Stripe)、信用查询机构......每一次调用都产生一项成本。然而在绝大多数企业的架构中,AI Agent 与其引发的下游成本是完全解耦的、不可见的。

\"想象一个金融服务工作流里的 AI Agent——它处理贷款、审阅数据、做出合规决策。过程中它会调用 Equifax 或 TransUnion 的外部 API。一份信用报告可能就要 25 美元。月底你收到 LLM 的 token 账单,也收到 Equifax 的账单,但你完全无法将两者关联起来——你不知道 Equifax 费用飙升,其实是因为某个 Agent 失控了。\"

>

------ Jason Cumberland

这就是 AI 成本管理的 「冰山问题」

LLM Token 费用 ← 你看到的(冰山尖顶) ↓ 数据库查询费用(Snowflake 等) 第三方 API 调用费用(身份验证、信用报告等) AI Agent 之间的循环调用(无限递归烧钱) Agent 失败后的人工补救成本 ↑ 你完全看不到的(水下冰山)

下游调用不仅增加 API 开销,还可能导致 AI Agent 陷入死循环——一个 Agent 调用另一个 Agent,另一个再调用回来,导致 token 疯狂消耗的同时,外部账单也在同步飙升。

━━━ ━━━ ━━━

三、Revenium:把 AI 当作 API 来计量

Revenium 创立六年,第一阶段专注的是 API 货币化(API monetization),为 Salesforce、Mulesoft 等巨头构建高并发的 API 计量基础设施。当生成式 AI(Generative AI)泡沫膨胀时,他们发现了自己的独特优势:

所有 AI 本质上就是 API 调用。

Jason Cumberland 的总结简洁到极致:\"All AI is just APIs.\"

RAG(检索增强生成,Retrieval-Augmented Generation)背后是向量数据库的查询 API;Agent 要获取实时信息,背后是对接新闻或金融数据的 REST API;模型推理本身就是对着 OpenAI、Anthropic、DeepSeek 或本地部署的 API 端点做 POST 请求。

既然都是 API,那计量、限流、熔断、预算管控这些 API 治理的老办法,就能完整平移过来。

新功能:AI Insights

2026 年 6 月 9 日,Revenium 在其 AI 经济控制系统(AI Economic Control System)中推出了 AI Insights 功能,核心能力包括:

  1. 运行时插桩(runtime instrumentation):代码在运行时注入,交易发生即计量,不等账单 API(可能延迟数小时甚至数天)
  2. 多阶段检测管道(multi-stage detection pipeline):自动分析交易历史,发现异常模式
  3. 量化优化建议:生成排好序的优化列表,每条建议附带预计月节省金额,并直接链接到原始交易数据
  4. 实时阻断:超预算可立即阻断,而非事后算账

Beta 测试中发现的典型问题:

问题类型 描述
循环依赖(circular dependencies) AI Agent 之间互相调用,形成昂贵的死循环
陈旧高价模型(outdated expensive models) 仍在使用旧版高价模型,未切换到更高效的替代品
特定提供商高失败率 某些模型的 API 调用失败率异常,浪费重试成本

相对于 CloudZero 等传统 FinOps(云财务运营,Cloud Financial Operations)厂商的事后账单分析路线,Revenium 的运行时插桩路线在速度上领先了几个数量级——前者等你看到账单时钱已经花了,后者在花钱的那一刻就喊停。

━━━ ━━━ ━━━

四、AI 可观测性的三个成熟度层次

Cumberland 将 AI 可观测性的落地划分为三个成熟度层次(three horizons of maturity):

层次 描述 比喻
H1 基本的 token 成本追踪 知道花了多少钱买电
H2 关联下游 API 调用成本(如 Equifax、Snowflake) 知道每台电器分别用了多少电
H3 追踪 AI 与人类工作的相对绩效 知道电费换来了多少产出

H3 是最引人注目的。在这个层次,Revenium 埋设了救援指标(rescue metrics),用来统计:

  • AI Agent 执行失败的 token 成本
  • 失败后交回人工处理花费的时间
  • 两者的总和 = AI 的真实成本

\"当 AI Agent 失败,任务弹回人类手中时,你不仅有初始执行的 token 成本,还有额外的人类修复时间。我们帮企业追踪的是这两者的总和。\"

>

------ Jason Cumberland

━━━ ━━━ ━━━

五、最 provocative 的命题:AI Agent 的绩效管理

如果 H3 已经让人思考,那下面这个观点足以让 CIO 们深夜无眠:

\"我坚信,未来员工做绩效面谈时,问题会是:你工作做得多好?以及你花了多少 token?\"

>

------ Jason Cumberland

企业有数十年成熟的人力绩效管理(workforce management)体系——OKR、KPI、360 评估......但当企业部署了数千个 AI Agent 来处理代码实现、客服分流、合规审核等任务时,完全没有任何基础设施来管理这些数字员工

Revenium 的长期愿景,是成为 AI Agent 的「人力资源系统」——追踪每个 Agent 的投入产出比(ROI),识别\"高绩效 Agent\"与\"摸鱼 Agent\"。

净收益公式

AI 净收益 = AI 节省的人力成本 - LLM Token 费用 - 下游 API 调用成本 - 人工补救时间成本

这个计算,目前几乎没有任何企业真正做好。

━━━ ━━━ ━━━

六、几点观察与思考① Tokenmaxxing 的本质是测量谬误

\"把消耗当产出\" 是经典的古德哈特定律(Goodhart\'s Law)——当一个指标变成目标本身时,它就不再是个好指标了。工程师们拼命拉 token 消耗,因为那个数字能上排行榜,但这和企业追求的业务价值毫无关系。

② 冰山模型揭示了一个架构级问题

现有的 AI 应用架构中,成本归属链路是断裂的

  • LLM 调用 → OpenAI/DeepSeek 统一出账
  • 数据库调用 → Snowflake 单独账单
  • 第三方 API 调用 → 各供应商独立计费
  • 人工补救 → 根本不记账

要修复这个问题,需要的不是另一个财务管理工具,而是从架构层面嵌入的可观测性——这正是 Revenium 运行时插桩方案的价值。

③ H3 打开了 AI 投入产出比(ROI)度量的大门

\"AI 到底值不值\"这个灵魂拷问,终于有了可操作的答案。但 H3 需要企业具备更成熟的数据基础设施——你不能追踪 AI 失败后的人工补救成本,除非你先把人机协作的工作流全链路数字化。

━━━ ━━━ ━━━

结语

Token 狂欢的宿醉过后,留给企业的不是要不要继续用 AI 的问题,而是如何观察、控制、优化 AI 的每一分钱花在什么地方的问题。

Revenium 的核心理念值得记住:\"All AI is just APIs.\"——把 AI 降维到 API 层面之后,计量、管控、优化这些在 API 治理领域沉淀了几十年的基础设施,都可以直接复用。也许,这才是 AI 规模化落地真正需要的\"大人的方法\"。

━━━ ━━━ ━━━

参考文献

  1. The New Stack (2026-06-09). *\"The tokenmaxxing party is over, and Revenium is mopping up\"*. https://thenewstack.io/revenium-ai-cost-observability/
  2. Revenium 官网: https://revenium.io
  3. Goodhart\'s Law(古德哈特定律)——当指标变成目标后,就不再是好指标。Wikipedia: https://en.wikipedia.org/wiki/Goodhart%27s_law
  4. CloudZero——AI FinOps 竞争产品对比: https://www.cloudzero.com
  5. FinOps Foundation——云财务运营标准: https://www.finops.org

━━━ ━━━ ━━━

*本文为 LeisureLinux 原创内容,基于公开报道翻译与解读。如需转载请联系作者。*

Nebius 收购 Eigen AI:AI 云计算领域的"垂直整合"大动作

2026 架构师必读:如何在工程化落地中约束 OpenClaw 式的"暴力"智能体?

Jeff Dean 的 AI 路线图与系统底色——从编译器优化到万亿参数大一统模型

本文整理自微信公众号 LeisureLinux 的原创内容(Linux / AI / 安全 硬核技术)。

· 阅读原文(微信公众号)

· 关注公众号 LeisureLinux,第一时间获取技术深度内容。

LeisureLinux 公众号二维码(微信扫一扫关注)