我们找出你的 AI 花费去了哪里,以及该改什么。
固定价格、固定范围,不需要部署任何基础设施。
我们最常看到的问题
一条 agent 工作流开始把整段对话历史在每一步重新发一遍。输入 token 增长,而输出基本不变。没有东西崩溃,没有告警,第一个信号是账单。
OWASP 关于 agent 执行预算的研究记录了跨 21 个编排框架的 63 起已确认生产超支事故,并估计财富 500 强在未预算支出上泄漏了约 4 亿美元。同一份研究还指出,只有大约五分之一的组织具备运行时可见性。
被记录下来的故障模式并不神秘。只是在有人去翻 token 数之前,它们是不可见的。
一次诊断是怎么做的
不部署。不让 agent 进你的 VPC。不改你的代码。
你给的是只读权限,不是基础设施
两种方式,随你选:
- 用服务商的管理员 API。OpenAI 和 Anthropic 都提供组织级的用量与成本接口。一把只读 key,我们直接拉数据。
- 给一个文件。你自己导出后发给我们。我们会明确告诉你需要哪些列。
无论哪种都是只读。我们不要写入权限的 key,也不需要访问 prompt 或回复内容。
我们分析的是元数据,从不碰内容
token 数、模型标识、时间戳、归因标签,以及服务商实际计费的金额。输入就这些。
我们不读你的 prompt。我们不读你的回复。就算你问,我们也说不出你的应用在做什么。
你拿到一份书面报告
一份不长的文档,A4 排版,是那种能直接转给 CTO 而不用重写的东西。内容包括:
- 一段结论,用平实的语言说明是什么在推高账单。
- 每一项发现按每月价值排序,给的是区间而不是一个自信的单点数字。
- 每个数字背后的证据,让你的工程师可以去核对我们的算术,而不是只能相信。
- 每一项都带置信度。有些是你自己数据上的算术,有些是关于你架构的判断,报告会说明是哪种。
- 这次分析无法告诉你什么。总有一些,而那应该写在纸面上,而不是留在我们脑子里。
- 当某项发现匹配到已记录的故障模式时,给出引用出处、记录事故数和已报告的最大损失。
多少钱
| 项目 | 价格 | 你得到什么 |
|---|---|---|
| 范围沟通电话 | 免费,15 分钟 | 我们确认数据是否拿得到,并诚实告诉你现在做诊断值不值得。有时候答案是不值得。 |
| 诊断 | $1,500 | 书面报告,收到数据后 5 个工作日内交付。 |
| 部署与守护 | $2,000 + $1,000/月 | 我们在你的基础设施里装上护栏、接好告警、持续更新价格表,出问题时有人接电话。 |
| 长期成本治理 | 从 $2,500/月起 | 我们持续盯着:路由调整、缓存策略、上下文预算,以及季度复盘。对标的是雇一个人来做这件事。 |
我们宁愿损失这笔费用,也不愿意去辩护一份写着「你的花费没问题,但这里有些图表」的报告。
这不是营销话术,它是数据模型的直接结果:在范围沟通电话里我们已经看到了数据的形状,所以在报价之前就知道里面有没有东西可找。
我们不做什么
我们不需要你的 prompt
如果某个厂商向你要,问问他为什么。
我们不卖要你盯着的看板
我们卖的是发现和修复。工具本身是免费开源的,你想自己跑就自己跑:llm-guard。
我们不从你的花费里抽成
没有按花费百分比的定价。无论你的账单涨还是跌,我们拿的钱一样多 —— 这是唯一能让建议有价值的结算方式。
为什么工具是免费的
llm-guard 是 MIT 许可且功能完整的。零运行期依赖,只用标准库,能执行预算、能检测失控循环。如果你的团队想自己跑,那就自己跑。它真的是全部,不是阉割版。
知道哪些模式重要、按我们见过的东西校准过、并且对答案负责。
开始
发邮件到 [email protected],告诉我们:
每月大概花多少
在模型 API 上的大致支出。
用了哪些服务商
OpenAI、Anthropic,或者别的。
过去一年有没有被账单吓到
如果有,大致多少钱。
这些就够安排一次范围沟通电话了。如果看起来有东西可找,我们会说。如果看起来没有,我们也会说。
LYE LABS LIMITED(灵野科技有限公司) · 香港