衡量 AI 创造的价值.

看影响,不看采用率。为 AI 交付的价值排名,并管控背后的支出。编码智能体、客服机器人、SDR 和研究工作流。从第一个指标到为其提供资金的预算,尽在一个平台。

app.yardstick.fi/
Overview
Acme · 6 agents · 4 repos measured
Last 30 days
Value created
$214k21%
ROI
7.2x14%
after review cost
AI spend / merged PR
$3.4018%
Merged PRs
1,2846%
Acceptance rate
92%
Trend
Merged PRs AI spend
AprMayJun
Recent activity streaming
claude-code
merged PR #318 · auth refactor
$3.40 / PR
cursor · web
resolved issue #2041 · checkout bug
94 score
兼容工具

每一个智能体。每一朵云。一个 ROI 数字。

你的智能体并不只生活在单一供应商的生态里,你的 ROI 数字也不该如此。Yardstick 覆盖每一个编程智能体、每一个网关和每一朵云进行度量,而不只是到达单一供应商仪表盘的那部分。

平台

三个套件。一条主干.

衡量 AI 创造的价值,优化每个智能体,并管控其背后的资金。共享一套身份、账本与主干之上的21款工具。

真正重要的指标

衡量影响,而不是采用率.

采用率仪表盘告诉你这周谁用了 AI:席位、会话、采纳率。这些都不是价值。唯一能通过 CFO 审查的数字,是你的智能体交付了什么、花了多少钱。Yardstick 衡量的正是这些:每个合并 PR 的成本、每个已解决工单的成本、变更失败率,以及每一美元 AI 支出背后的 ROI。

采用率指标
  • AI 采用率
  • 本周活跃席位
  • 消耗的 token
  • 代码行数
  • 被采纳的建议
影响指标
  • 每个合并 PR 的成本
  • 每个已解决工单的成本
  • 创造的价值
  • 每美元的价值
  • 变更失败率
价值时效

几分钟看到 90 天历史.

无需等待数据积累。连接仓库后,Yardstick 立即回填你最近的合并 PR 和回滚记录,并为其定价。

1几分钟
连接仓库

GitHub、GitLab 或 Bitbucket 一键安装。无需 SDK 即可开始。

2即刻
历史已回填

连接时拉取最多 90 天的合并 PR 和回滚记录。仪表盘打开即是你的过往战绩,而不是一片空白。

3当天
第一份 ROI 报告

每个合并 PR 的成本、创造的价值、变更失败率。在下一次站会前就能拿给董事会看。

回填覆盖你最近 90 天的 PR。成本采集从智能体运行的那一刻起实时流入。

Observe · 衡量

看清每个智能体的价值

用每个领域认可的单位评估 AI:每个合并 PR 的成本、解决率、引用准确度。活动指标会骗人。成果不会。

了解 Observe
app.yardstick.fi/agents/claude-code
Cost / merged PR
$42.10
▼ 9.4%
Value / dollar
2.3x
▲ 0.4x
91%
accepted
Acceptance rate
Outputs merged without rework, across 1,284 outcomes this month.
Optimize · 改进

把每一个分数变成更好的智能体

Observe 给出分数,Optimize 告诉你如何提升:要收紧的提示词、要更换的模型、要修改的配置,按每美元带来的提升排序。

了解 Optimize
app.yardstick.fi/optimize/tuner
Predicted lift
+18%
outcome
At lower cost
24%
▼ spend
12
changes
Ranked changes
Highest-impact tweaks for this agent, ranked by outcome per dollar.
Treasury · 治理

治理 AI 花出的每一美元

把 AI 预算变成会随已验证价值而响应的额度、策略与上限。更少浪费、更小的算力足迹,一个自运转的资金库。

了解 Treasury
app.yardstick.fi/treasury
Quarter budget
$50k
on track
Projected payout
$21.6k
▲ 0.4k
68%
used
Budget burn
Spent against cap. Use-it-or-cash-it at quarter end.
工作原理

一条流水线。五个阶段。

主干先行交付,因此每个新套件都能接入,而无需重写基础设施。新增一个领域只需数周,而非数年。

1
衡量

通用 LLM 追踪,加上各套件的采集器:代码库、CRM、支持队列、对话。

2
排名

带版本的评分引擎。共享主干之上、各套件各自的评分函数。

3
报告

档案、排行榜,以及面向 CFO 的支出对成果报告。

4
预算

按团队设定额度与策略。成本与成果同在一个账本。

5
优化

成本感知路由与浪费管控。花得更少,成果不变。

AI 终于在做真正的工作。但它做了什么的证明,以及背后的预算,仍靠截图和猜测在运转。 我们用一把真正的标尺取而代之。

对比

三条赛道。一个产品。

采用率仪表盘和工程智能工具统计谁在用 AI、开发者表现如何。网关计量模型调用。AI FinOps 追踪账单。Yardstick 是这些赛道交汇之处,依据你的 AI 编码智能体真正交付的成果来评分。

Yardstick
AWS CloudWatch
Revenium
Pensero
Olakai
Faros
追踪 AI 智能体活动
聚焦编码智能体的切入点
部分支持
·
部分支持
部分支持
评估智能体成果,而非仅看 token
·
·
部分支持
部分支持
PR 级别的 AI 与人类归因
·
·
部分支持
部分支持
部分支持
匿名的跨组织基准
·
·
部分支持
·
部分支持
预算、额度、急停开关
部分支持
·
部分支持
·
成本感知的模型路由
·
·
·
·
·
EU AI Act 审计包与 SOC 2 证据
·
·
·
·
用掉或兑现的开发者支出
·
·
·
·
·
·
开源 SDK 与认证标准
计划中
·
·
·
·
·

依据 2026 年年中的公开文档。欢迎指正:hello@yardstick.fi

安全与信任
默认隐私

我们只读取你接入的工具。未经同意,任何数据都不会离开你的技术栈。

全程加密

所有数据在传输中和静态时都经过加密。

SOC 2 进行中

从第一天起就按企业级安全标准来构建。

数据归你所有

随时导出。我们绝不出售,也绝不用于训练。

为什么选择 Yardstick

一台仪器,而非一个仪表盘

成果,而非活动

我们评估合并的 PR 和已解决的工单,绝不评估 token 或代码行数。

你的支出就是你的支出

我们衡量并治理预算,绝不在你的供应商成本上加价。

展示方法

每个分数都可解释。如果算不清楚,我们就不发布。

默认隐私

我们只读取你接入的工具。未经同意,任何数据都不会离开你的技术栈。

定价

上线定价。

三个智能体永久免费。付费方案捆绑 Treasury,因此你每个层级只付一次,而不是每个套件付一次。

省 20%
3 个智能体永久免费。每个付费方案都从 14-day 试用开始。已验证的分数和排行榜在所有方案中均永久保留。
Free
$0
3 个智能体 · 管控规模至多 $5k 时告警
  • ·3 个活跃智能体
  • ·无限查看者,永久免费
  • ·通用 LLM 与工具追踪
  • ·软性预算告警
  • ·公开智能体档案
  • ·7-day 数据留存 · 社区支持
Solo
$15/月,按年结算
上线定价
5 个智能体 · 任选 1 个套件
  • ·5 个活跃智能体
  • ·供应商 admin-API 成本采集
  • ·成果价值评分
  • ·公开智能体档案
  • ·90-day 数据留存 · 邮件支持
  • ·之后每多一个智能体 $5
推荐
Pro
$63/月,按年结算
上线定价
25 个智能体 · 归因与 ROI
  • ·Solo 的全部功能
  • ·PR 级别的 AI 与人类归因
  • ·用于每个 PR token 归因的 SDK
  • ·对账(SDK 与 admin-API 的差异)
  • ·AI 工具 ROI 与推荐引擎
  • ·包含 Treasury,管控规模至多 $50k/月
  • ·之后每多一个智能体 $4
Scale
$239/月,按年结算
上线定价
150 个智能体 · CFO 组合包
  • ·Pro 的全部功能
  • ·按团队分摊成本
  • ·更高的 Treasury 上限(管控规模 $250k/月)
  • ·2-year 数据留存 · 优先支持
  • ·Shadow-AI 检测
  • ·研发资本化报告
  • ·之后每多一个智能体 $3
Enterprise
无限 · 合规与采购

面向治理真实 AI 支出的组织,而不仅是工程团队。无限智能体、无限 Treasury,再加上合规与采购组合包。

  • ·Scale 的全部功能,无限量
  • ·EU AI Act 审计与证据包
  • ·自定义护栏与组织级 AI 网关
  • ·SSO / SAML / SCIM
  • ·SOC 2 Type II(即将推出)
  • ·本地部署选项 · 专属 CSM
常见问题

合理的问题。

加入等候名单。在私有测试期间,越早注册越能优先获得使用权限和各套件的设计合作伙伴名额。

DX 广泛地衡量工程,并发布 AI Measurement Framework。Yardstick 衡量 DX 没有定价的那一件事:你的 AI 编码智能体真正交付内容的成本与价值,并附带 PR 级归因与 EU AI Act 审计包。许多团队会同时使用两者。

开发工具方面有 Claude Code、Codex、Gemini 和 Cursor,还有 Devin、Factory、OpenHands 等自主型循环工程师,以及你的团队已经在用的支持、销售和研究智能体。底层调用的模型同样会被计量:Anthropic、OpenAI、Gemini、Kimi、DeepSeek、Mistral、Groq、Together、Fireworks、Perplexity 和 OpenRouter 都会经过网关,并按 token 计价。使用供应商计费密钥或轻量连接器接入,无需推倒重来。

这是 Treasury 要去的方向,目前还没有做。思路是:给每位开发者一份年度 AI 额度,没用完的部分在确实交付了成果的前提下转为薪酬,这样就没人会学会为了保住预算而把它烧掉。今天的 Treasury 做的是治理的那一半:预算、消耗追踪、预计未用完以及强制上限。支付通道是一个真正的设计难题,因为钱必须在我们从不经手的情况下流动。我们宁愿说清楚,也不暗示它已经上线。

不会。Treasury 生成对账单、账本分录和薪资导出。资金由人和现有渠道来转移。

如果 AI 真的在为你工作,那就衡量它。

早期使用权限将随我们首批设计合作伙伴开放。我们正在各个领域进行接入。

只需填写邮箱。 没有垃圾邮件。上线时只发一封邮件。

Yardstick · AI 代理 ROI 平台:测量、优化并治理 AI 支出