智能体时代的衡量仪器
各团队正把真正的工作交给 AI 智能体,而几乎没人说得清这些工作值多少。我们正在打造衡量它的仪器、改进它的引擎,以及治理它的控制手段。
没人衡量的 AI
在智能体上的支出节节攀升,而那个问题始终没有答案:它管用吗?仪表盘只数 token 和追踪记录,没有一个为成果定价。我们创办 Yardstick,就是要让 AI 价值像账本上的任何一行一样可衡量,并赋予团队据此行动的预算与策略。
AI 做的一切都应被衡量。然后它应当自运转.
各家公司里充斥着没人衡量的 AI。支出是真实的,成果却是猜的。Yardstick 的存在就是要终结这种猜测,再把整个闭环逐个阶段地变得自主。
在 AI 工作的地方衡量它,用该领域认可的单位。开发工具看每个合并 PR 的成本,支持看解决率,研究看引用准确度。活动指标会骗人。成果不会。
分数只有在你能改变它时才有用。Optimize 读取 Observe 衡量的内容,并告诉你如何为某个智能体和任务提升它:要收紧的提示词、要更换的模型、要运行的实验。然后它闭合这个闭环。
一旦成果被衡量,资金便可随之而动。按团队设定额度。未用完的预算被收回,并重新分配给产出最多价值的团队。预算不再是一张电子表格,而开始成为一套系统。
最终形态。一个智能体运转整个闭环:它朝着成果调优各智能体,按计划重新平衡预算,无需开会便执行策略。每个动作都有记录,每个动作都可撤销,人类的最终否决权永久保留。
我们绝不打破的规则
代码行数、烧掉的 token、发出的邮件:全是噪声。我们衡量合并的 PR、已解决的对话、每个成果的成本、已验证的发现。如果没有交付价值,就不算数。
你无法自动化你无法衡量的东西。我们交付的每一个自主功能,都建立在一个先证明了自己的衡量层之上。
每个分数都可解释。如果我们无法展示一个数字背后的算法,我们就不发布它。
我们衡量并治理预算,绝不在你的供应商成本上加价。Treasury 记录意图;资金由人和现有渠道来转移。
数据归你所有,随时可用开放格式导出。你的过往记录会随你在各工具与平台之间迁移。我们绝不扣押它。
我们只读取你接入的工具。未经同意,任何数据都不会离开你的技术栈。先看团队汇总,个人层面的细节受策略管控。
自主,但有一个关闭开关。每个自动化动作都被解释、被记录、可撤销。这不是一种限制,而是设计本身。
创始人
我们正在组建创始团队。目前还没有正式的职位空缺,但如果你出类拔萃,并且这正是你想为之奋斗的问题,告诉我们你会打造什么。
和我们一起打造它
我们正在各个套件接入设计合作伙伴。如果 AI 真的在为你工作,而你想衡量它,我们想和你聊聊。
只需填写邮箱。 没有垃圾邮件。上线时只发一封邮件。

