已上线

Replay.

在切换之前,用真实流量验证这项变更。

Replay 回答配置变更真正引出的问题:这在我们的实际工作里站得住吗?它把线上调用镜像到备选方案,由评审对两边答案正面打分,并给出成本差异与显著性检验。它不会重放已存储的提示词,因为 Yardstick 只保留 token 计数、从不保存请求本身,这个隐私立场比该功能更有价值。

18% cheaper
Replay · counterfactual$/PR
Current · gpt-4o$0.042
Alternate · haiku & verify$0.034
Same acceptance, 18% spend.
312 runs replayed
工作原理

Record, replay, compare.

01
Record

Yardstick keeps your agent's full run history.

02
Replay

Re-run it against a new prompt, model, or configuration.

03
Compare

Ship the change only when the counterfactual wins.

衡量项

它衡量什么。

01
镜像的线上流量

每一次比较都是你的智能体刚发出的真实请求,同时发往两边。没有合成提示词,也没有存储的历史。

02
模型、提示词或配置分支

每个分支只改一件事。请求的其余部分逐字节相同,这才让两者可比。

03
正面对比打分

LLM 评审对两边答案打分,并交换呈现顺序各评一次,避免位置偏差决定胜负。

04
以显著性判定胜者

对配对判定做符号检验,让 8 比 4 如实呈现为一次抛硬币。

05
实验自身的成本,明示

镜像会花掉你在服务商的钱。这次比较花了多少就写在页面上,不藏起来。

适合谁

谁会选择 Replay。

  • ·在迭代提示词的团队
  • ·在调优配置的智能体构建者
  • ·在发布智能体更新的团队
同一套件

与 Observe 的其余工具搭配使用。

想把 Replay 加入你的技术栈?

我们正在招募设计合作伙伴。加入等候名单,进入 Replay 的合作批次。

只需填写邮箱。 Replay 上线时只发一封邮件。别无其他。