已上线

Experiments.

用真实成果做 A/B/n 测试。

Experiments 把调优变成证据。在真实流量或重放的历史上,让提示词、模型和配置的变体对照真实成果指标正面对决,由统计显著性选出赢家。构建于 Arena 和 Replay 之上。

p < 0.05
Experiment · 3 variantsacceptance
A control18%
B verify-first 24%
C cheaper model15%
Winner: B (+33%)
1,902 runs
工作原理

Vary, test, promote.

01
Vary

Set up prompt, model, or config variants for one agent.

02
Test

Run them against the real outcome metric, live or on replayed history.

03
Promote

Significance picks the winner. Promote it, fully logged and reversible.

调节杆

它改进什么。

01
A/B/n 变体

一次性用同一个成果指标测试多个提示词、模型或配置。

02
以 LLM 为裁判的成对评测

两个变体正面对决,由依据评分准则的 LLM 裁判或人工投票打分。是了断“这个更好吗?”的最快方式。

03
内置显著性

依据统计置信度和样本量来判定赢家,而非单日的一次飙升。

04
实时流量

镜像你真实生产调用的一部分。你发送的内容不会被存储,因此没有可回放的历史记录。

05
一键晋升即将推出

把获胜变体晋升到生产,全程有日志、可逆。

适合谁

谁会选择 Experiments。

  • ·在发布智能体改动的团队
  • ·希望上线前先有证据的运营者
  • ·在统一智能体规范的平台团队
同一套件

与 Optimize 的其余工具搭配使用。

想把 Experiments 加入你的技术栈?

我们正在招募设计合作伙伴。加入等候名单,进入 Experiments 的合作批次。

只需填写邮箱。 Experiments 上线时只发一封邮件。别无其他。