提供中
Experiments.
実際の成果に対してバリアントを A/B/n テスト。
Experiments は、チューニングをエビデンスに変えます。プロンプト、モデル、設定のバリアントを、ライブトラフィックまたは再生した履歴上で、実際の成果指標に対して真っ向から競わせ、統計的有意性に勝者を選ばせます。Arena と Replay の上に構築されています。
p < 0.05
Experiment · 3 variantsacceptance
A control18%
B verify-first ▲24%
C cheaper model15%
Winner: B (+33%)
1,902 runs
仕組み
Vary, test, promote.
01
Vary
Set up prompt, model, or config variants for one agent.
02
Test
Run them against the real outcome metric, live or on replayed history.
03
Promote
Significance picks the winner. Promote it, fully logged and reversible.
動かすレバー
改善するもの。
01
A/B/n バリアント
複数のプロンプト、モデル、設定を、同じ成果指標に対して一度にテスト。
02
LLM-as-judge によるペアワイズ eval
2つのバリアントを真っ向から競わせ、ルーブリック駆動のLLM審判または人間の投票で採点。「こちらの方が良いか?」を決着させる最速の方法。
03
有意性を内蔵
1日の急上昇ではなく、統計的な信頼度とサンプルサイズに基づいて勝者を判定。
04
ライブトラフィック
実際の本番呼び出しの一部をミラーリングします。送信内容は保存されないため、再生できる記録済み履歴はありません。
05
ワンクリックでの昇格次に登場
勝ったバリアントを本番へ昇格。完全に記録され、取り消し可能。
対象となる人
Experiments を使うのは誰か。
- ·エージェントの変更を投入するチーム
- ·ロールアウト前に証拠を求める運用者
- ·エージェントを標準化するプラットフォームチーム
同じスイート
Optimize の他のツールと組み合わせて使えます。
Experiments をあなたのスタックに加えませんか?
現在、デザインパートナーをオンボーディング中です。ウェイトリストに登録して Experiments のコホートに参加しましょう。
メールアドレスだけで登録できます。 Experiments が公開されたら、メールを1通だけお送りします。それ以外は何も送りません。