Live

Experiments.

A/B/n-Varianten gegen echte Ergebnisse testen.

Experiments macht aus Tuning Nachweise. Lassen Sie Prompt-, Modell- und Konfigurationsvarianten Kopf an Kopf gegen die echte Outcome-Metrik laufen, auf Live-Traffic oder abgespielter Historie, und lassen Sie die statistische Signifikanz den Gewinner wählen. Baut auf Arena und Replay auf.

p < 0.05
Experiment · 3 variantsacceptance
A control18%
B verify-first 24%
C cheaper model15%
Winner: B (+33%)
1,902 runs
So funktioniert es

Vary, test, promote.

01
Vary

Set up prompt, model, or config variants for one agent.

02
Test

Run them against the real outcome metric, live or on replayed history.

03
Promote

Significance picks the winner. Promote it, fully logged and reversible.

Die Hebel

Was es verbessert.

01
A/B/n-Varianten

Testen Sie mehrere Prompts, Modelle oder Konfigurationen auf einmal gegen dieselbe Outcome-Metrik.

02
Paarweise Evaluation mit LLM-as-judge

Zwei Varianten, Kopf an Kopf, bewertet von einem rubrikgesteuerten LLM-Judge oder menschlichen Stimmen. Der schnellste Weg, "ist das besser?" zu klären.

03
Signifikanz eingebaut

Gewinner aufgrund von statistischer Konfidenz und Stichprobengröße bestimmt, nicht einer eintägigen Spitze.

04
Live-Traffic

Spiegelt einen Teil Ihrer echten Produktionsaufrufe. Nichts, was Sie senden, wird gespeichert, es gibt also keinen aufgezeichneten Verlauf zum Wiederholen.

05
Beförderung mit einem KlickAls Nächstes

Befördern Sie die Gewinnervariante in die Produktion, vollständig protokolliert und umkehrbar.

Für wen es ist

Wer zu Experiments greift.

  • ·Teams, die Agenten-Änderungen ausliefern
  • ·Betreiber, die vor dem Rollout Beweise wollen
  • ·Plattform-Teams, die Agenten standardisieren
Gleiche Suite

Passt zum Rest von Optimize.

Sie möchten Experiments in Ihrem Stack?

Wir onboarden gerade Design-Partner. Tragen Sie sich in die Warteliste ein, um in der Experiments-Kohorte zu sein.

Nur die E-Mail ist erforderlich. Eine E-Mail, wenn Experiments live geht. Sonst nichts.