Experiments.
Testez des variantes en A/B/n contre de vrais résultats.
Experiments transforme le réglage en preuves. Faites s'affronter des variantes de prompt, de modèle et de configuration contre la vraie métrique de résultat, sur du trafic en direct ou de l'historique rejoué, et laissez la significativité statistique désigner le gagnant. S'appuie sur Arena et Replay.
Vary, test, promote.
Set up prompt, model, or config variants for one agent.
Run them against the real outcome metric, live or on replayed history.
Significance picks the winner. Promote it, fully logged and reversible.
Ce qu'il améliore.
Testez plusieurs prompts, modèles ou configurations à la fois contre la même métrique de résultat.
Deux variantes, en duel, évaluées par un juge LLM piloté par une grille ou par des votes humains. Le moyen le plus rapide de trancher « est-ce mieux ? »
Gagnants désignés sur la confiance statistique et la taille d'échantillon, pas sur un pic d'une journée.
Duplique une partie de vos appels de production réels. Rien de ce que vous envoyez n'est conservé, il n'y a donc aucun historique enregistré à rejouer.
Promouvez la variante gagnante en production, entièrement journalisée et réversible.
Qui se tourne vers Experiments.
- ·Équipes qui livrent des changements d'agents
- ·Opérateurs qui veulent des preuves avant le déploiement
- ·Équipes plateforme qui standardisent les agents
S'associe au reste de Optimize.
Vous voulez Experiments dans votre stack ?
Nous intégrons des partenaires de conception en ce moment. Rejoignez la liste d'attente pour faire partie de la cohorte Experiments.
Seul l'e-mail est requis. Un seul e-mail quand Experiments sera en ligne. Rien d'autre.