Disponible

Experiments.

Prueba variantes A/B/n contra resultados reales.

Experiments convierte el ajuste en evidencia. Ejecuta variantes de prompt, modelo y configuración cara a cara contra la métrica de resultado real, sobre tráfico en vivo o historial reproducido, y deja que la significancia estadística elija al ganador. Se construye sobre Arena y Replay.

p < 0.05
Experiment · 3 variantsacceptance
A control18%
B verify-first 24%
C cheaper model15%
Winner: B (+33%)
1,902 runs
Cómo funciona

Vary, test, promote.

01
Vary

Set up prompt, model, or config variants for one agent.

02
Test

Run them against the real outcome metric, live or on replayed history.

03
Promote

Significance picks the winner. Promote it, fully logged and reversible.

Las palancas

Lo que mejora.

01
Variantes A/B/n

Prueba varios prompts, modelos o configuraciones a la vez contra la misma métrica de resultado.

02
Evaluación por pares con LLM-as-judge

Dos variantes, cara a cara, puntuadas por un juez LLM guiado por una rúbrica o por votos humanos. La forma más rápida de zanjar '¿esto es mejor?'

03
Significancia integrada

Ganadores decididos por confianza estadística y tamaño de muestra, no por un pico de un día.

04
Tráfico en vivo

Refleja una parte de tus llamadas reales de producción. Nada de lo que envías se almacena, así que no hay historial grabado que reproducir.

05
Promoción en un clicLo siguiente

Promueve la variante ganadora a producción, totalmente registrada y reversible.

Para quién es

Quién recurre a Experiments.

  • ·Equipos que lanzan cambios de agentes
  • ·Operadores que quieren pruebas antes del despliegue
  • ·Equipos de plataforma que estandarizan agentes
Misma suite

Combina con el resto de Optimize.

¿Quieres Experiments en tu stack?

Estamos incorporando socios de diseño ahora. Únete a la lista de espera para estar en la cohorte de Experiments.

Solo el correo es obligatorio. Un solo correo cuando Experiments se lance. Nada más.