제공 중
Experiments.
실제 성과를 기준으로 변형을 A/B/n 테스트하세요.
Experiments는 튜닝을 증거로 바꿉니다. 프롬프트, 모델, 설정 변형을 실제 성과 지표 기준으로 라이브 트래픽이나 다시 돌린 이력에서 정면 대결시키고, 통계적 유의성이 승자를 고르게 하세요. Arena와 Replay 위에 세워집니다.
p < 0.05
Experiment · 3 variantsacceptance
A control18%
B verify-first ▲24%
C cheaper model15%
Winner: B (+33%)
1,902 runs
작동 방식
Vary, test, promote.
01
Vary
Set up prompt, model, or config variants for one agent.
02
Test
Run them against the real outcome metric, live or on replayed history.
03
Promote
Significance picks the winner. Promote it, fully logged and reversible.
레버
무엇을 개선하는가.
01
A/B/n 변형
여러 프롬프트, 모델, 설정을 같은 성과 지표 기준으로 한 번에 테스트합니다.
02
LLM 판정 쌍별 평가
두 변형을 정면 대결시켜, 루브릭 기반 LLM 판정이나 사람 투표로 채점합니다. '이게 더 나은가?'를 가리는 가장 빠른 방법.
03
유의성 내장
하루의 급등이 아니라 통계적 신뢰도와 표본 크기로 승자를 정합니다.
04
라이브 트래픽
실제 프로덕션 호출의 일부를 미러링합니다. 보내는 내용은 저장되지 않으므로 다시 재생할 기록된 이력이 없습니다.
05
원클릭 승격다음 차례
이긴 변형을 프로덕션으로 승격합니다. 전부 기록되고 되돌릴 수 있습니다.
누구를 위한 것인가
누가 Experiments을 찾는가.
- ·에이전트 변경을 출시하는 팀
- ·출시 전에 증거를 원하는 운영자
- ·에이전트를 표준화하는 플랫폼 팀
같은 스위트
Optimize의 나머지와 함께 씁니다.
Experiments을 당신의 스택에 두고 싶으신가요?
지금 디자인 파트너를 온보딩하고 있습니다. Experiments 코호트에 들어오려면 대기자 명단에 등록하세요.
이메일만 입력하면 됩니다. Experiments이 출시되면 이메일 한 통만. 그 외에는 없습니다.