A/B 테스트는 의견이 아니라 실험으로 답을 냅니다. 버전 A(대조군)와 버전 B(변형)를 트래픽을 무작위로 나눠 동시에 노출시키고, 클릭률·전환율 같은 지표를 비교합니다. "동시에"가 핵심입니다 — 순서대로 A를 한 달, B를 한 달 돌리면 계절성·트렌드 같은 다른 변수가 섞여 어느 쪽 때문에 지표가 바뀐 건지 알 수 없습니다.
숫자 하나가 더 높다고 바로 승자를 선언하면 안 됩니다. 표본이 작으면 우연히 갈린 차이를 진짜 효과로 착각하기 쉬워서, 통계적 유의성(우연히 이 정도 차이가 날 확률이 충분히 낮은가)을 확인하고 나서야 결론을 냅니다.
사용성 테스트가 "왜"(어디서 헤매는가)를 알려주는 정성적 방법이라면, A/B 테스트는 "어느 쪽이 더 나은가"를 알려주는 정량적 방법입니다. 보통 사용성 테스트로 후보안을 좁힌 뒤 A/B 테스트로 실제 트래픽에서 검증하는 순서로 이어집니다.
아래 카운터는 개념을 보여주기 위한 예시 데이터이며 실제 실험 결과가 아닙니다.
언제 쓰나
이미 후보가 둘로 좁혀졌고 트래픽이 충분할 때 최종 결정에 씁니다. 트래픽이 적으면 유의미한 차이를 보는 데 오래 걸리니 정성적 방법을 먼저 고려하세요.