강화학습 개인화는 실제 고객 반응을 보상 신호로 받아 다음 메시지나 제안을 조정합니다. Braze는 2025년 의사결정 제품 발표에서 고객 행동에 따른 지속적 실험과 적응을 설명했습니다.
데모에서는 두 제안의 성공 결과를 관찰한 뒤 다음 라운드의 배분 비율이 바뀝니다. 기존 AI 의사결정 항목이 예상 점수로 현재 선택을 보여준다면, 이 항목은 결과를 이용해 정책을 갱신하는 과정을 보여줍니다.
클릭만 보상으로 삼으면 원치 않는 메시지를 많이 보내고도 좋아 보일 수 있습니다. 장기 가치와 수신 거부를 함께 측정하세요.
언제 쓰나
여러 제안의 배분을 고객 반응에 맞춰 계속 조정할 때 씁니다.