강화학습 개인화

Reinforcement learning personalization

발송 뒤 관찰한 반응을 보상으로 삼아 다음 선택 비율을 바꿉니다.

···
html
<div class="learn"><div class="headline">ROUND <b id="round">1</b> <span>OBSERVE → UPDATE</span></div><div class="arm"><label>HELP</label><div class="rail"><i id="helpbar"></i></div><b id="helpnum">50%</b></div><div class="arm"><label>OFFER</label><div class="rail"><i id="offerbar"></i></div><b id="offernum">50%</b></div><div class="reward" id="reward">REWARD: HELP +1</div></div>
css
.learn{width:min(91%,590px);font:800 clamp(10px,3.2vmin,15px)/1.2 var(--font-sans)}.headline{border-bottom:2px solid var(--fg);padding-bottom:clamp(8px,2vmin,16px);display:flex;gap:6px}.headline span{margin-left:auto;color:var(--muted)}.arm{display:grid;grid-template-columns:clamp(40px,11vmin,75px) 1fr 35px;align-items:center;gap:8px;margin:clamp(13px,4vmin,25px) 0}.rail{height:clamp(19px,5vmin,32px);background:var(--line)}.rail i{display:block;height:100%;width:50%;background:var(--accent);transition:width .5s}.arm:nth-of-type(3) .rail i{background:var(--fg)}.arm b{text-align:right}.reward{background:var(--surface);border:2px solid var(--line);padding:clamp(7px,2vmin,14px);text-align:center}
js
const rounds=[[1,50,50,'HELP +1'],[2,65,35,'HELP +1'],[3,58,42,'OFFER +1'],[4,72,28,'HELP +1']];let n=0;function show(){const [round,help,offer,reward]=rounds[n];document.querySelector('#round').textContent=round;document.querySelector('#helpbar').style.width=help+'%';document.querySelector('#offerbar').style.width=offer+'%';document.querySelector('#helpnum').textContent=help+'%';document.querySelector('#offernum').textContent=offer+'%';document.querySelector('#reward').textContent='REWARD: '+reward;n=(n+1)%rounds.length}show();setInterval(show,1800);

강화학습 개인화는 실제 고객 반응을 보상 신호로 받아 다음 메시지나 제안을 조정합니다. Braze는 2025년 의사결정 제품 발표에서 고객 행동에 따른 지속적 실험과 적응을 설명했습니다.

데모에서는 두 제안의 성공 결과를 관찰한 뒤 다음 라운드의 배분 비율이 바뀝니다. 기존 AI 의사결정 항목이 예상 점수로 현재 선택을 보여준다면, 이 항목은 결과를 이용해 정책을 갱신하는 과정을 보여줍니다.

클릭만 보상으로 삼으면 원치 않는 메시지를 많이 보내고도 좋아 보일 수 있습니다. 장기 가치와 수신 거부를 함께 측정하세요.

언제 쓰나

여러 제안의 배분을 고객 반응에 맞춰 계속 조정할 때 씁니다.

페이지로 열기 ↗