Prompt-set benchmark

질문 세트 벤치마크

Rerun a fixed question set to observe answer variability and change.

···
html
<div class="scene bench"><div class="row"><span class="label">REPEATED QUESTION SET</span><strong id="run">RUN 1 / 3</strong></div><div class="chart"><div class="axis">Q1<span id="q1"></span></div><div class="axis">Q2<span id="q2"></span></div><div class="axis">Q3<span id="q3"></span></div></div><div class="ranges">same prompts · variable answers</div></div>
css
.scene{width:min(92%,680px);max-height:94%;font:700 clamp(10px,max(1.7vmin,1vw),15px)/1.3 sans-serif;color:var(--fg)}.label{font:900 clamp(10px,max(1.3vmin,1vw),12px)/1 sans-serif;letter-spacing:.12em;color:var(--accent)}.panel{background:var(--surface);border:1px solid var(--line);padding:clamp(8px,2vmin,18px)}.muted{color:var(--muted)}.accent{color:var(--accent)}.row{display:flex;align-items:center;gap:clamp(5px,1.2vmin,10px)}.pill{display:inline-block;padding:.35em .6em;border:1px solid var(--line);border-radius:30px}button{cursor:pointer;font:inherit}@media(min-width:700px){.scene{transform:scale(1.5)}}.bench{max-width:570px}.bench .row{justify-content:space-between}.bench strong{color:var(--accent)}.chart{display:grid;gap:clamp(9px,2vmin,19px);margin:clamp(17px,4vmin,34px) 0}.axis{display:flex;align-items:center;gap:10px;font-size:clamp(10px,max(1.4vmin,1vw),12px)}.axis span{display:block;height:clamp(11px,2vmin,19px);background:var(--accent);min-width:5%;transition:width .5s;position:relative}.axis span::after{content:'';position:absolute;right:0;top:-4px;bottom:-4px;border-right:2px solid var(--fg)}.ranges{border-top:1px solid var(--line);padding-top:8px;color:var(--muted);font-size:clamp(10px,max(1.3vmin,1vw),12px)}
js
const vals=[[58,42,70],[63,35,76],[54,49,68]];let i=0;function draw(){document.querySelector('#run').textContent='RUN '+(i+1)+' / 3';vals[i].forEach((v,n)=>document.querySelector('#q'+(n+1)).style.width=v+'%');i=(i+1)%3}draw();setInterval(draw,1500);

A prompt-set benchmark groups realistic customer questions and checks them consistently across runs or search environments. It avoids treating a couple of examples as the whole picture.

The demo runs three questions over three rounds and draws their movement. It exposes variability that an average can hide.

Keep the prompt list, region, language, date, and scoring rule together. Answers may vary, so avoid declaring a winner from one run.

When to use

Use it to track GEO work over time while retaining answer variability.

Open as page ↗