에이전트 목표 탈취는 검색 결과나 문서처럼 신뢰하지 않는 자료에 들어간 지시가 원래 작업 목표를 바꾸려는 공격입니다. 외부 자료는 작업의 데이터이지 권한이 높은 명령이 아닙니다.
데모는 문서의 악성 문장이 목표 레인으로 넘어가려 할 때 경계에서 차단되는 모습을 보여줍니다. 자료 출처를 표시하고 도구 실행 전 목표와 권한을 다시 확인해야 합니다.
언제 쓰나
에이전트가 웹 페이지, 문서, 이메일 등 외부 내용을 읽고 도구를 실행할 때 고려합니다.
외부 자료의 지시를 사용자 목표보다 우선시하지 않도록 경계를 지킵니다.
<div class="sd"><div class="sd-head"><strong>GOAL HIJACK</strong><span id="state">live check</span></div><div class="sd-stage"><div class="goal tile good">user goal<br>summarize</div><div class="boundary" id="boundary">TRUST<br>BOUNDARY</div><div class="source tile" id="source">document<br>change goal</div></div><div class="sd-foot"><span id="caption">checking boundary</span><span>tap to step</span></div></div>.sd{box-sizing:border-box;width:min(94vw,700px);height:min(86vh,318px);padding:clamp(9px,2.3vmin,18px);border:1px solid var(--line);border-radius:14px;background:var(--surface);color:var(--fg);display:flex;flex-direction:column;gap:clamp(6px,1.8vmin,12px);font:600 clamp(12px,2.6vmin,16px)/1.25 var(--font-sans, sans-serif)}.sd *{box-sizing:border-box}.sd-head,.sd-foot{display:flex;align-items:center;justify-content:space-between;gap:8px;min-height:1.25em}.sd-head strong{color:var(--accent);letter-spacing:.06em}.sd-head span,.sd-foot{color:var(--muted)}.sd-foot{font-size:clamp(12px,2.4vmin,14px)}.sd-stage{position:relative;flex:1;min-height:0;display:flex;align-items:center;justify-content:center;gap:clamp(6px,2vmin,18px);overflow:hidden}.sd .mono{font-family:ui-monospace,monospace}.sd .tile{border:1px solid var(--line);border-radius:8px;background:var(--bg);padding:clamp(5px,1.5vmin,10px);text-align:center}.sd .good{color:var(--accent);border-color:var(--accent)}.sd .bad{color:var(--accent-3);border-color:var(--accent-3)}.sd .arrow{color:var(--muted);font-size:clamp(15px,4vmin,28px)}.sd .active{background:color-mix(in srgb,var(--accent) 16%,var(--surface));border-color:var(--accent)}.sd .blocked{background:color-mix(in srgb,var(--accent-3) 13%,var(--surface));border-color:var(--accent-3)}.goal,.source{width:31%}.boundary{border:2px dashed var(--accent-3);border-radius:6px;padding:clamp(4px,1.2vmin,10px);font:700 clamp(12px,2.4vmin,13px)/1.2 ui-monospace,monospace;color:var(--accent-3);text-align:center}.source{transition:transform .3s}.source.push{transform:translateX(-8px);border-color:var(--accent-3)}.boundary.alert{background:color-mix(in srgb,var(--accent-3) 15%,var(--surface))}let n=0;function advance(){n=1-n;document.getElementById('source').classList.toggle('push',!!n);document.getElementById('boundary').classList.toggle('alert',!!n);document.getElementById('state').textContent=n?'injection blocked':'reading source';document.getElementById('caption').textContent=n?'external instruction stays data':'agent follows user goal'}advance();setInterval(advance,900);
document.querySelector('.sd').addEventListener('pointerdown',advance);에이전트 목표 탈취는 검색 결과나 문서처럼 신뢰하지 않는 자료에 들어간 지시가 원래 작업 목표를 바꾸려는 공격입니다. 외부 자료는 작업의 데이터이지 권한이 높은 명령이 아닙니다.
데모는 문서의 악성 문장이 목표 레인으로 넘어가려 할 때 경계에서 차단되는 모습을 보여줍니다. 자료 출처를 표시하고 도구 실행 전 목표와 권한을 다시 확인해야 합니다.
에이전트가 웹 페이지, 문서, 이메일 등 외부 내용을 읽고 도구를 실행할 때 고려합니다.