DOM snapshot으로 오탐 비용을 먼저 잰다
정상 page snapshot 20~50개와 과거 layout을 모으고 class rename, wrapper 삽입, section 이동, 추천 card 추가와 전면 개편을 재생합니다. strict selector, adaptive와 사람이 갱신한 selector를 비교해 true recovery, false match, fail-closed와 처리 시간을 분류합니다. “무언가를 찾음”을 성공으로 세지 않고 정확한 entity, field가 맞아야 통과시킵니다.
변경 정도와 adaptive confidence에 따라 정책을 나눌 수 있습니다. 높은 confidence이고 ID, schema, 분포가 모두 맞으면 임시 결과로 사용하고, 핵심 selector가 새 위치로 이동하거나 confidence가 낮으면 quarantine합니다. 자동으로 새 fingerprint를 영구 저장하기 전 diff와 대표 screenshot을 review해야 한 번의 오탐이 이후 기준으로 굳지 않습니다.
운영 metric은 page success, selector fallback 비율, false-match 표본, field null, duplicate, browser 전환율, p95 시간과 request, CPU 비용입니다. 갑자기 adaptive 비율이 오르면 “자가 치유 성공”이 아니라 site 변화 경보로 취급합니다. 원본 HTML과 추출 version을 제한 기간 보존해야 잘못 수집한 값을 재처리할 수 있습니다.
수집 허용 범위도 코드와 별도 register로 관리합니다. domain owner, 이용 조건 검토일, 요청 속도, 보존 data와 삭제 경로를 기록합니다. 로그인 우회나 탐지 회피를 성공 지표로 삼지 않고 공식 API, export가 생기면 그 경로로 전환합니다. 기술적 복원력은 데이터 권리와 정확성 검토를 대신하지 않습니다.