회귀 테스트는 어떻게 만들까
각 형식에서 실패하기 쉬운 문서 5~10개를 골라 사람이 핵심 문장, 표 셀, 제목 경계를 표시합니다. 변환 뒤 이 요소가 존재하는지와 순서가 맞는지 자동 검사하고, 읽기 순서처럼 단순 문자열 비교로 부족한 항목은 사람이 표본 검토합니다. 라이브러리나 선택 dependency를 업데이트할 때 같은 세트를 다시 실행합니다.
변환 성공률은 예외 없이 파일이 끝났다는 지표일 뿐입니다. 필수 요소 보존률, 잘못 추가된 text, 처리 시간과 peak memory를 함께 기록해야 합니다. 대용량 파일 하나가 worker를 점유하거나 VLM 재시도가 과도하게 발생하는 경우를 찾기 위해 크기 구간별 분포도 봅니다.
실패 문서는 빈 Markdown으로 저장하지 않고 상태와 원인을 별도 queue에 둡니다. 암호화 파일, 손상 파일, 지원하지 않는 형식, 일시적 VLM 오류는 서로 다른 재처리 정책이 필요합니다. 수동 보정한 결과가 있다면 다음 자동 변환에서 덮어쓰지 않도록 원본, 자동 결과, 검수 결과를 분리해야 합니다.
품질 검사가 통과한 문서만 다음 청킹 단계로 보내면 변환 실패가 검색 품질 문제로 숨어드는 것을 막을 수 있습니다.