사내 비교용 질문 세트를 구성한다
공개 benchmark를 다시 묻기보다 실제 업무에서 이미 정답과 검수 기준이 있는 문제를 모읍니다. 짧은 계산, 긴 문서 근거 찾기, code 수정, 한국어 설명, 최신 자료 검색을 나누고 각 문제의 허용 시간과 source 요구를 적습니다. 모델 이름을 가린 채 결과를 검토하면 발표 이미지의 선입견을 줄일 수 있습니다.
검색이 필요한 질문은 사전 지식 답변과 검색 도구 사용 답변을 구분합니다. 인용된 페이지가 주장을 직접 뒷받침하는지, 서로 다른 날짜의 사실을 섞지 않았는지, 불확실한 내용을 명시했는지를 채점합니다. 코딩 문제는 설명이 아니라 실제 test, 문서 문제는 원문의 근거 위치로 완료를 판정합니다.
마지막 표에는 성공률만 아니라 실패 한 건의 영향과 사람 수정 시간을 둡니다. 평균 점수가 높아도 자신 있게 틀린 답이 잦다면 검토 비용이 커집니다. Grok 3의 선택은 경쟁 모델과 같은 조건에서 이 표를 채운 뒤에 내려야 합니다.
비교 결과를 저장할 때는 질문, model과 mode, 실행 날짜, tool 허용 범위, 원문 답과 사람 판정을 함께 보관합니다. 모델이 갱신되면 같은 세트를 다시 실행해 개선과 회귀를 확인할 수 있습니다. 제품 이름만 기록하면 나중에 어느 version을 평가했는지 알 수 없습니다.