연구가 확인한 오탐과 놓침의 범위
2023년 International Journal for Educational Integrity에 실린 Weber-Wulff 연구팀의 원문은 공개 도구 12개와 상용 시스템 2개를 54개 영어 문서에 적용했습니다. 사람 작성, 기계 번역, AI 생성, 사람 편집, 자동 바꿔쓰기 등 여섯 범주의 문서로 총 756회 검사를 구성했고, 당시 도구들이 AI와 사람 글을 신뢰성 있게 구분하지 못한다고 결론 내렸습니다.
같은 해 Patterns에 실린 Liang 연구팀의 연구는 영어가 모국어가 아닌 사람이 작성한 TOEFL 에세이 91개를 일곱 탐지기로 검사했습니다. 평균 61.22%가 AI 생성으로 잘못 분류됐고, 91개 중 89개는 적어도 한 도구에서 표시됐습니다. 이 결과는 비원어민 영어 글에 대한 공정성 위험을 보여줍니다.
{
"type": "bar",
"data": {
"labels": ["7개 탐지기의 평균 오탐", "한 도구 이상에서 AI로 분류"],
"datasets": [
{
"label": "에세이 비율",
"data": [61.22, 97.80],
"backgroundColor": ["#2457ff", "#20ad91"]
}
]
},
"options": {
"indexAxis": "y",
"responsive": true,
"scales": {
"x": {
"beginAtZero": true,
"max": 100,
"title": { "display": true, "text": "비율 (%)" }
}
},
"plugins": {
"title": { "display": true, "text": "비원어민 영어 에세이 91편의 오탐 관찰" },
"subtitle": { "display": true, "text": "Liang 외, Patterns 2023. 한국어와 최신 제품의 성능으로 일반화할 수 없음" }
}
}
}
그러나 이 숫자를 “2026년 모든 탐지기의 한국어 오탐률이 61.22%”라고 쓰면 또 다른 오류입니다. 두 연구는 2023년 당시 도구, 특정 영어 문서와 모델을 다뤘습니다. 탐지기는 계속 업데이트됐고 한국어 성능을 직접 측정한 설계가 아닙니다. 반면 실험 조건이 바뀔 때 성능과 편향도 달라진다는 사실은 고위험 결정에 단일 점수를 쓰지 말아야 할 이유가 됩니다.
| 연구 | 직접 검증한 범위 | 현재 판단에 주는 의미 | 일반화하면 안 되는 것 |
|---|
| Weber-Wulff 외, 2023 | 14개 도구, 54개 영어 문서, 당시 ChatGPT와 편집 조건 | 도구와 변형 조건에 따라 거짓 양성과 거짓 음성이 생김 | 최신 모든 제품의 현재 정확도 |
| Liang 외, 2023 | 7개 도구, 비원어민 영어 TOEFL 에세이 91개 | 언어 배경과 문체가 공정성에 영향을 줄 수 있음 | 한국어 문서의 수치 |
| PeerJ Computer Science, 2025 | 세 탐지기, 최신 모델 생성 및 AI 보조 학술 초록 | 정확도와 편향 사이의 절충이 계속 관찰됨 | 과제, 소설, 채용 문서 전체 |
2025년 PeerJ Computer Science 연구도 GPTZero, ZeroGPT, DetectGPT를 학술 초록에 적용해 정확도와 비원어민 저자 및 학문 분야 편향의 절충을 보고했습니다. 연구마다 자료와 모델이 다르므로 숫자를 한 줄 순위로 합치기보다 내 문서와 조건이 연구 범위에 들어가는지 확인해야 합니다.