Heretic는 오픈 가중치 LLM의 거부 행동과 연관된 활성값 방향을 찾고 일부 가중치가 그 방향을 만들지 못하도록 수정하는 연구, 도구 접근입니다. 별도 파인튜닝 데이터로 모델을 다시 학습하지 않는다는 장점이 있지만 지능을 그대로 보존한 채 안전 스위치 하나만 끈다고 단정할 수는 없습니다. 거부 감소, 일반 품질과 위험 출력의 변화는 서로 다른 평가로 확인해야 합니다.
Heretic는 LLM 거부 방향을 어떻게 바꾸나: 절제, 품질, 안전 검증
거부 방향은 어떻게 찾나
기존 설명은 유해하다고 분류된 프롬프트와 무해한 프롬프트를 모델에 넣고 여러 레이어의 residual stream 활성값을 비교하는 과정을 소개했습니다. 두 집합의 평균 차이는 거부 행동과 상관된 후보 방향으로 사용됩니다. 이는 모델 내부의 복잡한 안전 행동 전체가 하나의 벡터라는 증명이라기보다 특정 데이터에서 관찰된 선형 신호입니다.
프롬프트 표현, 언어, 모델과 레이어가 바뀌면 방향도 달라질 수 있습니다. 유해, 무해 집합의 주제나 문체가 다르면 거부가 아니라 데이터셋 스타일을 찾을 수도 있습니다. 같은 의미의 표현 변형과 별도 평가 세트를 두고 후보 방향이 실제 거부 행동과 반복해서 연결되는지 확인해야 합니다.
Heretic 저장소의 현재 지원 모델과 평가 구성이 기존 소개 글의 설명과 일치하는지도 직접 확인해야 합니다. 저장소 동작을 다른 모델 아키텍처에 자동 일반화하지 않습니다.
가중치 직교화는 무엇을 바꾸나
후보 방향을 찾은 뒤 attention output projection과 MLP down projection 같은 가중치가 그 방향의 성분을 만들지 못하도록 직교화하는 방식이 소개됩니다. 모델이 특정 거부 표현으로 이동하는 경로를 약화하려는 것입니다. 학습 스텝 없이 행렬을 직접 수정할 수 있다는 점이 파인튜닝과 다릅니다.
그러나 같은 방향이 일반적인 위험 판단, 불확실성 표현이나 일부 유용한 추론에도 쓰일 수 있습니다. 한 성분을 제거하면 관련 없는 작업이 미세하게 또는 크게 변할 수 있습니다. 수정 레이어와 강도별로 거부율, 일반 품질과 출력 분포를 함께 봐야 합니다.
가중치 변경은 체크포인트 자체를 새 모델로 만듭니다. 원본과 수정본의 hash, 적용한 레이어, 방향, 강도와 도구 버전을 기록해야 결과를 재현하고 되돌릴 수 있습니다. 이름만 같은 수정 모델을 여러 설정에서 섞지 않습니다.
TPE 최적화는 무엇을 탐색하나
기존 글은 Optuna의 TPE를 이용해 수정할 레이어와 강도 같은 후보를 자동 탐색하고, 거부 횟수와 원본 대비 KL 발산을 동시에 줄이는 목표를 소개했습니다. 수동으로 설정 하나를 고르는 것보다 여러 교환 관계를 체계적으로 비교할 수 있습니다. 자동화는 탐색 노동을 줄이지만 목적 함수의 한계를 없애지 않습니다.
평가 프롬프트가 좁으면 그 집합의 거부만 줄이고 다른 표현에서는 그대로이거나 예상하지 못한 출력을 만들 수 있습니다. KL 발산이 작아도 사실성, 코딩, 수학, 긴 문맥과 도구 호출 같은 실제 능력은 별도입니다. 최적화에 쓴 데이터와 최종 검증 데이터는 분리해야 합니다.
탐색 trial 수와 하드웨어가 늘면 시간, 비용도 커집니다. 특정 8B, GPU의 소요 시간을 모든 모델 크기에 적용하지 말고 모델 로딩, 활성값 수집, 평가와 저장을 포함한 끝단 비용을 측정합니다.
기존 파인튜닝과 무엇이 다른가
DPO, ORPO 같은 파인튜닝은 예시 데이터와 목적 함수를 통해 여러 가중치를 업데이트합니다. 방향성 절제는 후보 거부 신호를 찾고 행렬 성분을 직접 바꿉니다. 데이터 준비와 전체 학습을 줄일 수 있지만 행동을 세밀하게 재학습하는 것과 같은 통제력은 기대하기 어렵습니다.
사후 수정이 빠르다는 사실과 결과가 더 안전하거나 품질이 높다는 사실은 다릅니다. 특정 합법 업무의 과잉 거부를 줄이는 목적이라면 먼저 시스템 지침, 라우팅과 좁은 정책 조정으로 해결 가능한지 비교합니다. 가중치 변경은 영향 범위가 넓고 되돌릴 수 있는 배포 절차가 필요합니다.
실행 예시는 어떤 범위만 보여 주나
기존 글에는 다음 CLI 형태가 포함되어 있습니다.
1
2
# Gemma-3-12B 모델의 검열을 해제하고 결과를 평가하는 명령어 예시
heretic --model google/gemma-3-12b-it --evaluate-model p-e-w/gemma-3-12b-it-heretic
이 명령은 도구의 호출 모양을 보여 주는 시점별 예시입니다. 현재 패키지 설치, 모델 접근권한, 저장 공간, 양자화, 출력 경로와 평가 데이터가 빠져 있어 완전한 재현 절차가 아닙니다. 실행 전 저장소 문서와 코드에서 인수 의미와 지원 버전을 확인해야 합니다.
원본 모델과 데이터 라이선스, 수정 모델의 배포 조건도 별도로 검토합니다. 모델을 받을 수 있다는 사실이 수정본을 공개 서비스나 재배포에 사용할 권리를 자동으로 주지 않습니다.
품질 손상은 어떤 세트로 확인할까
거부 평가와 독립적으로 일반 지식, 사실성, 지시 이행, 코딩, 수학, 다국어와 긴 문맥을 포함합니다. 원본과 수정본을 같은 프롬프트, 디코딩 설정에서 여러 번 비교하고 작업별 승패를 봅니다. 평균 점수가 유지돼도 특정 안전, 전문 영역이 크게 퇴행할 수 있습니다.
답변을 강제로 내는 것과 유용한 답을 내는 것도 분리합니다. 원래 거부하던 질문에 길고 자신 있는 허위 정보를 만들 수 있습니다. 정답, 근거가 있는 합법적 경계 사례와 명확히 위험한 사례를 함께 평가해야 합니다.
KL 발산은 진단 항목 중 하나로 사용하고 사람, 작업 기반 평가를 대체하지 않습니다. 출력 분포가 비슷해도 한 토큰 차이가 도구 호출과 코드 실행에서 큰 부작용을 만들 수 있습니다.
안전 평가는 왜 별도 관문이어야 하나
거부율을 낮추는 목적 함수는 본질적으로 위험한 요청에 대한 장벽도 약화할 수 있습니다. 수정 모델을 공격 코드, 개인정보 침해, 자해와 기타 위해 도메인에서 평가하고 실제 서비스의 이용 목적과 접근 대상을 제한해야 합니다. “합법적인 내부 용도”라는 설명만으로 런타임 위험이 줄어들지는 않습니다.
연구 환경에서는 네트워크, 도구 권한이 없는 격리된 추론부터 시작합니다. 외부 행동을 수행하는 에이전트에 연결하려면 별도의 정책 모델, 결정론적 도구 허용 목록과 사람 승인을 둡니다. 위험 출력과 사용 이력을 감사할 수 있어야 합니다.
수정 모델이 과잉 거부를 줄였더라도 필요한 경고와 불확실성까지 사라지는지 확인합니다. 최종 안전 통제는 모델 가중치 하나가 아니라 사용자 인증, 데이터, 도구 권한, 모니터링과 사고 대응의 여러 층으로 구성해야 합니다.
연구용 PoC는 어떤 순서로 진행할까
먼저 수정 목적을 합법적이고 좁은 경계 사례로 정의하고 원본 모델의 과잉 거부와 정상 품질 기준선을 만듭니다. 별도 검증 세트와 위험 평가 세트를 준비합니다. 원본 체크포인트를 보존하고 작은 모델에서 제한된 설정을 비교합니다.
각 후보에 거부 감소, 유용성, 사실성, 일반 능력, 위험 출력과 계산 비용을 함께 기록합니다. 자동 최적화가 선택한 결과를 그대로 승격하지 않고 사람이 실패 사례와 로그를 검토합니다. 외부 배포 전에 접근 통제와 중단, 복구를 시험합니다.
Heretic의 의미는 모델 행동과 연관된 내부 방향을 직접 수정하고 자동 탐색할 수 있다는 데 있습니다. 이를 “지능 손상 없는 검열 스위치”로 표현하면 근거를 넘어섭니다. 유용성과 안전의 변화 전체를 측정할 수 있는 환경에서만 연구 도구로 다루는 것이 정확합니다.
수정본을 보존하거나 공유할 때는 원본 모델, 적용 설정, 평가 결과와 체크포인트 해시를 한 묶음으로 남겨야 후속 검증과 롤백이 가능합니다.
함께 읽으면 이해가 이어지는 글
- Understand-Anything 지식 그래프를 믿어도 될까: AST 관계와 LLM 추론 구분법 — Understand-Anything이 코드 구조와 비즈니스 의미를 지식 그래프로 만드는 과정을 살펴보고, 명시적 관계와 LLM 추론을 구분해 온보딩, 영향 분석에 안전하게 쓰는 법을 정리합니다.
- AstrBot: 단일 코드베이스로 모든 메신저에 똑똑한 AI 에이전트를 배포하는 방법 — 파편화된 메신저 플랫폼과 다수의 대형 언어 모델(LLM)을 하나로 통합하여, 샌드박스 기반의 안전한 코드 실행과 웹 시각화 도구를 제공하는 오픈소스 에이전트 프레임워크 AstrBot의 내부 아키텍처와 활용법을 깊이 있게 분석합니다.
- Openwork: 내 컴퓨터에서 50개 이상의 LLM으로 자유롭게 일하는 오픈소스 AI 동료 — Openwork는 앤트로픽의 독점 데스크톱 에이전트인 Claude Cowork를 대체하는 오픈소스 데스크톱 애플리케이션입니다. Tauri와 OpenCode 엔진을 기반으로 내 컴퓨터의 파일 시스템과 50개 이상의 다양한 LLM…
자주 묻는 질문
Heretic는 파인튜닝 없이 모델의 모든 거부를 안전하게 제거하나요?
보장되지 않습니다. 특정 프롬프트에서 찾은 거부 방향을 가중치에서 약화하는 방식이며 일반 추론, 사실성, 안전 행동이 함께 변할 수 있습니다.
KL 발산이 작으면 원본 모델의 능력이 그대로 유지되나요?
아닙니다. 평가 프롬프트의 출력 분포가 비슷하다는 신호일 뿐 드문 작업, 긴 문맥과 도구 사용의 퇴행까지 모두 보증하지는 않습니다.
수정한 모델을 바로 외부 서비스에 배포해도 되나요?
안 됩니다. 격리된 연구 환경에서 품질, 안전, 오용 평가를 거치고 접근 권한, 출력 필터, 감사 로그와 사람 승인 등 별도 통제를 마련해야 합니다.
←→ 키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.