지시문과 권한 통제는 두 층으로 나눈다
‘외부로 데이터를 보내지 말라’는 문장은 모델에 대한 요청일 뿐 강제 정책이 아닙니다. 파일 시스템은 읽기 전용 볼륨과 작업용 출력 디렉터리로 분리하고, 네트워크 목적지와 HTTP 동작은 샌드박스에서 허용 목록으로 제한해야 합니다. 원문이 설명하는 OpenShell 결합도 지식 주입과 런타임 통제를 각각 맡기는 구상입니다.
환자 데이터 같은 민감 정보가 있다면 식별자가 외부 요청 본문이나 로그에 들어가지 않는지 차단 테스트를 해야 합니다. 에이전트가 금지된 경로 읽기, 임의 패키지 설치, 허용되지 않은 POST를 시도하도록 만들어 정책이 모델 판단과 무관하게 거부하는지 확인하세요.
sandbox manifest에는 read-only input mount, writable output, temp, non-root, CPU, memory, wall time, process, file count, allowed executable와 egress domain을 적습니다. Package install은 runtime에서 막고 승인된 image digest와 lockfile을 사용합니다. Output path 밖 write, symlink, subprocess와 DNS redirect로 network policy를 우회하는 경우도 시험합니다.
Skill이 외부 database, API를 요구한다면 synthetic, least-privilege credential을 별도 capability로 전달합니다. Read와 write를 나누고 연구 sample 제출, 삭제 같은 side effect에는 대상, parameter와 사람 승인을 둡니다. Code, stdout, tool trace에는 patient ID와 secret을 redaction하되 재현에 필요한 version, hash는 남깁니다.