설정 조각은 재현 가능한 학습 명령이 아니다
원문의 Python dict는 hybrid_engine, vLLM memory utilization, tensor parallel과 FSDP micro batch 관계를 보여 주는 구성 예시입니다. 데이터, 모델 경로, Ray cluster, reward, 설치 버전과 실행 entrypoint가 없어 완전한 훈련법이 아닙니다. 현재 config schema가 같은지도 저장소에서 확인해야 합니다.
PyTorch, CUDA, vLLM, Ray, NCCL 버전이 어긋나면 actor death와 timeout이 발생할 수 있습니다. 컨테이너 이미지와 lockfile을 고정하고 단일 GPU, 단일 노드에서 보상과 loss를 검증한 뒤 규모를 늘려야 합니다.
재현 manifest에는 base model, tokenizer hash, dataset split, chat template, max prompt, response length, reward code, seed와 모든 engine version을 넣습니다. container가 같아도 GPU type, driver, NCCL topology가 다르면 collective와 memory 결과가 달라집니다. 시작 log에 실제 resolved config와 cluster resource 배치를 저장해 default 값 변화도 추적합니다.
작은 golden batch에서 생성 token, log probability, reward, advantage와 한 update 뒤 parameter checksum을 기준 구현과 비교합니다. 완전한 bit equality가 어려운 distributed 연산은 허용 오차와 통계 기준을 정합니다. 처리량이 높아도 reward mask나 padding이 틀리면 빠르게 잘못 학습하는 것이므로 loss curve만 보고 통과시키면 안 됩니다.