ml-mania-2026이 보여 주는 답은 피처 생성과 반복 실험은 에이전트에 맡길 수 있지만, 검증 분할과 누수 방지는 사람이 먼저 고정해야 한다는 것입니다. 점수를 올리는 루프보다 잘못된 개선을 거부하는 품질 게이트가 더 중요합니다.
피처 실험을 에이전트에 맡겨도 될까: ml-mania-2026의 검증 장치
AutoML과 다른 것은 탐색의 단위다
저장소는 2026 March Machine Learning Mania 대회를 대상으로 한 실험 기록입니다. 정해진 하이퍼파라미터 조합만 돌리는 대신 코딩 에이전트가 도메인 아이디어를 피처 군으로 만들고, 코드를 작성해 검증한 뒤 결과를 기록하는 흐름을 다룹니다. 원문은 저자 Mario Filho를 Kaggle 글로벌 12위 출신으로 소개합니다.
제어면은 checklist-prompt.md와 AGENTS.md 같은 Markdown 문서입니다. 한 피처 군을 끝까지 조사하고 최소 열 개의 새 피처를 시험하며 부분 진행을 완료로 취급하지 말라는 규칙을 둡니다. 에이전트가 조기 종료하거나 엉뚱한 방향으로 갈 때 구현 코드뿐 아니라 행동을 만든 지시문도 고치는 방식입니다.
검색 공간을 어떻게 제한할까
에이전트에게 “점수를 올려라”만 주면 피처 수, 모델 종류와 검증 반복 횟수가 계속 늘어날 수 있습니다. 먼저 허용한 데이터 열, 한 실험에서 바꿀 피처 군, 최대 학습 시간과 총 시도 횟수를 명시해야 합니다. 실패한 시도도 예산을 사용한 결과이므로 성공 기록과 같은 수준으로 남겨야 다음 에이전트가 반복하지 않습니다.
피처 제안과 채택도 분리하는 편이 좋습니다. 제안 단계에서는 도메인 가설, 필요한 시점과 누수 가능성을 쓰게 하고, 실행 단계에서는 승인된 가설만 코드로 옮깁니다. 점수가 오른 뒤에는 해당 피처를 제거한 절제 실험과 여러 시드를 다시 돌립니다. 아이디어를 많이 만드는 능력과 신뢰할 수 있는 결론을 내리는 능력을 같은 단계에 묶지 않는 운영 장치입니다.
기록과 검증이 자동화의 브레이크다
에이전트는 목표 점수만 보면 미래 정보가 섞인 피처도 성과로 받아들일 수 있습니다. 그래서 실험마다 데이터 범위, 피처 정의, 시드, 검증 점수와 실패 이유를 남겨야 합니다. JOURNAL.md 같은 기록이 없으면 같은 아이디어를 반복하거나 이전 제약을 잊은 뒤 결과만 비교하게 됩니다.
원문은 2021~2025년 예측 확률과 시드 기반 기준선의 Pearson 상관을 추적했다고 설명합니다. 공식 검증 폴드 평균은 0.9500, 2026년 최종 제출은 0.9575이며 남성부 0.9519, 여성부 0.9653으로 제시됩니다. 이 값은 대회 성능 자체보다 새 제출이 과거 모델 구조에서 비정상적으로 벗어났는지 보는 진단 신호로 읽는 편이 맞습니다.
시계열 누수는 코드보다 데이터 시점에서 찾는다
경기 결과가 확정된 뒤 갱신된 순위, 시즌 종료 통계나 미래 시장 값이 과거 경기 행에 합쳐지면 모델 코드는 정상이어도 검증은 오염됩니다. 각 열에 “언제 알 수 있었는가”를 붙이고 예측 컷오프 이후 값이 들어오지 않는지 확인해야 합니다. 무작위 분할보다 시즌과 경기 시간의 순서를 보존한 분할이 중요한 이유입니다.
예를 들어 팀의 시즌 평균을 만들 때 현재 경기 결과까지 포함하면 미세한 누수가 생길 수 있습니다. 같은 팀이나 시즌의 정보가 학습과 검증에 중복되는지도 봐야 합니다. 에이전트가 새 집계 피처를 만들 때마다 원천 열, 집계 창, 컷오프와 결측 처리 방식을 JOURNAL에 남기면 사람이 데이터 계보를 역추적할 수 있습니다.
많은 실험의 최고점은 우연일 수 있다
같은 검증 세트를 수십 번 조회하면 실제 효과가 없는 피처도 한 번쯤 좋아 보입니다. 최고 점수만 고르는 자동 루프는 이 다중 비교 문제를 확대합니다. 변경 불가능한 홀드아웃을 최종 후보에만 열고, 후보 수와 검증 조회 횟수를 함께 기록해야 합니다. 여러 시드와 인접 시즌에서 개선 방향이 유지되는지도 확인합니다.
점수 차이가 작은 경우에는 복잡한 피처보다 단순한 기준선을 유지하는 선택도 필요합니다. 학습 시간, 피처 생성 지연과 재현 실패 위험까지 포함하면 검증 소수점의 작은 개선이 운영 가치로 이어지지 않을 수 있습니다. 에이전트의 목표 함수에 성능뿐 아니라 계산 비용과 복잡도 상한을 넣는 이유입니다.
외부 시장 신호도 이동 폭을 제한한다
POLY-ODDS-BLEND.md의 접근은 Polymarket 우승 배당을 정규화하고, 모델 확률과의 차이를 logit 공간에서 계산하는 것입니다. 시장 값을 그대로 덮어쓰지 않고 팀별 보정은 최대 ±0.10, 경기별 이동은 ±0.03으로 제한합니다. 외부 신호가 모델을 통째로 지배하지 못하게 하는 안전장치입니다.
원문은 Iteration 69와 71의 예측 차이에 따라 가중치를 바꾸는 라우팅 예도 듭니다. 격차가 0.040 이하일 때 69번 모델을 56% 사용하는 식입니다. 이런 임계값은 해당 검증 구조의 산물이지 다른 데이터에 복사할 일반 공식이 아닙니다. 별도 기간에서 다시 검증하지 않으면 또 하나의 과적합 변수가 됩니다.
시장 값에는 게시 시각과 유동성이라는 별도 위험이 있습니다. 실제 제출 시점보다 늦게 형성된 값은 과거 검증에 넣을 수 없고, 거래가 적은 시장의 확률은 작은 주문에도 움직일 수 있습니다. 외부 신호가 없는 경기의 처리, 취소, 오류 값과 데이터 수집 실패도 미리 정해야 합니다. 성능이 좋아 보여도 재현 가능한 시점 데이터가 없다면 운영 피처로 쓰기 어렵습니다.
도입할 때 사람에게 남겨야 할 일
먼저 시간 순서를 지키는 검증 분할과 변경 불가능한 홀드아웃을 만든 뒤 에이전트에 허용할 데이터와 계산 예산을 정합니다. 한 번에 한 피처 군만 바꾸고, 기준선보다 좋아진 결과뿐 아니라 실패한 실험도 기록해야 합니다. 비용 상한과 중단 조건이 없으면 LLM 호출과 XGBoost 학습이 함께 폭주할 수 있습니다.
대회 페이지의 규칙과 데이터 시점을 확인하는 일도 자동 탐색 밖에 둬야 합니다. 이 사례는 에이전트가 연구자를 대체했다는 증명이 아니라, 사람이 평가 규칙과 위험 한도를 설계했을 때 반복 연구의 일부를 자동화할 수 있음을 보여 주는 저장소입니다.
어떤 로그가 있어야 실험을 재현할까
각 실행에는 코드 커밋, 데이터 스냅샷, 피처 목록, 분할 정의, 시드, 라이브러리 환경, 실행 시간과 점수를 함께 묶습니다. 결과 파일만 남기면 에이전트가 왜 그 선택을 했는지 확인할 수 없으므로 가설과 실패 이유도 필요합니다. 외부 신호를 썼다면 수집 시각과 원본 값, 변환 방식과 이동 제한도 같은 기록에 포함합니다.
재현 시험은 최고 모델만 다시 돌리는 것으로 끝나지 않습니다. 깨끗한 환경에서 데이터 생성부터 제출 파일까지 한 번에 실행하고 해시나 허용 오차가 맞는지 봅니다. 비용 상한을 넘거나 같은 오류를 반복하거나 홀드아웃을 건드리면 자동 중단하도록 합니다. 이 브레이크가 작동해야 사람이 잠시 자리를 비워도 자율 실험이 통제된 연구로 남습니다.
사람의 승인은 어느 지점에 둘까
모든 실험을 일일이 승인하면 자동화의 이점이 사라지고, 아무 승인도 없으면 누수나 비용 폭주를 늦게 발견합니다. 위험에 따라 게이트를 나누는 방식이 현실적입니다. 기존 열의 조합처럼 되돌리기 쉬운 저비용 피처는 정해진 예산 안에서 자동 실행하고, 새 외부 데이터 수집, 검증 분할 변경, 홀드아웃 접근, 최종 제출은 사람 승인을 요구할 수 있습니다.
승인 화면에는 점수만 보여 주지 말고 이전 기준선과의 차이, 바뀐 코드와 데이터 열, 실행 비용, 누수 검사와 실패한 재현 결과를 함께 둡니다. 그래야 사람도 에이전트가 고른 최고점에 끌려가지 않고 근거를 검토할 수 있습니다. 거절 이유는 JOURNAL에 남겨 같은 요청이 다른 표현으로 반복되는 것을 막습니다.
운영이 시작되면 예산과 성능을 주기적으로 다시 봅니다. 데이터가 갱신되거나 대회 규칙이 바뀌면 과거 임계값과 시장 보정이 더는 유효하지 않을 수 있습니다. 자동화는 한 번 만든 파이프라인을 영구히 켜 두는 일이 아니라, 변경 가능한 탐색과 변경하면 안 되는 평가 규칙을 계속 분리하는 과정입니다. 사람이 이 경계를 소유할 때 에이전트의 반복 속도가 장점으로 남습니다.
함께 읽으면 이해가 이어지는 글
- CyberStrikeAI는 정말 자율 레드팀인가: 실행 전 출처, 격리 점검 — CyberStrikeAI를 제로데이 자동화 도구로 믿기 전에 원문 속 출처 충돌, 검증되지 않은 주장, 허가된 실험 환경의 필수 조건을 살펴봅니다.
- ml-intern에 H100 300회 루프를 맡겨도 될까: 170K Compaction과 비용 상한 — ml-intern의 논문 탐색, 학습 Job, Trackio 평가 루프와 170K 자동 압축을 살펴보고, 최대 300회 자율 실행 전에 걸어야 할 GPU, API, 평가 상한을 정리합니다.
- GitHub Actions를 자연어로 써도 안전할까? gh-aw의 컴파일, 권한 경계 — 마크다운 의도를 Actions 워크플로로 바꾸는 gh-aw의 컴파일 구조와 firewall, safe-outputs, 비용, 비결정성 때문에 읽기 작업부터 시작해야 하는 이유를 정리합니다.
자주 묻는 질문
자율 ML에서 에이전트에게 맡기면 안 되는 결정은 무엇인가요?
검증 분할, 데이터 사용 가능 시점, 변경 불가능한 홀드아웃과 비용 상한은 사람이 먼저 고정해야 하며 에이전트가 점수를 보고 바꾸게 해서는 안 됩니다.
실험 점수가 올랐는데도 채택하지 말아야 할 때는 언제인가요?
많은 아이디어 중 우연히 좋아진 결과이거나 시간 누수, 중복 피처, 홀드아웃 재사용이 의심되면 독립 기간과 시드에서 다시 확인하기 전에는 채택하지 않아야 합니다.
Polymarket 같은 외부 신호는 어떻게 안전하게 섞나요?
예측 시점에 실제로 이용 가능했는지 확인하고 이동 폭을 제한한 뒤, 신호를 뺀 기준선과 별도 기간에서 비교해 외부 신호가 모델을 지배하지 않게 해야 합니다.
←→ 키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.