CLI-Anything이 GUI를 자동으로 CLI로 바꿀까: 7단계, 1,436개 테스트의 범위
CLI-Anything이 GUI 이벤트 뒤의 로직을 CLI, JSON, REPL로 노출하는 구조와 기능 누락, 상태 격리, 권한, 테스트 범위를 검증하는 법을 설명합니다.
CLI-Anything이 GUI 이벤트 뒤의 로직을 CLI, JSON, REPL로 노출하는 구조와 기능 누락, 상태 격리, 권한, 테스트 범위를 검증하는 법을 설명합니다.
Cline의 ReAct 파일 수정, 터미널 루프와 Auto Approve, MCP 권한을 살펴보고 비용 상한, 반복 중단, diff, 테스트 검토 기준을 설명합니다.
ExeVRM이 컴퓨터 에이전트의 실행 영상을 보고 완료 여부를 판정하는 방식과 오탐, 화면 밖 상태, 토큰 가지치기, 도메인 이동 검증법을 설명합니다.
MA-EgoQA와 EgoMAS가 여섯 에이전트의 장기 1인칭 영상을 검색, 정렬하는 구조와 근거 누락, 시간 동기화, 비용, 검증 한계를 설명합니다.
Claude Code에 파일, Bash 권한을 줄 때 필요한 승인 경계, CLAUDE.md, MCP 관리, 작업 범위, 비용, diff 검증 기준을 설명합니다.
MiroFish의 GraphRAG, OASIS 멀티에이전트 사회 시뮬레이션 구조와 확률 해석, 시나리오 민감도, 상태 복구, 호출 비용을 검증하는 법을 설명합니다.
InternVL-U 4B가 시각 이해와 이미지 생성을 분리해 연결하는 구조와 14B 비교 범위, 계획 오류, 편집 보존, 실제 VRAM을 검증하는 법을 설명합니다.
MM-Zero가 제안, 코드 렌더링, 풀이 역할로 합성 시각 문제를 만드는 구조와 보상 해킹, 합성 편향, 실사 일반화, 연산 비용을 검증하는 법을 설명합니다.
Agent Safehouse가 macOS Seatbelt 정책으로 AI 에이전트 권한을 줄이는 방식과 예외 경로, 네트워크, IPC, 차단 실패를 검증하는 기준을 설명합니다.
Promptfoo로 프롬프트, 모델 회귀 테스트를 구성하는 방법과 결정적 assertion, LLM Judge 보정, 캐시, 비용, CI 차단 기준을 설명합니다.