컴퓨터비전 90
- Colibri: 25GB 램 노트북으로 744B 초거대 AI 모델을 구동하는 순수 C 추론 엔진의 원리
- ds4의 284B 로컬 추론은 누구에게 현실적일까: 128GB, Metal, SSD 조건
- RAG 답이 틀릴 때 LLM보다 PDF를 먼저 의심해야 하는 이유: RAGFlow
- 옷을 갈아입은 사람을 33개 카메라에서 찾을 수 있을까? MEVID의 범위
- DreamVideo-Omni는 두 캐릭터 얼굴 융합을 막을까: Latent Identity RL의 범위
- MA-EgoQA는 로봇 6대의 영상을 함께 이해할까: 7일 기억과 EgoMAS 검색
- CoCo는 이미지 속 글자, 배치를 코드로 고칠까: +68.83%와 Sandbox 비용
- Holi-Spatial은 3D 라벨링을 없앨까: 1.2만 Scene, 400만 자동 데이터의 검증
- 15B Phi-4 Vision은 왜 UI, 수식 추론을 노리나: 동적 해상도와 모드 토큰
- 냉장고 문을 열 때 손이 관통한다면: ArtHOI의 4D 재구성
- LiDAR, RGB-D, CAD를 한 3D 인코더로 처리할 수 있을까? Utonia의 범위
- pinchtab은 Playwright를 대체할까: 12MB HTTP 브리지와 800토큰 접근성 트리
- UA-VLS의 불확실성 점수는 의료 판단을 안전하게 할까: SEU Loss와 Dice 3~5% 향상
- RynnBrain 30B-A3B는 로봇에 충분히 가벼울까: 3B 활성 파라미터와 제어 지연
- VLM 추론 데이터 180만 개가 다 필요할까? MMFineReason의 7% 선별
- 차트 OCR은 글자만 맞으면 될까? OCRVerse의 문서, 웹, 수치 보상 분리
- Youtu-VL은 객체 검출 헤드를 없앨 수 있을까: Vision-as-Target과 NTP-M 구조
- 위성 사진만 보고 학교와 병원을 구분할 수 있을까: SocioReasoner
- 비디오 데이터를 더 모아도 움직임이 나쁜 이유: Motive의 선별법
- 게임 영상 4만 시간에 버튼 라벨은 어떻게 붙였나: NitroGen의 답
- VLM이 카메라 이동과 객체 이동을 헷갈리는 이유: DSR Suite와 GSM
- 인간 1인칭 영상이 로봇 학습에 바로 쓰이지 못하는 이유: PhysBrain E2E
- 온디바이스 VLM은 모든 이미지를 고해상도로 봐야 할까? HyperVL의 VRC 판단
- NEPA는 왜 다음 Pixel 대신 Embedding을 예측할까? Causal Mask와 Stop-Gradient
- YOLOE: 모든 객체를 실시간으로 탐지 & 분할하는 혁신 기술
- Sa2VA는 문장으로 비디오 객체를 어떻게 찾나: SAM-2, LLaVA와 [SEG] 토큰 연결
- DICEPTION 하나로 깊이, 법선, 분할을 다 잘할까: 벤치마크가 보여준 성능 차이
- RailSem19 데이터셋으로 철도 객체 탐지를 바로 학습해도 될까: 라벨 2종과 클래스 불균형
- BiRefNet: 고해상도 이미지 세분화를 위한 최첨단 AI 모델
- OmniParser: GUI 자동화를 위한 순수 비전 기반 에이전트
- Soft Teacher는 라벨 1%에서 왜 강했나: Pseudo Label 신뢰도 설계
- MoAI는 왜 외부 CV 모델 4개를 붙이나: Compressor와 Mixer
- 도로 위험물 데이터가 없을 때: HazardNet이 합성 장애물을 아무 곳에나 놓지 않은 이유
- Darknet utils.c 이름만 믿으면 틀리는 7곳: mse_array는 MSE가 아니다
- Darknet Upsample에서 음수 Stride를 쓰면 왜 Downsample이 될까?
- Darknet 계층 분류 확률이 너무 작을 때: 부모 확률을 곱하는 Tree 구조
- Darknet Softmax 확률 합이 1이 아닐 때: groups와 softmax_tree 확인법
- Darknet Route Layer에서 Channel Concat이 깨질 때: offset과 Shape 점검법
- Darknet RNN의 State 포인터가 깨질 때: batch, steps 메모리 계약 읽기
- Darknet Reorg Layer가 forward와 backward에서 다르게 움직이는 조건: reverse, extra 우선순위
- Darknet Region Layer 학습이 멈추는 이유: 빈 backward와 objectness delta 추적
- Darknet cfg 파서가 네트워크를 망가뜨리는 순간: route 인덱스, STEPS, 가중치 순서
- Darknet data.cfg 옵션이 조용히 잘못 읽히는 이유: '=' 파싱과 문자열 수명
- Darknet Normalize Layer 역전파가 정확하지 않은 이유: 채널 정규화와 delta 덮어쓰기
- Darknet Maxpool 역전파가 index -1로 깨지는 경우: padding과 argmax 추적
- Darknet matrix를 복사, 분할할 때 생기는 버그: 행 포인터 소유권과 CSV 처리
- Darknet LSTM 역전파가 헷갈리는 이유: 8개 Connected Layer와 포인터 이동
- Darknet Logistic Layer의 cost가 batch마다 달라지는 이유: sigmoid, cross entropy 흐름
- Darknet Local Layer가 Convolution보다 무거운 이유: 위치별 가중치와 초기화 함정
- Darknet 연결 리스트가 한 번 pop 뒤 깨지는 이유: front, back과 메모리 소유권
- Darknet ISEG Layer는 무엇을 학습하나: 픽셀 클래스와 인스턴스 임베딩 해설
- DarkNet im2col 배열 모양 계산: 픽셀은 data_col 어디에 놓이나
- DarkNet GRU Layer는 학습 가능한가: 6개 Connected와 빈 backward
- DarkNet Dropout은 추론 때 왜 아무것도 하지 않나
- DarkNet Demo 실시간 파이프라인: 3개 버퍼와 3프레임 평균
- DarkNet Deconvolutional Layer 출력 크기와 col2im 흐름
- DarkNet data.c 읽는 법: 이미지 경로가 X, y 배치가 되기까지
- DarkNet Crop Layer는 학습과 추론에서 어디를 자르나
- DarkNet CRNN Layer의 state는 세 Convolution을 어떻게 순환하나
- DarkNet Cost Layer에서 SSE, L1, MASKED가 실제로 갈리는 지점
- DarkNet Convolutional Layer는 왜 im2col과 GEMM을 쓰나
- DarkNet Connected Layer 순전파, 역전파: GEMM 차원 따라가기
- DarkNet Compare는 두 이미지를 어떻게 순위로 바꾸나
- Darknet col2im에서 픽셀값을 덮어쓰지 않고 +=로 더하는 이유
- Darknet NMS는 Class별로 해야 할까? do_nms_obj와 do_nms_sort 차이
- Darknet blas.c를 어디서부터 읽을까? 배열 연산, Loss, Feature Map 지도
- Darknet avgpool은 일반 Average Pooling이 아니다: Global Average 코드 읽기
- Darknet 활성화 함수 역전파가 틀릴 때: gradient()에 출력값을 넣는 이유
- YOLOv4 Bag of Freebies와 Specials, 무엇이 추론 비용을 늘릴까?
- YOLOv1 출력 7×7×30은 어떻게 읽을까? 98개 Box와 Loss까지
- 얼굴 인식이 자꾸 틀리는 이유: 검출, 정렬, FaceNet Triplet Loss 점검
- Detectron2 데모가 CUDA ROI 오류로 멈출 때: 설정, 가중치, 빌드 점검법
- Saliency Map은 무엇을 설명하나: 입력 gradient 시각화와 해석의 한계
- Grad-CAM은 CAM과 무엇이 다른가: GAP 없이 CNN 판단 영역 찾기
- CAM 히트맵이 엉뚱한 곳을 보는 이유: GAP 구조와 구현 체크리스트
- EfficientDet은 왜 빠른가: BiFPN 가중치 융합과 복합 스케일링 핵심
- EfficientDet 전에 보는 EfficientNet Compound Scaling: 세 축을 함께 키우는 이유
- Deformable Convolution은 Offset을 어디에 더하나: DCN 수식 해설
- CornerNet은 Anchor 없이 박스를 어떻게 묶나: Heatmap, Embedding, Offset
- FPN의 Top-down, Lateral Connection은 멀티스케일 특징을 어떻게 살리나
- FSAF는 Anchor 없이 어떤 FPN 레벨을 고르나
- MMDetection 구조 읽는 법: Backbone, Neck, Head와 테스트 명령 연결
- SSD는 왜 8,732개 Default Box를 쓰나: 멀티스케일 구조 계산
- COCO API로 이미지, 인스턴스, 키포인트, 캡션 찾는 순서
- Deep SORT의 코사인 거리는 어디에 쓰일까: Feature Gallery와 추적 코드 흐름
- CenterNet은 Anchor와 NMS 없이 어떻게 물체를 찾을까: 중심점, 크기, Offset 해설
- SORT가 빠른 대신 ID를 놓치는 이유: Kalman Filter와 Hungarian 매칭
- YOLOv2는 recall을 어떻게 올렸나: Anchor Box, 좌표 제약, Multi-Scale의 역할
- YOLOv1은 왜 빠르지만 작은 물체에 약할까: 7×7 Grid와 Loss 해설
- 사람을 한 명씩 찾지 않고 군중을 세는 법: MCNN과 Density Map