15B Phi-4 Vision은 왜 UI, 수식 추론을 노리나: 동적 해상도와 모드 토큰
Phi-4-reasoning-vision-15B의 동적 해상도, 데이터 정제, 직접/추론 모드를 살펴보고, UI, 문서, 수식 평가와 로컬 자원, 안전 기준을 설명합니다.
Phi-4-reasoning-vision-15B의 동적 해상도, 데이터 정제, 직접/추론 모드를 살펴보고, UI, 문서, 수식 평가와 로컬 자원, 안전 기준을 설명합니다.
Claude-Mem이 Claude Code의 작업 관찰을 압축, 검색하는 구조와, 민감정보 제외, 기억 최신성, 삭제, 복구, 효과 검증 기준을 설명합니다.
CyberStrikeAI의 자율 레드팀 주장을 출처, 기능별로 검증하고, 허가된 방어 실험에서 범위 고정, 격리, 증거, 중단, 오탐을 평가하는 기준을 설명합니다.
ArtHOI가 단안 비디오의 광학 흐름과 비디오 prior로 관절 객체 4D 상태를 먼저 복원하고 사람 접촉을 맞추는 원리와 실패 조건을 설명합니다.
AgentVista가 복잡한 시각 자료를 25턴 이상 확대, 검색, 코드 처리하는 멀티모달 에이전트를 평가하는 방식과 연쇄 오류, 비용 분석법을 설명합니다.
Qwen-Agent의 LLM, Tool, Memory/RAG, Agent 구조와 WebUI, code interpreter를 살펴보고, 도구 schema, 격리, 검색 근거, routing 검증법을 설명합니다.
Agentic workflow의 Profile, Memory, Planning, Tools 구조와 멀티에이전트 역할 분리를 살펴보고, 권한, 재시도, 상태, 검증, 비용 통제법을 설명합니다.
RoboPocket이 로봇 정책 궤적을 스마트폰 AR로 보여 주고 교정을 비동기 학습에 반영하는 원리, 좌표, 지연, 품질, 안전 검증 기준을 설명합니다.
Proact-VL이 실시간 영상에서 SPEAK 시점과 응답 길이를 정하는 원리, 발화 누락, 과잉 개입, 지연, context 관리와 안전한 trigger 평가법을 설명합니다.
Memori가 LLM 호출 전후에 사실, 선호, 규칙을 SQL로 저장, 주입하는 구조와, vector RAG와의 역할 분리, 거짓 기억, 권한, 삭제 기준을 설명합니다.