음성AI 26
- FluidVoice: 구독료 없이 Mac에서 작동하는 온디바이스 AI 음성 받아쓰기 구축기
- LiveKit Agents: 초저지연 실시간 음성 AI 에이전트를 위한 오픈소스 프레임워크
- Claude Code로 영상을 대화하듯 편집하는 Video Use의 원리와 실전 활용법
- OpenCut 아키텍처 가이드: AI가 영상을 편집하고 코드가 타임라인을 제어하는 방법
- pocket-tts: 무거운 GPU 없이 CPU만으로 작동하는 실시간 AI 음성 합성의 원리
- Meetily: 오디오 유출 없이 내 PC에서 완성되는 프라이버시 최우선 AI 회의 비서
- API 호출 당근마켓 시대는 끝났다: 99M 초경량 아키텍처로 167배 빠른 온디바이스 TTS 구현하기 (Supertonic 딥다이브)
- 콜센터 AI, '1번을 누르세요'의 저주를 끝내다: LLM이 레거시 IVR을 박살 내는 진짜 방법
- [시니어의 시선] 토크나이저를 버렸다, 음성 합성의 룰을 깬 'VoxCPM' 심층 분석
- 더 이상 유튜브 튜토리얼은 필요 없다: '진짜' 커서를 움직이는 AI, farzaa/clicky 아키텍처 심층 분석
- GPU 없이 25MB로 구현하는 사람의 목소리: KittenTTS 아키텍처 딥다이브
- 이걸 왜 이제 알았을까? 90분짜리 팟캐스트를 통째로 굽는 MS VibeVoice 솔직 리뷰
- 이걸 왜 이제 알았을까? RAG 파이프라인의 구원자, MS MarkItDown 솔직 분석 및 후기
- 이걸 왜 이제 알았을까? 브라우저에서 돌아가는 AI 사이버 생명체, AIRI 솔직 분석 및 후기
- [2026-02-24] 5분 연속 생성의 비밀: 짧게 배우고 길게 써먹는 Video-to-Audio (MMHNet 리뷰)
- 이걸 왜 이제 알았을까? 바이트댄스가 푼 오픈소스 딥 리서치 끝판왕 'Deer-flow' 솔직 분석 및 후기
- 이걸 왜 이제 알았을까? 바이트댄스가 작정하고 푼 미친 리서치 AI, Deer-Flow 2.0 솔직 리뷰
- [2026-02-25] SkyReels-V4: 비디오+오디오+편집을 '모델 하나'로? 영상 생성 AI의 끝판왕 등장? 🎬
- 개발자 일자리 위협? ElevenLabs를 대체할 미친 AI 에이전트 등장 🤯
- [2026-02-12] UniT: 통합 멀티모달 모델의 사고 연쇄(CoT)와 추론 시간 스케일링의 혁신적 분석
- [2026-02-09] NarraScore: 계층적 감정 제어를 통한 영상 서사와 음악의 완벽한 동기화 - 차세대 AI 작곡 프레임워크 심층 분석
- [2026-02-09] MOVA: 비디오와 오디오의 완벽한 동기화를 위한 MoE 기반 차세대 통합 생성 모델 심층 분석
- [2026-01-08] [심층 분석] 지도를 읽는 AI: Thinking with Map, 강화학습과 병렬 탐색으로 Geolocalization의 한계를 넘다
- DiffuSeq: 확산 모델을 활용한 시퀀스-투-시퀀스 텍스트 생성의 혁신
- Spark-TTS: 인공지능이 당신의 목소리를 만드는 방법
- 구글 어시스턴트 로봇 만들기