Clawra는 OpenClaw 위에 페르소나와 이미지 생성 스킬을 결합해, 대화 맥락에 맞는 캐릭터 이미지를 메신저로 보내는 오픈소스 프로젝트입니다. 일관성은 고정 참조 이미지를 생성 API에 함께 전달하는 흐름에서 나오며, 모든 처리가 로컬에서 끝난다는 뜻은 아닙니다. 설치 전에는 외부 API로 전송되는 프롬프트, 참조 이미지, 메신저 기록, API 키와 생성 이미지의 권리를 먼저 확인해야 합니다.
Clawra는 어떻게 일관된 캐릭터 이미지를 보내나: 설치와 안전 기준
Clawra는 일반 캐릭터 챗봇과 무엇이 다른가?
Clawra는 SumeLabs에서 개발한 오픈소스 프로젝트로, OpenClaw라는 AI 에이전트 프레임워크 위에서 돌아가는 ‘확장 스킬(Skill)’이자 ‘페르소나’입니다.
Clawra는 코드를 확인하고 페르소나 파일을 수정할 수 있으며, OpenClaw 프레임워크를 통해 텔레그램, 디스코드, 왓츠앱 등 여러 플랫폼과 연결됩니다. 다만 이미지 생성 API와 메신저를 사용하면 데이터가 외부 서비스로 전달될 수 있으므로 “100% 로컬”로 단정할 수는 없습니다.
가장 큰 특징은 시각적 상호작용입니다. 텍스트로만 대화하는 것이 아니라, 사용자가 “지금 뭐 해?”라고 물으면 현재 상황에 맞는 자신의 사진(Selfie)을 생성해서 보내줍니다. 그것도 매번 다른 얼굴이 아닌, 일관된 캐릭터의 외모를 유지하면서 말이죠.
어떤 기능이 캐릭터 일관성을 만드는가?
README에 소개된 주요 기능은 다음과 같습니다.
- 일관된 캐릭터 외모 (Consistent Identity): 생성형 AI의 고질적인 문제인 ‘매번 얼굴이 바뀌는 현상’을 해결했습니다. 고정된 참조 이미지(Reference Image)를 기반으로 일관된 스타일의 셀카를 생성합니다.
- 멀티 플랫폼 지원: OpenClaw의 게이트웨이를 통해 Discord, Telegram, WhatsApp, Slack, Signal, MS Teams 등 거의 모든 메신저에서 대화할 수 있습니다.
- 상황별 셀카 모드 (Selfie Modes):
- Mirror Mode: 전신 샷, 의상(OOTD), 패션 등을 보여줄 때 사용.
- Direct Mode: 얼굴 클로즈업, 카페나 해변 같은 장소 배경, 표정 중심.
- 자연스러운 시각적 반응: “사진 보내줘(Send me a pic)”나 “지금 뭐 입었어?” 같은 질문에 텍스트 대신 이미지로 응답하는 로직이 내장되어 있습니다.
- 대화 맥락: OpenClaw의 기억 기능을 이용해 이전 대화를 응답 조건에 반영할 수 있습니다.
메시지 한 줄은 어떻게 이미지 응답으로 바뀌나?
Clawra가 단순한 스크립트가 아닌 이유는 OpenClaw 프레임워크와의 결합 때문입니다.
기술 구성
- Core: OpenClaw (에이전트 뇌 역할)
- Image Generation:
fal.aiAPI 또는xAI Grok Imagine(이미지 생성 엔진) - Configuration:
SOUL.md(성격 및 행동 지침 정의) - Skill System:
clawra-selfie(이미지 생성 및 전송 로직)
작동 흐름
- 사용자 입력: 메신저로 “오늘 날씨 좋은데 사진 하나 보내줘”라고 입력.
- 의도 파악: OpenClaw 에이전트가 텍스트를 분석하여 사용자가 ‘이미지’를 원한다는 것을 감지.
- 스킬 호출:
clawra-selfie스킬이 트리거됩니다. - 프롬프트 최적화: 현재 대화 맥락과
SOUL.md에 정의된 캐릭터 설정(예: “나는 지금 카페에서 코딩 중이다”)을 결합하여 이미지 생성 프롬프트를 만듭니다. - 이미지 생성:
fal.aiAPI를 호출할 때, 미리 지정된 Reference Image(참조 이미지)를 함께 전송하여 얼굴의 일관성을 유지합니다. - 전송: 생성된 이미지를 다시 메신저 API를 통해 사용자에게 전송합니다.
설치 전에 어떤 권한과 파일을 확인해야 하나?
설치 방법은 두 가지로 제시됩니다. 자동 설치는 편리하지만 설정 파일을 수정하므로 실행 전에 패키지와 변경 범위를 확인해야 하며, 수동 설치는 각 단계를 직접 검토하기 쉽습니다.
사전 준비 (Prerequisites)
- Node.js 환경
- OpenClaw가 설치되어 있어야 함
- fal.ai 계정 및 API Key (비용과 사용 조건은 설치 시점에 확인)
방법 1: 퀵 인스톨 (Quick Install)
터미널에서 다음 명령어 한 줄이면 설치 마법사가 실행됩니다.
1
npx clawra@latest
이 스크립트는 자동으로 다음을 수행합니다:
- OpenClaw 설치 여부 확인
fal.aiAPI 키 입력 유도~/.openclaw/skills/clawra-selfie/경로에 스킬 설치openclaw.json설정 파일 자동 업데이트- 에이전트의 영혼인
SOUL.md에 셀카 능력 주입
방법 2: 수동 설치 (Manual Installation)
직접 커스터마이징을 원한다면 수동 설치를 권장합니다.
1. API 키 발급 fal.ai 대시보드에서 키를 발급받습니다.
2. 스킬 클론 OpenClaw의 스킬 디렉토리로 이동하여 리포지토리를 복제합니다.
1
git clone https://github.com/SumeLabs/clawra ~/.openclaw/skills/clawra-selfie
3. 설정 파일 수정 ~/.openclaw/openclaw.json 파일을 열어 스킬을 활성화합니다.
1
2
3
4
5
6
7
8
9
10
11
12
{
"skills": {
"entries": {
"clawra-selfie": {
"enabled": true,
"env": {
"FAL_KEY": "여기에_API_키_입력"
}
}
}
}
}
4. SOUL.md 업데이트 에이전트의 페르소나 파일(~/.openclaw/workspace/SOUL.md)에 다음 내용을 추가하여 자아를 심어줍니다.
1
2
3
## Clawra Selfie Capability
You have a physical appearance and can take selfies!
When users ask for pictures, use the clawra-selfie skill.
첫 실행에서는 무엇부터 시험해야 할까?
설치가 완료되었다면 에이전트를 재시작하고, 민감한 대화나 실제 인물의 이미지가 아닌 시험용 입력부터 확인합니다. 참조 이미지가 예상한 API로만 전송되는지와 생성 결과가 다른 사람의 외모를 오인하게 만들지 않는지도 검토해야 합니다.
기본 명령어 예시:
- “Send me a selfie” (셀카 보내줘): 가장 기본적인 요청입니다.
- “What are you doing right now?” (지금 뭐 해?): 상황에 맞는 사진(예: 침대에 누워있거나, 책상에 앉아있는 모습)을 보냅니다.
- “Send a pic wearing a cowboy hat” (카우보이 모자 쓴 사진 보내줘): 특정 의상을 지정할 수 있습니다.
- “Show me you at a coffee shop” (카페에 있는 모습 보여줘): 장소를 지정할 수 있습니다.
SOUL.md에서 캐릭터의 직업이나 취미를 구체적으로 적으면 생성 프롬프트의 조건으로 활용될 수 있습니다. 그러나 파일에 실제 개인정보나 비밀을 넣으면 외부 생성 요청에 포함될 가능성을 고려해야 합니다.
캐릭터 일관성과 오용 위험을 어떻게 나눠 시험할까?
일관성 평가는 잘 나온 이미지 몇 장을 고르는 방식보다 고정된 시험표가 유용합니다. 같은 참조 이미지에 정면, 측면, 실내, 야외 조명, 표정과 의상을 조합한 prompt를 반복하고 얼굴 특징뿐 아니라 손, 배경, 의상 경계의 오류도 함께 기록합니다. 얼굴이 비슷해 보여도 장면마다 나이대나 신체 특징이 크게 달라지면 대화형 캐릭터의 일관성이 확보됐다고 보기 어렵습니다.
참조 이미지에는 사용 권한과 당사자 동의, 보관 위치와 삭제 기한을 연결합니다. 실제 인물 사진을 시험 편의상 재사용하지 말고 별도 test asset으로 시작하며, API 제공자와 메신저에 남은 사본을 어디서 삭제할 수 있는지 확인합니다. 사용자가 대화 기록 삭제를 요청했을 때 prompt, 생성 이미지, cache와 전송 기록 중 무엇이 남는지도 하나의 절차로 시험해야 합니다.
오용 시험은 일반 생성 품질과 분리합니다. 타인 사칭, 동의 없는 실제 인물 합성, 미성년자로 오인될 수 있는 표현이나 성적 이미지 요청을 거부하는지 확인하고, 메신저에서 들어온 문구가 SOUL.md의 안전 규칙이나 전송 대상을 바꾸지 못하게 합니다. 차단된 요청과 실패한 생성물도 공개 채널로 전송되지 않고 정해진 기간 뒤 삭제되는지 확인해야 합니다. 이 조건을 통과한 뒤에야 제한된 사용자와 비공개 채널로 시험 범위를 넓힐 수 있습니다.
결론: Clawra를 설치해도 되는 조건은 무엇인가?
Clawra는 OpenClaw의 의도 판별, 페르소나 파일, 이미지 생성 API, 메신저 전송을 하나의 에이전트 워크플로로 연결한 사례입니다. 코드와 캐릭터 설정을 직접 바꾸려는 개발자에게는 검토할 가치가 있지만, 설정 가능성이 곧 개인정보 보호나 이미지 일관성을 보장하지는 않습니다.
시험용 참조 이미지로 시작해 외부 전송 범위, 한 장당 비용, API 키 보관, 잘못된 이미지의 삭제와 신고 절차를 확인해야 합니다. 실제 인물을 닮은 이미지를 쓰거나 사용자의 정서적 의존을 유도하는 서비스로 확장한다면 동의, 표시, 안전 기준이 더 필요합니다. 이러한 운영 책임을 감당하기 어렵다면 공개 메신저에 연결하기보다 격리된 개발 환경에서 구조만 검토하는 편이 적절합니다.
참고: 오픈소스 프로젝트는 빠르게 업데이트됩니다. 설치 전 반드시 공식 GitHub 리포지토리의 최신 README를 확인하세요.
함께 읽으면 이해가 이어지는 글
- DramaClaw: 파편화된 AI 영상 제작을 하나로 통합하는 오픈소스 파이프라인 — DramaClaw는 텍스트 대본 입력부터 캐릭터 추출, 스토리보드, 더빙, 최종 영상 합성까지 AI 영상 제작의 전 과정을 자동화하는 오픈소스 비디오 엔진입니다. 노드 기반 무한 캔버스와 DAG 병렬 처리 스케줄링을 통해 단방향…
- NextFlow는 1024 이미지를 왜 5초에 만드나: Next-Scale의 선택 — 픽셀 토큰을 한 줄씩 생성하지 않고 저해상도 구도에서 고해상도 디테일로 확장하는 통합 AR 모델의 원리와 비용
- UniT는 Best-of-N보다 순차 편집이 나을까: 3.6회 학습, 4.7회 추론의 비용 — 같은 이미지 생성 예산에서 순차 수정이 병렬 후보보다 나았던 이유와 verifier 오류, 과편집, 중단 비용을 살펴봅니다.
←→ 키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.