며칠간 자율 코딩했다는 주장을 어떻게 검증할까?
발표에서 특히 강조된 항목은 ‘장기 자율 코딩’ 능력입니다.
알리바바의 내부 테스트와 시연에서는 사람이 중간에 수정하지 않은 채 며칠 동안 소프트웨어 엔지니어링 과제를 이어간 결과가 소개됐습니다 [1]. 그러나 실행 시간이 길다는 사실만으로 결과가 정확하거나 비용 효율적이라고 판단할 수는 없습니다. 같은 테스트를 반복했을 때의 성공률, 잘못 변경한 파일 수, 되돌림과 재시도 횟수, 최종 테스트 통과 여부를 함께 확인해야 합니다.
장기 작업에서는 모델 성능 외에도 실행 장치가 중요합니다. 체크포인트 없이 며칠간 진행하면 한 번의 오류나 만료된 세션으로 앞선 작업을 잃을 수 있고, 넓은 셸 권한을 주면 잘못된 명령의 피해가 커집니다. 작업을 작은 단계로 나누고 각 단계의 변경 내역과 테스트 결과를 저장하며, 비용, 시간, 파일 변경 범위에 상한을 두어야 발표의 시연을 운영 가능한 워크플로로 바꿀 수 있습니다.
sequenceDiagram
autonumber
participant Dev as 개발자 / 시스템
participant Qwen as Qwen3.8-Max
participant Code as 코드베이스 / 테스트 환경
Dev->>Qwen: 장기 프롬프트 및 소프트웨어 과제 전달
loop 며칠간 인간 개입 없는 무인 자율 수행
Qwen->>Code: 코드 작성 및 수정
Code-->>Qwen: 테스트 실행 및 결과 반환
Qwen->>Qwen: 오류 분석 및 차세대 작업 자율 계획
end
Qwen-->>Dev: 최종 완결된 소프트웨어 엔지니어링 결과 전달
사람의 개입 없이 AI가 주도적으로 코드를 수정하고 테스트를 반복하는 루프가 핵심입니다.
알리바바 클라우드 Model Studio의 Qwen3.8-Max API 가격은 입력 100만 토큰당 2달러($2), 출력 100만 토큰당 6달러($6)로 소개됐습니다 [3]. 100만 토큰을 모두 입력하는 호출이라면 표시 단가만으로도 입력 비용이 2달러이므로, 긴 문맥을 반복해서 보내는 에이전트는 호출 횟수와 출력량까지 포함해 예산을 잡아야 합니다.
{
"type": "bar",
"data": {
"labels": ["입력 토큰 (1M당)", "출력 토큰 (1M당)"],
"datasets": [
{
"label": "Qwen3.8-Max API 가격 (USD)",
"data": [2, 6]
}
]
},
"options": {
"plugins": {
"title": {
"display": true,
"text": "Qwen3.8-Max Model Studio API 이용 비용 ($)"
}
}
}
}
차트는 발표 시점의 입력 및 출력 토큰 표시 단가를 보여줍니다.