성능 수치와 실행 조각의 범위를 구분한다
원문에 소개된 액션 인식 결과는 다음과 같습니다.
| 모델 | Kinetics-400 | Something-Something V2 |
|---|
| InternVideo | 91.1% | 77.2% |
| ViViT | 81.3% | 65.9% |
| TimeSformer | 80.7% | 62.3% |
| MViT | 86.1% | 70.4% |
이 표에서 InternVideo가 두 열 모두 가장 높고 Kinetics-400은 90%를 넘습니다. 하지만 액션 분류 수치가 곧 비디오 검색이나 VideoQA 성능을 의미하지는 않습니다. 태스크별 checkpoint와 평가 설정을 분리해 확인해야 합니다.
원문 설치 예시는 저장소를 복제하고 requirements를 설치하는 단계입니다.
1
2
3
| git clone https://github.com/OpenGVLab/InternVideo
cd InternVideo
pip install -r requirements.txt
|
액션 분류와 검색 예시는 다음처럼 적혀 있습니다.
1
2
3
4
5
6
7
| python demo/classification.py \
--video_path "sample_video.mp4" \
--model_path "checkpoints/internvideo_kinetics400.pth"
python demo/retrieval.py \
--query "A person is playing basketball" \
--database "datasets/kinetics-400"
|
이 명령은 원문 작성 시점의 핵심 조각일 뿐, 모델 다운로드, checkpoint 이름, 데이터 전처리, GPU 조건을 포함한 완전 실행법은 아닙니다. 현재 저장소에 같은 스크립트와 인자가 있는지 확인하고, 분류와 검색 중 필요한 태스크의 checkpoint를 먼저 준비해야 합니다.