핵심 요약
1
832×448 영상의 워밍 후 생성 시간 중앙값은 16.39초, 1280×704는 25.65초였습니다.
2
세 해상도의 샘플링 VRAM 최대치는 50.11에서 50.86GiB였습니다.
3
영상에 넣으려고 했던 OH MY GPU 문구는 모든 해상도에서 정확하게 나오지 않아 후편집이 필요했습니다.
LTX 2.5는 1080p급 영상을 얼마나 빠르게 만들고, 결과물은 어떨까요? Runpod의 RTX PRO 6000 Blackwell 한 장에서 공식 Two-Stage Distilled 워크플로로 5초 영상을 만들었는데요. 832×448은 중앙값 16.39초, 1280×704는 25.65초, 1984×1088은 54.87초가 걸렸습니다.
가장 높은 해상도에서도 생성은 1분 안에 끝났고, 결과물에는 48kHz 스테레오 오디오가 함께 들어갔습니다. VRAM 피크는 세 해상도 모두 50.11~50.86GiB였습니다.
비용은 테스트 당시 Runpod 가격인 시간당 $2.09에 생성 시간만 곱해 계산했습니다. 각 해상도는 다섯 번씩 반복했고 첫 실행과 워밍업은 중앙값에서 제외했습니다.
공개 템플릿으로 같은 환경 준비
이번 테스트와 같은 Blackwell GPU, CUDA 13, Sage Attention 환경을 바로 띄울 수 있게 Runpod 템플릿을 공개했습니다.
- Runpod 계정이 있으면 LTX 2.5 테스트용 템플릿을 열어 RTX PRO 6000 Blackwell로 배포합니다.
- 계정이 없으면 Runpod 레퍼럴 링크로 가입한 뒤 같은 템플릿을 사용하면 됩니다.
이 글에는 Runpod 레퍼럴 링크가 포함돼 있습니다.
템플릿에는 CUDA 13과 Sage Attention 실행 환경이 들어 있지만 ComfyUI와 모델 파일은 포함하지 않았습니다. LTX 2.5 모델 파일이 약 46.6GiB이므로 출력 파일과 캐시까지 고려해
/workspace는 60GiB 이상으로 잡았습니다.약 46.6GiB 모델 파일과 ComfyUI 준비
ComfyUI 설치부터 시작했습니다. 터미널에서 저장소를 받은 뒤 필요한 패키지를 설치합니다.
cd /workspace
git clone https://github.com/comfyanonymous/ComfyUI.git
cd /workspace/ComfyUI
pip install -r requirements.txtComfyUI 설치가 끝나면 워크플로에 필요한 여섯 개 파일을 모델 폴더에 배치합니다.
cd /workspace/ComfyUI
hf download Lightricks/LTX-2.5 \
text_encoders/gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrot.safetensors \
diffusion_models/ltx-2.5-22b-distilled-transformer-comfy-int8-convrot.safetensors \
vae/ltx-2.5-video-vae-bf16.safetensors \
vae/ltx-2.5-audio-vae-bf16.safetensors \
latent_upscale_models/ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors \
--local-dir /workspace/ComfyUI/models
hf download Comfy-Org/gemma-4 \
text_encoders/gemma4_e2b_it_bf16.safetensors \
--local-dir /workspace/ComfyUI/models사용한 파일 구성은 다음과 같습니다.
ComfyUI/models/
├── diffusion_models/
│ └── ltx-2.5-22b-distilled-transformer-comfy-int8-convrot.safetensors
├── text_encoders/
│ ├── gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrot.safetensors
│ └── gemma4_e2b_it_bf16.safetensors
├── vae/
│ ├── ltx-2.5-video-vae-bf16.safetensors
│ └── ltx-2.5-audio-vae-bf16.safetensors
└── latent_upscale_models/
└── ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors8+3스텝 Two-Stage Distilled 워크플로 실행
다음 명령으로 ComfyUI를 실행했습니다. 화면은 템플릿에 등록한
7860 HTTP 포트로 열었습니다.cd /workspace/ComfyUI
python main.py \
--listen 0.0.0.0 \
--port 7860 \
--use-sage-attention \
--disable-auto-launchLTX 2.5 공식 Two-Stage Distilled 워크플로를 열고 위 파일을 각 모델 로더에 지정했습니다. LoRA는 추가하지 않았고 Prompt Enhance는
ON으로 두었습니다.1단계에서 8스텝으로 생성하고, 2× Latent Spatial Upscale을 거친 뒤 2단계에서 3스텝을 더 실행했습니다. 영상 길이는 5초, FPS는 24로 두었는데요. 실제로는 121프레임, 5.042초 영상이 나왔습니다.
첫 실행은 64.32초가 걸렸는데요. 모델 로딩이 끝난 뒤에는 해상도별로 다섯 번씩 반복했고, 회차마다 seed를
424243에서 424247까지 바꿔 ComfyUI가 이전 결과를 재사용하지 않게 했습니다.해상도에 따라 늘어난 생성 시간, 약 51GiB에 머문 VRAM
다섯 번 측정했을 때 832×448은 14.91~16.53초, 1280×704는 24.85~26.45초, 1984×1088은 54.33~58.80초가 걸렸습니다. 해상도를 올리면 생성 시간은 길어졌지만, VRAM 피크는 약 51GiB였습니다.
1984×1088에서 5초 영상 한 편을 만드는 데는 약 55초가 걸렸습니다. 832×448보다 약 3.3배 느렸지만, 생성 구간 비용은 $0.0319였습니다.
해상도를 높여도 틀린 OH MY GPU 문구
바리스타가 우유를 부어 컵 위에 무늬를 완성하는 장면은 세 해상도 모두 동작이 중간에 끊기지 않았습니다. 스케이트보드 장면은 달랐는데요. 832×448 영상에서는 4.5초쯤 인물이 화면 위로 크게 벗어났지만, 해상도를 높이자 화면 안에 더 잘 남았습니다.
반면 영상에 넣으려고 했던
OH MY GPU 문구는 세 해상도에서 모두 정확하게 나오지 않았습니다. OH Y GPU, OH MY GUU로 바뀌었고 해상도를 1984×1088로 올려도 고쳐지지 않았습니다. 영상 안에 정확한 문구가 필요하다면 후편집으로 넣는 편이 낫습니다.RTX PRO 6000에서 1분 안에 끝난 1080p급 생성
이번에 사용한 설정에서는 LTX 2.5가 RTX PRO 6000 한 장으로 1080p급 영상과 오디오를 1분 안에 생성했습니다.
5초 영상을 기준으로 832×448은 약 16초, 1280×704는 약 26초, 1984×1088은 약 55초가 걸렸습니다. 1080p급 한 편에는 VRAM 50.86GiB, 생성 시간 54.87초, 생성 구간 비용 $0.0319가 들었습니다. 영상에 넣으려고 했던
OH MY GPU 문구는 해상도를 올려도 정확하게 나오지 않아, 필요한 문구는 후편집으로 넣는 편이 낫습니다.

