LTX 2.5는 얼마나 빠르고 결과물은 어떨까? RTX PRO 6000에서 1080p급까지 돌려봤다

LTX 2.5는 1080p급 영상을 얼마나 빠르게 만들고, 결과물은 어떨까요? RTX PRO 6000에서 5초 영상을 54.87초에 생성했지만, 영상에 넣으려고 했던 OH MY GPU 문구는 해상도를 높여도 정확하게 나오지 않았습니다.

은긔
은긔
분홍색과 파란색 네온 골목에서 스케이트보드를 타는 인물이 담긴 LTX 2.5 생성 영상 프레임

핵심 요약

1

832×448 영상의 워밍 후 생성 시간 중앙값은 16.39초, 1280×704는 25.65초였습니다.

2

세 해상도의 샘플링 VRAM 최대치는 50.11에서 50.86GiB였습니다.

3

영상에 넣으려고 했던 OH MY GPU 문구는 모든 해상도에서 정확하게 나오지 않아 후편집이 필요했습니다.

LTX 2.5는 1080p급 영상을 얼마나 빠르게 만들고, 결과물은 어떨까요? Runpod의 RTX PRO 6000 Blackwell 한 장에서 공식 Two-Stage Distilled 워크플로로 5초 영상을 만들었는데요. 832×448은 중앙값 16.39초, 1280×704는 25.65초, 1984×1088은 54.87초가 걸렸습니다.
가장 높은 해상도에서도 생성은 1분 안에 끝났고, 결과물에는 48kHz 스테레오 오디오가 함께 들어갔습니다. VRAM 피크는 세 해상도 모두 50.11~50.86GiB였습니다.
해상도반복 측정생성 시간 중앙값VRAM 피크생성 구간 비용
832×4485회16.39초50.11GiB$0.0095
1280×7045회25.65초50.61GiB$0.0149
1984×10885회54.87초50.86GiB$0.0319
비용은 테스트 당시 Runpod 가격인 시간당 $2.09에 생성 시간만 곱해 계산했습니다. 각 해상도는 다섯 번씩 반복했고 첫 실행과 워밍업은 중앙값에서 제외했습니다.
RTX PRO 6000에서 다섯 번씩 반복 측정한 LTX 2.5 해상도별 생성 시간과 VRAM

공개 템플릿으로 같은 환경 준비

이번 테스트와 같은 Blackwell GPU, CUDA 13, Sage Attention 환경을 바로 띄울 수 있게 Runpod 템플릿을 공개했습니다.
이 글에는 Runpod 레퍼럴 링크가 포함돼 있습니다.
템플릿에는 CUDA 13과 Sage Attention 실행 환경이 들어 있지만 ComfyUI와 모델 파일은 포함하지 않았습니다. LTX 2.5 모델 파일이 약 46.6GiB이므로 출력 파일과 캐시까지 고려해 /workspace는 60GiB 이상으로 잡았습니다.

약 46.6GiB 모델 파일과 ComfyUI 준비

ComfyUI 설치부터 시작했습니다. 터미널에서 저장소를 받은 뒤 필요한 패키지를 설치합니다.
cd /workspace
git clone https://github.com/comfyanonymous/ComfyUI.git
cd /workspace/ComfyUI
pip install -r requirements.txt
ComfyUI 설치가 끝나면 워크플로에 필요한 여섯 개 파일을 모델 폴더에 배치합니다.
cd /workspace/ComfyUI

hf download Lightricks/LTX-2.5 \
  text_encoders/gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrot.safetensors \
  diffusion_models/ltx-2.5-22b-distilled-transformer-comfy-int8-convrot.safetensors \
  vae/ltx-2.5-video-vae-bf16.safetensors \
  vae/ltx-2.5-audio-vae-bf16.safetensors \
  latent_upscale_models/ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors \
  --local-dir /workspace/ComfyUI/models

hf download Comfy-Org/gemma-4 \
  text_encoders/gemma4_e2b_it_bf16.safetensors \
  --local-dir /workspace/ComfyUI/models
사용한 파일 구성은 다음과 같습니다.
ComfyUI/models/
├── diffusion_models/
│   └── ltx-2.5-22b-distilled-transformer-comfy-int8-convrot.safetensors
├── text_encoders/
│   ├── gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrot.safetensors
│   └── gemma4_e2b_it_bf16.safetensors
├── vae/
│   ├── ltx-2.5-video-vae-bf16.safetensors
│   └── ltx-2.5-audio-vae-bf16.safetensors
└── latent_upscale_models/
    └── ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors

8+3스텝 Two-Stage Distilled 워크플로 실행

다음 명령으로 ComfyUI를 실행했습니다. 화면은 템플릿에 등록한 7860 HTTP 포트로 열었습니다.
cd /workspace/ComfyUI
python main.py \
  --listen 0.0.0.0 \
  --port 7860 \
  --use-sage-attention \
  --disable-auto-launch
LTX 2.5 공식 Two-Stage Distilled 워크플로를 열고 위 파일을 각 모델 로더에 지정했습니다. LoRA는 추가하지 않았고 Prompt Enhance는 ON으로 두었습니다.
1단계에서 8스텝으로 생성하고, 2× Latent Spatial Upscale을 거친 뒤 2단계에서 3스텝을 더 실행했습니다. 영상 길이는 5초, FPS는 24로 두었는데요. 실제로는 121프레임, 5.042초 영상이 나왔습니다.
첫 실행은 64.32초가 걸렸는데요. 모델 로딩이 끝난 뒤에는 해상도별로 다섯 번씩 반복했고, 회차마다 seed를 424243에서 424247까지 바꿔 ComfyUI가 이전 결과를 재사용하지 않게 했습니다.

해상도에 따라 늘어난 생성 시간, 약 51GiB에 머문 VRAM

다섯 번 측정했을 때 832×448은 14.91~16.53초, 1280×704는 24.85~26.45초, 1984×1088은 54.33~58.80초가 걸렸습니다. 해상도를 올리면 생성 시간은 길어졌지만, VRAM 피크는 약 51GiB였습니다.
1984×1088에서 5초 영상 한 편을 만드는 데는 약 55초가 걸렸습니다. 832×448보다 약 3.3배 느렸지만, 생성 구간 비용은 $0.0319였습니다.

해상도를 높여도 틀린 OH MY GPU 문구

바리스타가 우유를 부어 컵 위에 무늬를 완성하는 장면은 세 해상도 모두 동작이 중간에 끊기지 않았습니다. 스케이트보드 장면은 달랐는데요. 832×448 영상에서는 4.5초쯤 인물이 화면 위로 크게 벗어났지만, 해상도를 높이자 화면 안에 더 잘 남았습니다.
반면 영상에 넣으려고 했던 OH MY GPU 문구는 세 해상도에서 모두 정확하게 나오지 않았습니다. OH Y GPU, OH MY GUU로 바뀌었고 해상도를 1984×1088로 올려도 고쳐지지 않았습니다. 영상 안에 정확한 문구가 필요하다면 후편집으로 넣는 편이 낫습니다.
해상도를 높여도 OH MY GPU 문구는 정확해지지 않았습니다.

RTX PRO 6000에서 1분 안에 끝난 1080p급 생성

이번에 사용한 설정에서는 LTX 2.5가 RTX PRO 6000 한 장으로 1080p급 영상과 오디오를 1분 안에 생성했습니다.
5초 영상을 기준으로 832×448은 약 16초, 1280×704는 약 26초, 1984×1088은 약 55초가 걸렸습니다. 1080p급 한 편에는 VRAM 50.86GiB, 생성 시간 54.87초, 생성 구간 비용 $0.0319가 들었습니다. 영상에 넣으려고 했던 OH MY GPU 문구는 해상도를 올려도 정확하게 나오지 않아, 필요한 문구는 후편집으로 넣는 편이 낫습니다.

🔗 References

현재 워크로드를 함께 살펴봅니다.

Runpod 도입·GPU 운영 상담하기