2026년 9월 12일은긔
오픈웨이트 모델을 받는데, 왜 회사 이름과 직함까지 적어야 했을까
MiniMax H3 승인을 직접 받아보며, 한국에서 오픈웨이트 모델을 사용할 때 파일 접근과 실제 사용 권한이 왜 다른 문제인지 정리했습니다.
읽어보기
Oh My GPU Blog
LLM 서빙, GPU 하드웨어, 생성 AI와 운영 과정을 튜토리얼·벤치마크·리뷰로 정리합니다.
MiniMax H3 승인을 직접 받아보며, 한국에서 오픈웨이트 모델을 사용할 때 파일 접근과 실제 사용 권한이 왜 다른 문제인지 정리했습니다.
읽어보기
B200 두 장에 Qwen3.8 Flash Next NVFP4를 올리면 어디까지 서비스할 수 있을까요? 처리량이 멈춘 지점과 지연 시간이 급격히 늘어난 지점을 나눠 확인했습니다.
읽어보기
LTX-2.5 I2V로 확인한 RTX 5090과 RTX PRO 6000 3프로세스의 실제 처리량·VRAM·비용 비교
읽어보기
Qwen3.8-27B에서 Network Volume에 저장한 vLLM 컴파일·커널 캐시가 새 Serverless 워커에서도 재사용되는지 확인한 실험입니다.
읽어보기
LTX 2.5는 1080p급 영상을 얼마나 빠르게 만들고, 결과물은 어떨까요? RTX PRO 6000에서 5초 영상을 54.87초에 생성했지만, 영상에 넣으려고 했던 OH MY GPU 문구는 해상도를 높여도 정확하게 나오지 않았습니다.
읽어보기
공유 템플릿과 vLLM을 이용해 RTX 5090 한 장에서 Qwen3.8 27B NVFP4 모델을 구동하고 외부 API와 성능을 확인한 재현 가능한 배포 가이드입니다.
읽어보기
LLM 서빙 최적화의 반복 비용과 Runpod Overdrive를 평가할 때 확인할 기준을 정리합니다.
읽어보기