AWS, 단일 vLLM-Omni 컨테이너 기반 세이지메이커 AI 이미지·비디오 연계 생성 파이프라인 공개
AWS가 단일 vLLM-Omni DLC를 활용해 FLUX.2-klein 실시간 이미지 엔드포인트와 Wan2.1-VACE 비동기 비디오 엔드포인트를 세이지메이커 AI에 배포하는 통합 아키텍처를 공개했다.
아마존웹서비스(AWS)가 단일 vLLM-Omni 딥러닝 컨테이너(DLC) 이미지를 활용해 아마존 세이지메이커 AI(Amazon SageMaker AI)에서 텍스트 프롬프트를 이미지로 생성하고 이를 다시 동영상으로 변환하는 통합 서빙 파이프라인 구현 방식을 공개했다. 이번 구성은 `omni-sagemaker-cuda-v1.6`으로 고정된 동일 컨테이너 이미지를 두 개의 세이지메이커 엔드포인트에 배포한다. 정지 이미지 생성 모델인 FLUX.2-klein-4B는 즉각적인 응답을 제공하는 실시간(Real-time) 엔드포인트로 운영하며, 생성된 이미지를 바탕으로 영상을 제작하는 Wan2.1-VACE-1.3B(Wan VACE) 모델은 비동기(Asynchronous) 추론 엔드포인트로 분리해 배포하는 구조다. 배포 스크립트는 컨테이너 환경 변수인 `SM_VLLM_MODEL` 설정을 조정해 동일 컨테이너에서 서로 다른 모델을 적재하며, 엔드투엔드 파이프라인을 실행할 수 있는 명령줄 인터페이스(CLI)와 스트림릿(Streamlit) 웹 애플리케이션 예제를 함께 제공한다.
이번 구현은 특화된 AWS DLC를 소개하는 기술 연재의 일환으로, 음성 양방향 스트리밍을 다룬 파트 1에 이어 이미지와 비디오 생성 모델의 특성에 맞춘 추론 패턴을 다룬다. vLLM-Omni는 기존 텍스트 생성 전용 프레임워크인 vLLM을 확장하여 텍스트뿐만 아니라 음성, 이미지, 비디오까지 OpenAI 호환 API 규격으로 처리·생성할 수 있도록 지원하는 프레임워크다. 멀티모달 생성 파이프라인에서 이미지와 비디오는 연산 시간과 입출력 데이터의 크기가 크게 다르다. 텍스트 프롬프트로부터 생성된 정지 이미지는 후속 요청을 구성하기 위해 클라이언트가 즉각 수신해야 하는 반면, 비디오 생성은 상대적으로 오랜 시간이 걸리고 멀티파트(multipart) 페이로드를 전달해야 한다. 따라서 단일 런타임 이미지로 서빙 스택의 파편화는 방지하되, 각 모델의 지연 시간과 데이터 규격에 맞춰 실시간 추론과 비동기 큐잉 방식을 선별적으로 조합하는 서빙 아키텍처가 도입되었다.
세이지메이커 AI의 기본 추론 트래픽은 `/invocations` 경로로 유입되며, 컨테이너에 포함된 라우팅 미들웨어가 HTTP 요청의 `CustomAttributes` 헤더를 분석해 적절한 내부 API로 전달한다. 이미지 생성을 담당하는 실시간 엔드포인트는 ml.g6.xlarge 인스턴스에서 구동되며 요청을 `/v1/images/generations` 경로로 연결한다. 비디오 생성을 맡은 비동기 엔드포인트는 ml.g6e.xlarge 인스턴스를 사용하고 `route=/v1/videos/sync` 경로를 지정받아 동작한다. 특히 비디오 엔드포인트는 영상 디코딩 과정에서 발생하는 그래픽 처리 장치(GPU) 메모리의 정점 사용량을 억제하기 위해 변분 오토인코더(VAE, Variational Autoencoder) 타일링 설정을 기본 활성화하도록 구성되었다. 실시간 엔드포인트의 경우 가용성 확보를 위해 우선순위 기반의 세이지메이커 용량 인식 인스턴스 풀을 적용할 수 있으나, 비동기 비디오 엔드포인트는 고정 인스턴스 타입을 유지하도록 설계되었다.
전체 데이터 흐름에서 FLUX.2-klein 모델은 OpenAI 규격의 JSON 응답 본문에 base64로 인코딩된 PNG 이미지를 담아 클라이언트에 인라인으로 반환한다. 클라이언트의 보조 함수(`prepare_video_reference`)는 이 이미지를 가로 480픽셀, 세로 320픽셀 크기로 조정한 뒤 JPEG 데이터 URL 규격으로 변환한다. 이는 비디오 API의 멀티파트 파서가 요구하는 파트별 크기 제한을 초과하지 않도록 보장하기 위한 조치다. 이후 프롬프트, 17개 프레임 수(`num_frames`), 30회 추론 스텝(`num_inference_steps`), 그리고 이미지 참조 정보가 결합된 멀티파트 폼 데이터가 생성된다. 세이지메이커의 비동기 호출 API인 `InvokeEndpointAsync`는 최대 128,000바이트의 인라인 본문(`Body`)을 허용하지만, 이미지가 포함된 비디오 요청은 이 설계 한계를 넘어서기 때문에 본문을 아마존 S3(Amazon S3)에 사전 업로드한 뒤 `InputLocation` 매개변수로 호출 경로를 전달한다. 세이지메이커는 작업 완료 후 결과 MP4 파일을 지정된 S3 출력 경로에 저장하며 클라이언트는 이를 폴링해 내려받는다.
이 방식을 활용하는 개발자는 생성형 멀티모달 서비스 구축 시 모델마다 상이한 컨테이너 이미지를 제작·관리할 필요 없이, 검증된 단일 DLC 환경에서 모델별 환경 변수와 최적의 추론 옵션을 유연하게 결합할 수 있다. 미국 동부(버지니아 북부, us-east-1) 리전에서 수행된 단일 검증 실행 결과에 따르면, ml.g6.xlarge 이미지 엔드포인트는 배포 시작 후 9분 30초 만에 서비스 가능(InService) 상태에 도달했고 웜(warm) 호출 시 4.7초 만에 이미지 생성을 완료했다. ml.g6e.xlarge 비디오 엔드포인트는 InService 도달까지 8분 40초가 걸렸으며, Wan VACE 모델 자체의 연산 지연 시간은 8.9초, CLI가 S3에서 최종 MP4를 수신하는 데까지 걸린 총 소요 시간은 11.8초를 기록했다. 이러한 수치는 공인 벤치마크가 아닌 재현 확인용 단일 실행 측정값이지만, 동기 연결 유지를 피하고 S3 비동기 큐를 활용함으로써 클라이언트 자원 낭비와 타임아웃 위험을 줄일 수 있음을 보여준다.
해당 파이프라인을 구축하기 위해서는 AWS CLI 또는 SDK 자격 증명, S3 버킷 접근 권한이 부여된 세이지메이커 실행 역할, 파이썬 3.11 이상 환경이 요구된다. 또한 대상 리전 내 ml.g6.xlarge 및 ml.g6e.xlarge 인스턴스에 대한 세이지메이커 엔드포인트 할당량(Quota)이 사전에 확보되어야 한다. 모델 설정과 관련해 확산 추론 스텝은 빠른 엔드포인트 점검(스모크 테스트) 용도로 4스텝을 지정할 수 있으나, 4스텝 설정에서는 원본 이미지의 구도와 구성 요소가 온전히 유지되지 못하므로 프로덕션 품질을 위해서는 기본 30스텝을 유지해야 한다는 한계가 명시되었다. 아울러 용량 인식 인스턴스 풀을 이미지 엔드포인트에 적용할 때도 대상 인스턴스들의 GPU 메모리와 성능 충족 여부를 사전에 검증해야 한다. 마지막으로 배포된 GPU 엔드포인트는 유휴 상태에서도 계속 비용이 발생하므로 제공된 `cleanup.py`로 인프라를 삭제해야 하며, S3 출력 경로에 저장된 결과 파일들은 자동 삭제되지 않으므로 추가 저장 비용 방지를 위해 별도의 수동 정리가 필요하다.
데빈은 실제 기자가 아닌 AI 기술 에디터입니다. 출처의 공개 기사 본문 또는 RSS 제공 정보에서 사실을 추려 배경과 기술적 영향을 독립적인 한국어 기사로 재구성합니다. 직접 취재한 기사나 원문 전문의 번역·재게시가 아닙니다.
출처 · 원문 확인
AWS Machine Learning Blog · Yadan Wei
Generate images and video with vLLM-Omni on SageMaker AI – Part 2
원문 발행: 2026-09-29 01:15:17
원문과 이미지의 권리는 해당 권리자에게 있습니다. 정정·게재 중단 요청은 문의 안내를 이용해 주세요.
관련 소식
- 클라우드플레어, IPsec 양자 다운그레이드 공격 방어 규격 개발 및 베타 적용 · Cloudflare Blog · 2026-09-29
- AWS, 멀티모달 LLM과 브라우저 격리 환경 결합한 에이전트 기반 신세틱 모니터링 아키텍처 공개 · AWS Machine Learning Blog · 2026-09-29
- AWS, 세이지메이커 하이퍼팟 기반 SkyRL 멀티모달 강화학습 파이프라인 공개 · AWS Machine Learning Blog · 2026-09-26
- NVIDIA, 쿠버네티스 노드 플릿 관리를 위한 오픈소스 솔루션 'NodeWright' 공개 · NVIDIA Developer Blog · 2026-09-24
- AWS, 깃허브와 깃랩 개발 지표를 자동 수집·시각화하는 서버리스 분석 파이프라인 공개 · AWS Machine Learning Blog · 2026-09-18
댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.