PyTorch Foundation 블로그, vLLM용 하드웨어 독립 레이어 소개
IBM, Meta, Hugging Face의 기여자들이 다양한 하드웨어에서 다양한 모델을 실행하는 사용자를 위해 최첨단 성능과 이식성의 균형을 맞추려는 하드웨어 독립 레이어를 소개한다.
IBM, Meta, Hugging Face의 기여자들이 다양한 하드웨어에서 다양한 모델을 실행하는 사용자를 위해 최첨단 성능과 이식성의 균형을 맞추려는 하드웨어 독립 레이어를 소개한다.
vLLM은 PyNvVideoCodec을 통합하여 비디오 디코딩을 CPU에서 GPU NVDEC로 오프로드했으며, 8×H100에서 2x+ 처리량을 보고했다고 밝혔습니다. 이 프로젝트는 해당 변경 사항이 CUDA vLLM 릴리스와 함께 제공된다고 전했습니다.
vLLM은 @Alibaba_Qwen의 Qwen-Image-2.1이 vLLM-Omni에서 출시 당일 지원된다고 밝혔으며, 생성·편집·투명 이미지를 위해 Qwen3-VL-8B와 페어링된 7.1B DiT라고 설명했다. Qwen은 vLLM에 감사하며 하나의 모델이 서비스를 제공할 준비가 되었다고 말했다.