PyTorch Foundation 網誌介紹 vLLM 的硬件無關層
IBM、Meta 與 Hugging Face 的貢獻者提出硬件無關層,旨在為於不同硬件上運行不同模型的用戶,在前沿效能與可移植性之間取得平衡。
IBM、Meta 與 Hugging Face 的貢獻者提出硬件無關層,旨在為於不同硬件上運行不同模型的用戶,在前沿效能與可移植性之間取得平衡。
vLLM 表示已整合 PyNvVideoCodec,將視訊解碼從 CPU 卸載至 GPU NVDEC,並稱在 8×H100 上達 2x+ 吞吐量。該項目表示此改動隨 CUDA vLLM 版本一併推出。
vLLM 表示,來自 @Alibaba_Qwen 的 Qwen-Image-2.1 已於 vLLM-Omni 獲得 day-0 支援,並指該模型為 7.1B DiT,配對 Qwen3-VL-8B,可用於生成、編輯及透明圖像。Qwen 感謝 vLLM,並表示此單一模型已可投入服務。