PyTorch Foundation 博客介绍面向 vLLM 的硬件无关层
来自 IBM、Meta 和 Hugging Face 的贡献者提出硬件无关层,旨在为在不同硬件上运行多种模型的用户兼顾前沿性能与可移植性。
来自 IBM、Meta 和 Hugging Face 的贡献者提出硬件无关层,旨在为在不同硬件上运行多种模型的用户兼顾前沿性能与可移植性。
vLLM 表示已集成 PyNvVideoCodec,将视频解码从 CPU 卸载至 GPU NVDEC,并报告在 8×H100 上实现 2x+ 吞吐量。该项目称此变更随 CUDA vLLM 发行版发布。
vLLM 表示,来自 @Alibaba_Qwen 的 Qwen-Image-2.1 已在 vLLM-Omni 中获得 Day-0 支持,称其为一个 7.1B 的 DiT,与 Qwen3-VL-8B 配对,可用于生成、编辑和透明图像。Qwen 感谢 vLLM,并表示这一模型已可提供服务。