vLLM 0.31.0 adds `vllm preload` for fast restarts and locks down per-request multimodal kwargs
The Oct 5 release adds vllm preload, a daemon that keeps post-quantized weights resident in GPU memory so engine restarts skip reloading, plus a big DeepSeek-V4.1-Flash speed pass on Blackwell (SM100). Check your configs before upgrading: per-request mm_processor_kwargs and media_io_kwargs are now rejected unless you pass --trust-request-mm-kwargs, tokenizer_mode="slow" is gone, and online quantization="fp8" becomes fp8_per_tensor.
