LocalFTW
Why Local
All Posts
Guides
Contribute
Clinic
Topic Graph
Bookmarks
Sponsors
Tagged "batched-inference"
vLLM v0.28.0 Features Major Kimi-K3 Optimization and Decode Context Parallel Support
27 August 2026
NVIDIA Accelerates Gemma 4 for Local Agentic AI on RTX GPUs
3 April 2026
Mistral AI Debugs Critical Memory Leak in vLLM Inference Engine
11 February 2026