June 22, 2026 SPECTRE: Hybrid Ordinary-Parallel Speculative Serving for Resource-Efficient LLM Inference 通过复用闲置尾部模型服务作为远程草稿模型,实现资源高效的 LLM 推理服务 llm-serving speculative-decoding multi-tenant resource-efficiency inference-optimization