Hugging Face Blog·· 2025-06-12AI 评分34
长提示词如何阻塞其他请求:优化 LLM 性能
How Long Prompts Block Other Requests - Optimizing LLM Performance
AI 导读
TNG 在 24 张 H100 上自托管多个大语言模型,服务超 50 个应用,日均消耗超 1 亿 token、生成超 1000 万 token。其分析指出,vLLM 默认的 chunked-prefill 会顺序调度不同请求的 prefill,单个长提示词请求即可阻塞后续请求,显著拉高首 token 延迟。
来源:Hugging Face Blog · huggingface.co