Hugging Face Blog·· 2025-04-16AI 评分36
并发请求下的 Prefill 与 Decode:优化 LLM 性能
Prefill and Decode for Concurrent Requests - Optimizing LLM Performance
AI 导读
TNG 在 24 块 H100 GPU 集群上自托管多个大语言模型,支撑 50 个应用、每小时超 5,000 次推理、每天生成超一千万 token。文章解析 LLM 生成的两个阶段:prefill 阶段可并行处理全部输入 token,decode 阶段只能逐个生成输出 token,二者分别对应首 token 延迟和单 token 延迟两项指标。
来源:Hugging Face Blog · huggingface.co