vLLM vs HuggingFace TGI 的实证对比论文:在 LLaMA-2 7B-70B 上测吞吐量 / 端到端延迟 / GPU 显存占用 / 可扩展性结论:vLLM 在高并发批处理上凭借 PagedAttention 比 TGI 高达 24 吞吐;TGI 在交互式单用户场景下尾延迟更低论文给出按工作负载选型的具体建议10 页工程评测,2025-11-17 提交 cs.LG
基础设施
3.0 · 值得看
Comparative Analysis of Large Language Model Inference Serving Systems: A Performance Study of v...
vLLM vs HuggingFace TGI 的实证对比论文:在 LLaMA-2 7B-70B 上测吞吐量 / 端到端延迟 / GPU 显存占用 / 可扩展性结论:vLLM 在高并发批处理上凭借 PagedAttention 比 TGI 高达 24 吞吐;TGI 在交互式单用户场景下尾延迟更低论文给出按工作负载选型的具体建议10 页工程评测,2025-11-17 提交 cs.LG