vLLM
vLLM 是常见的大模型推理服务框架,适合需要较高吞吐和稳定 API 的部署场景。
适用场景
- 开源模型推理服务
- 多用户并发请求
- 对吞吐和延迟有要求的企业应用
- 私有化部署中的模型服务层
- 多模型路由中的推理节点
选型注意
vLLM 需要结合模型大小、GPU 显存、并发量和上下文长度一起评估。
mermaid
flowchart LR
A["FDE 执行引擎"] --> B["模型路由"]
B --> C["vLLM 推理服务"]
C --> D["GPU 资源"]
C --> E["模型权重"]
C --> F["监控与日志"]部署评估
| 维度 | 说明 |
|---|---|
| 模型规格 | 参数量、量化方式、上下文长度会影响显存 |
| 并发 | 请求峰值、批处理策略和排队延迟需要压测 |
| API | 是否满足现有应用的调用方式和鉴权要求 |
| 监控 | 需要记录延迟、吞吐、错误率、显存和队列情况 |
| 运维 | 模型更新、服务重启、灰度和回滚要可控 |
和私有化部署的关系
vLLM 通常属于 大模型私有化部署 的推理服务层。它解决的是模型如何高效对外提供服务,不直接解决知识库、权限、审计和业务流程问题。因此生产项目还需要配合 RAG、MCP 和 LLMOps。
常见误区
- 部署了 vLLM 不等于完成企业 AI 应用。
- 吞吐高不代表业务体验一定好,还要看首 token 时间和端到端链路。
- 只看单次请求速度不够,需要压测真实并发。
