容量估算
容量估算用于判断企业 AI 系统需要多少推理资源、存储资源、网络带宽和运维能力。它不是单纯计算 GPU 数量,而是把业务请求量、模型规格、上下文长度、RAG 检索、工具调用和峰值并发放在一起评估。
基本输入
| 输入项 | 说明 |
|---|---|
| 日活用户 | 预计每天有多少真实业务用户使用系统 |
| 请求频率 | 每个用户每天发起多少次问答、摘要或流程任务 |
| 峰值并发 | 高峰时同时在线或同时请求的数量 |
| 模型规格 | 参数量、上下文长度、量化方式和推理框架 |
| 任务类型 | 问答、摘要、长文档分析、工具调用或智能体流程 |
| 数据规模 | 文档数量、向量库规模、索引更新频率 |
mermaid
flowchart LR
A["业务规模"] --> D["容量估算"]
B["模型规格"] --> D
C["任务复杂度"] --> D
D --> E["GPU/CPU 资源"]
D --> F["存储与向量库"]
D --> G["网络与并发"]
D --> H["监控与扩容策略"]估算步骤
- 先定义最小上线场景,例如 30 个试点用户、3 个业务流程、每日 500 次调用。
- 用真实样本测量单次请求平均耗时、上下文长度和输出长度。
- 分别计算普通问答、长文档、RAG、工具调用和智能体任务的资源消耗。
- 做峰值压测,观察排队时间、首 token 时间、错误率和显存占用。
- 预留扩容空间,并明确降级策略,例如切换小模型、缩短上下文或限制长任务。
输出结果
| 输出 | 用途 |
|---|---|
| 推理资源建议 | 决定 GPU、CPU、显存和实例数量 |
| 存储建议 | 决定模型权重、文档库、向量库和日志容量 |
| 并发策略 | 决定限流、排队、异步任务和优先级 |
| 成本区间 | 估算硬件、云资源、运维和扩容成本 |
| 风险清单 | 标记瓶颈、单点故障和不可承诺的性能目标 |
常见误区
- 只按模型参数量估算资源,忽略上下文长度和并发。
- 用演示请求速度判断生产性能,没有做峰值压测。
- 只算模型推理,不算 RAG 检索、重排、日志和工具调用。
- 没有降级策略,导致高峰期系统不可用。
