Skip to content

容量估算

容量估算用于判断企业 AI 系统需要多少推理资源、存储资源、网络带宽和运维能力。它不是单纯计算 GPU 数量,而是把业务请求量、模型规格、上下文长度、RAG 检索、工具调用和峰值并发放在一起评估。

基本输入

输入项说明
日活用户预计每天有多少真实业务用户使用系统
请求频率每个用户每天发起多少次问答、摘要或流程任务
峰值并发高峰时同时在线或同时请求的数量
模型规格参数量、上下文长度、量化方式和推理框架
任务类型问答、摘要、长文档分析、工具调用或智能体流程
数据规模文档数量、向量库规模、索引更新频率
mermaid
flowchart LR
  A["业务规模"] --> D["容量估算"]
  B["模型规格"] --> D
  C["任务复杂度"] --> D
  D --> E["GPU/CPU 资源"]
  D --> F["存储与向量库"]
  D --> G["网络与并发"]
  D --> H["监控与扩容策略"]

估算步骤

  1. 先定义最小上线场景,例如 30 个试点用户、3 个业务流程、每日 500 次调用。
  2. 用真实样本测量单次请求平均耗时、上下文长度和输出长度。
  3. 分别计算普通问答、长文档、RAG、工具调用和智能体任务的资源消耗。
  4. 做峰值压测,观察排队时间、首 token 时间、错误率和显存占用。
  5. 预留扩容空间,并明确降级策略,例如切换小模型、缩短上下文或限制长任务。

输出结果

输出用途
推理资源建议决定 GPU、CPU、显存和实例数量
存储建议决定模型权重、文档库、向量库和日志容量
并发策略决定限流、排队、异步任务和优先级
成本区间估算硬件、云资源、运维和扩容成本
风险清单标记瓶颈、单点故障和不可承诺的性能目标

常见误区

  • 只按模型参数量估算资源,忽略上下文长度和并发。
  • 用演示请求速度判断生产性能,没有做峰值压测。
  • 只算模型推理,不算 RAG 检索、重排、日志和工具调用。
  • 没有降级策略,导致高峰期系统不可用。

容量估算应与 GPU 选型国产芯片私有化部署LLMOps 一起设计。

驻场交付,让系统真正跑起来。