登录

LLM 推理显存与性能计算 · 云网安方案配置
方案配置工具平台

模型与量化

推理时模型权重的精度。越低越省显存, 但可能影响质量。
KV 缓存精度。越低越省显存, 尤其适用于长序列。

硬件配置 · 集群选型

+
+
+
+

输入参数

每步同时处理的输入数 (影响吞吐量与延迟)。
每个输入的最大 token 数; 影响 KV 缓存与激活 (也受注意力结构影响)。
同时进行推理的用户数 (影响显存与每用户性能)。

▶ 高级配置

动态打包多序列填充 GPU, 提升吞吐; 关闭则按固定批量逐步处理。
填写左侧配置后点击「计算显存与性能」。