方案配置工具平台
模型与量化
推理时模型权重的精度。越低越省显存, 但可能影响质量。
KV 缓存精度。越低越省显存, 尤其适用于长序列。
硬件配置 · 集群选型
−
+
−
+
−
+
−
+
输入参数
每步同时处理的输入数 (影响吞吐量与延迟)。
每个输入的最大 token 数; 影响 KV 缓存与激活 (也受注意力结构影响)。
同时进行推理的用户数 (影响显存与每用户性能)。
▶ 高级配置
多个请求共享同一系统前缀时, 共享前缀的 KV 缓存只存一份, 显著降低长上下文 KV 占用。
为 CUDA Graph / 静态内存池预留固定显存, 减少运行时碎片与 OOM 风险。
可用投机解码模块将在计算后显示。
勾选后按所选模型的投机解码模块增加对应权重 (默认取该模块参数量, 可手动覆盖); 需额外显存存放草稿模型权重。
动态打包多序列填充 GPU, 提升吞吐; 关闭则按固定批量逐步处理。
填写左侧配置后点击「计算显存与性能」。