推理速度详情
Prefill 累计耗时-
Decode 累计耗时-
输出吞吐(近期)-
Prefill 速度-
Decode 速度-
「近期窗口」按采样间隔增量计算;vLLM 仅在请求完成时刷新 token / 耗时计数器,故空闲时显示「空闲」。
请求统计
抢占次数0
总请求数0
平均 Prompt / 请求-
平均生成 / 请求-
「抢占」表示因 KV 缓存不足被调度器换出的请求数。
Token 统计
缓存命中率0%
生成 Token0
输出吞吐(近期)-
延迟(均值)
首 Token (TTFT)-
Token 间隔 (ITL)-
端到端-
排队等待-
Prefill 阶段-
Decode 阶段-
投机解码 DFlash2 · 7 drafts
草稿 Token0
接受率-
前缀缓存收益 命中即跳过 prefill 计算
节省费用(按输入价折算)¥0
前缀命中率-
上次查询 / 命中-
前缀查询 Token0
前缀命中 Token0
Prompt 缓存命中率-
GPU 块数 / 缓存内存-
精度 / 块大小-
前缀缓存-
进程
运行时长-
内存 (RSS)
虚拟内存-
CPU 时间-
打开句柄-
GC 对象-
引擎状态运行中
实时功耗
单卡均耗-
系统估算-
电费¥0
电价 ¥1.00/度 · 系统开销 +50W · 按 vLLM 运行时长估算
GPU 4 × Tesla V100-SXM2-16GB · TP4
推理速度趋势
Prefill tok/s
Decode tok/s
费用统计 参考 DeepSeek V4 Flash 定价
API 每请求均价-
API 每 1K Token-
缓存节省¥0
本地运行总成本¥0
净节省(API − 电费)¥0
单价输入 ¥1.0/M · 输出 ¥2.0/M · 缓存 ¥0.05/M