vLLM 监控
连接中…
-- 连接中…
Prefill 速度
0
tokens / 秒 · 累计均值
近期窗口 -
Decode 速度
0
tokens / 秒 · 累计均值
近期窗口 -
运行 / 排队
0
排队 0
KV 缓存占用
0%
前缀命中 0%
GPU 功耗
0 W
峰值 -
累计请求
0
输出 0 tokens
当前阶段
当前请求 Prompt tokens
上一完成请求 tokens
上次 Prefill 耗时 s
上次 Decode 耗时 s
0 tok/s 生成 0 /s 草稿 0 %/s KV增速 0% 占用 日志 10s 窗口 0 prompt 0 gen 0运行 / 0排队
推理速度详情
-
Prefill 累计 Token
-
单请求速率 (1/ITL)
Prefill 累计耗时-
Decode 累计耗时-
输出吞吐(近期)-
Prefill 速度-
Decode 速度-
「近期窗口」按采样间隔增量计算;vLLM 仅在请求完成时刷新 token / 耗时计数器,故空闲时显示「空闲」。
请求统计
0
正常结束
0
长度截断
0
中止
0
错误
抢占次数0
总请求数0
平均 Prompt / 请求-
平均生成 / 请求-
「抢占」表示因 KV 缓存不足被调度器换出的请求数。
Token 统计
0
Prompt Token
0
缓存命中 Token
缓存命中率0%
生成 Token0
输出吞吐(近期)-
延迟(均值)
首 Token (TTFT)-
Token 间隔 (ITL)-
端到端-
排队等待-
Prefill 阶段-
Decode 阶段-
投机解码 DFlash2 · 7 drafts
0
草稿次数
0
接受 Token
草稿 Token0
接受率-
前缀缓存收益 命中即跳过 prefill 计算
0
节约 Token 总量
上次节约 Token
节省费用(按输入价折算)¥0
前缀命中率-
上次查询 / 命中-
前缀查询 Token0
前缀命中 Token0
Prompt 缓存命中率-
GPU 块数 / 缓存内存-
精度 / 块大小-
前缀缓存-
进程
运行时长-
内存 (RSS)-
虚拟内存-
CPU 时间-
打开句柄-
GC 对象-
引擎状态运行中
实时功耗
0 W
平均功耗
-
已耗电量
单卡均耗-
系统估算-
电费¥0
电价 ¥1.00/度 · 系统开销 +50W · 按 vLLM 运行时长估算
GPU 4 × Tesla V100-SXM2-16GB · TP4
推理速度趋势
Prefill tok/s Decode tok/s
KV 缓存趋势
占用率 % 前缀命中率 %
Token 趋势
Prompt 生成
延迟趋势
首 Token (s) 端到端 (s)
费用统计 参考 DeepSeek V4 Flash 定价
¥0
Prompt 费用
¥0
生成费用
¥0
API 合计
¥0
电费
API 每请求均价-
API 每 1K Token-
缓存节省¥0
本地运行总成本¥0
净节省(API − 电费)¥0
单价输入 ¥1.0/M · 输出 ¥2.0/M · 缓存 ¥0.05/M