Citation :
(APIServer pid=7) INFO 08-06 21:13:34 [loggers.py:314] Engine 000: Avg prompt throughput: 3616.3 tokens/s, Avg generation throughput: 230.2 tokens/s, Running: 3 reqs, Waiting: 0 reqs, GPU KV cache usage: 13.5%, Prefix cache hit rate: 85.8%
(APIServer pid=7) INFO 08-06 21:13:44 [loggers.py:314] Engine 000: Avg prompt throughput: 6401.0 tokens/s, Avg generation throughput: 269.2 tokens/s, Running: 4 reqs, Waiting: 0 reqs, GPU KV cache usage: 8.4%, Prefix cache hit rate: 81.0%
(APIServer pid=7) INFO 08-06 21:13:54 [loggers.py:314] Engine 000: Avg prompt throughput: 6874.1 tokens/s, Avg generation throughput: 344.6 tokens/s, Running: 5 reqs, Waiting: 0 reqs, GPU KV cache usage: 2.0%, Prefix cache hit rate: 80.3%
(APIServer pid=7) INFO 08-06 21:14:04 [loggers.py:314] Engine 000: Avg prompt throughput: 1806.3 tokens/s, Avg generation throughput: 635.8 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 2.0%, Prefix cache hit rate: 79.6%
(APIServer pid=7) INFO 08-06 21:14:14 [loggers.py:314] Engine 000: Avg prompt throughput: 2983.9 tokens/s, Avg generation throughput: 590.4 tokens/s, Running: 5 reqs, Waiting: 0 reqs, GPU KV cache usage: 9.1%, Prefix cache hit rate: 78.6%
(APIServer pid=7) INFO 08-06 21:14:24 [loggers.py:314] Engine 000: Avg prompt throughput: 6983.7 tokens/s, Avg generation throughput: 409.5 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 2.8%, Prefix cache hit rate: 77.6%
(APIServer pid=7) INFO 08-06 21:14:34 [loggers.py:314] Engine 000: Avg prompt throughput: 2550.8 tokens/s, Avg generation throughput: 609.9 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 14.8%, Prefix cache hit rate: 77.7%
(APIServer pid=7) INFO 08-06 21:14:44 [loggers.py:314] Engine 000: Avg prompt throughput: 6635.8 tokens/s, Avg generation throughput: 387.1 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 3.6%, Prefix cache hit rate: 77.7%
(APIServer pid=7) INFO 08-06 21:14:54 [loggers.py:314] Engine 000: Avg prompt throughput: 3148.5 tokens/s, Avg generation throughput: 547.7 tokens/s, Running: 5 reqs, Waiting: 0 reqs, GPU KV cache usage: 8.9%, Prefix cache hit rate: 78.6%
(APIServer pid=7) INFO 08-06 21:15:04 [loggers.py:314] Engine 000: Avg prompt throughput: 6454.2 tokens/s, Avg generation throughput: 341.4 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 4.4%, Prefix cache hit rate: 79.7%
(APIServer pid=7) INFO 08-06 21:15:14 [loggers.py:314] Engine 000: Avg prompt throughput: 4481.4 tokens/s, Avg generation throughput: 436.5 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 4.7%, Prefix cache hit rate: 81.0%
(APIServer pid=7) INFO 08-06 21:15:24 [loggers.py:314] Engine 000: Avg prompt throughput: 6621.5 tokens/s, Avg generation throughput: 313.8 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 12.3%, Prefix cache hit rate: 81.7%
(APIServer pid=7) INFO 08-06 21:15:34 [loggers.py:314] Engine 000: Avg prompt throughput: 3559.2 tokens/s, Avg generation throughput: 500.9 tokens/s, Running: 5 reqs, Waiting: 0 reqs, GPU KV cache usage: 4.3%, Prefix cache hit rate: 82.4%
(APIServer pid=7) INFO 08-06 21:15:44 [loggers.py:314] Engine 000: Avg prompt throughput: 3410.1 tokens/s, Avg generation throughput: 475.3 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 5.9%, Prefix cache hit rate: 83.1%
(APIServer pid=7) INFO 08-06 21:15:54 [loggers.py:314] Engine 000: Avg prompt throughput: 3726.1 tokens/s, Avg generation throughput: 390.2 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 13.9%, Prefix cache hit rate: 84.6%
(APIServer pid=7) INFO 08-06 21:16:04 [loggers.py:314] Engine 000: Avg prompt throughput: 3019.7 tokens/s, Avg generation throughput: 469.9 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 6.4%, Prefix cache hit rate: 85.5%
(APIServer pid=7) INFO 08-06 21:16:14 [loggers.py:314] Engine 000: Avg prompt throughput: 2217.1 tokens/s, Avg generation throughput: 516.1 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 11.6%, Prefix cache hit rate: 86.3%
(APIServer pid=7) INFO 08-06 21:16:24 [loggers.py:314] Engine 000: Avg prompt throughput: 3700.4 tokens/s, Avg generation throughput: 463.2 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 6.9%, Prefix cache hit rate: 86.8%
(APIServer pid=7) INFO 08-06 21:16:34 [loggers.py:314] Engine 000: Avg prompt throughput: 3148.0 tokens/s, Avg generation throughput: 420.8 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 11.6%, Prefix cache hit rate: 88.4%
(APIServer pid=7) INFO 08-06 21:16:44 [loggers.py:314] Engine 000: Avg prompt throughput: 2458.1 tokens/s, Avg generation throughput: 520.8 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.4%, Prefix cache hit rate: 88.8%
(APIServer pid=7) INFO 08-06 21:16:54 [loggers.py:314] Engine 000: Avg prompt throughput: 1182.8 tokens/s, Avg generation throughput: 555.1 tokens/s, Running: 5 reqs, Waiting: 0 reqs, GPU KV cache usage: 6.4%, Prefix cache hit rate: 89.3%
(APIServer pid=7) INFO 08-06 21:17:04 [loggers.py:314] Engine 000: Avg prompt throughput: 2243.0 tokens/s, Avg generation throughput: 512.4 tokens/s, Running: 5 reqs, Waiting: 0 reqs, GPU KV cache usage: 13.5%, Prefix cache hit rate: 89.5%
(APIServer pid=7) INFO 08-06 21:17:14 [loggers.py:314] Engine 000: Avg prompt throughput: 4154.6 tokens/s, Avg generation throughput: 354.9 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 9.4%, Prefix cache hit rate: 90.3%
(APIServer pid=7) INFO 08-06 21:17:24 [loggers.py:314] Engine 000: Avg prompt throughput: 644.4 tokens/s, Avg generation throughput: 568.5 tokens/s, Running: 5 reqs, Waiting: 0 reqs, GPU KV cache usage: 6.5%, Prefix cache hit rate: 90.7%
|