Conversation

Jarkko Sakkinen

fter optimizing QWen3-VL-2B Q8 pipeline a bit in ReadSeek:

Decoder prefill: 47.3 s -> 14.1 s
Total inference: 133.4 s -> 98.8 s
Prefill throughput: 6.2 tok/s -> 20.8 tok/s

CPU: AMD Ryzen 5 PRO 4650U

Update will be released soon :-)
0
0
0