Inference
Serving-Stacks, Durchsatz und Latenz - gemessen an realen Lasten.
Messungen
| Modell | Hardware | Runtime | Parallel | tok/s | TTFT (ms) | Score | Datum |
|---|---|---|---|---|---|---|---|
| Qwen 3.8 Max | NVIDIA DGX Spark (2× GB10) | vLLM | ×1 | 150.1 | 621 | 92% | 2026-08-29 |
| Qwen 3.8 Max | NVIDIA DGX Spark (2× GB10) | vLLM | ×2 | 225.5 | 1057 | 90% | 2026-08-29 |
| Qwen 3.8 Max | NVIDIA DGX Spark (2× GB10) | vLLM | ×4 | 269.4 | 1263 | 88% | 2026-08-29 |
BeiträgeAlle Beiträge →
Hier erscheinen in Kürze die ersten Beiträge zu diesem Bereich.
Weitere BereicheZurück zum AI Lab →
