Infrastructure
Was aus den Maschinen ein System macht: Runtimes, Dienste, Netz und Überwachung - der Unterbau, auf dem Modelle und Agenten tatsächlich laufen.
Der Betrieb drumherum
NVIDIA DGX Spark (2× GB10)
- GPU
- 2× GB10
- VRAM
- 2× 128 GB unified
- Nodes
- 2 × ConnectX/RoCE
RTX 3090 Ti Workstation
- GPU
- RTX 3090 Ti
- VRAM
- 24 GB
LLM-Serving im Dauerbetrieb (llama.cpp / llama-swap)
RTX 4070 Ti Workstation
- GPU
- RTX 4070 Ti
- VRAM
- 12 GB
Speech-Stack: Echtzeit-STT, TTS und Sprecher-Erkennung
RTX 5070 Workstation
- GPU
- RTX 5070
- VRAM
- 12 GB
STT-Zweitpass und Vision-Experimente
| Modell | Familie | Quantisierung | Kontext | Status |
|---|---|---|---|---|
| Qwen 3.8 Max | Qwen | NVFP4 | 262k | testing |
Runtimes
llama.cppvLLM 0.25
| Modell | Hardware | Runtime | Parallel | tok/s | TTFT (ms) | Score | Datum |
|---|---|---|---|---|---|---|---|
| Qwen 3.8 Max | NVIDIA DGX Spark (2× GB10) | vLLM | ×1 | 150.1 | 621 | 92% | 2026-08-29 |
| Qwen 3.8 Max | NVIDIA DGX Spark (2× GB10) | vLLM | ×2 | 225.5 | 1057 | 90% | 2026-08-29 |
| Qwen 3.8 Max | NVIDIA DGX Spark (2× GB10) | vLLM | ×4 | 269.4 | 1263 | 88% | 2026-08-29 |
BeiträgeAlle Beiträge →
Hier erscheinen in Kürze die ersten Beiträge zu diesem Bereich.
Weitere BereicheZurück zum AI Lab →
