Infrastructure

Was aus den Maschinen ein System macht: Runtimes, Dienste, Netz und Überwachung - der Unterbau, auf dem Modelle und Agenten tatsächlich laufen.

Der Betrieb drumherum
NVIDIA DGX Spark (2× GB10)
GPU
2× GB10
VRAM
2× 128 GB unified
Nodes
2 × ConnectX/RoCE
RTX 3090 Ti Workstation
GPU
RTX 3090 Ti
VRAM
24 GB

LLM-Serving im Dauerbetrieb (llama.cpp / llama-swap)

RTX 4070 Ti Workstation
GPU
RTX 4070 Ti
VRAM
12 GB

Speech-Stack: Echtzeit-STT, TTS und Sprecher-Erkennung

RTX 5070 Workstation
GPU
RTX 5070
VRAM
12 GB

STT-Zweitpass und Vision-Experimente

ModellFamilieQuantisierungKontextStatus
Qwen 3.8 MaxQwenNVFP4262ktesting
Runtimes llama.cppvLLM 0.25
ModellHardwareRuntimeParalleltok/sTTFT (ms)ScoreDatum
Qwen 3.8 MaxNVIDIA DGX Spark (2× GB10)vLLM ×1 150.162192% 2026-08-29
Qwen 3.8 MaxNVIDIA DGX Spark (2× GB10)vLLM ×2 225.5105790% 2026-08-29
Qwen 3.8 MaxNVIDIA DGX Spark (2× GB10)vLLM ×4 269.4126388% 2026-08-29

Hier erscheinen in Kürze die ersten Beiträge zu diesem Bereich.