Fleet Navigator läuft auf Consumer Hardware – kein Rechenzentrum nötig
Marktübersicht: Hardware für lokale LLM-Inferenz
Stand: 26. August 2026 · Preisquellen: Geizhals.de, Apple Store DE, Herstellerdirektvertrieb
| Gerät | Speicher | Bandbreite | Straßenpreis DE | Status / Bezugsquelle |
|---|---|---|---|---|
| NVIDIA DGX Spark FE (GB10) | 128 GB LPDDR5X unified | 273 GB/s | ab 5.785 € | Geizhals, Preisstand 26.08.2026 |
| ASUS Ascent GX10 | 128 GB unified | 273 GB/s | ab 4.292 € | Geizhals, günstigste GB10-Variante |
| Lenovo ThinkStation PGX | 128 GB unified | 273 GB/s | ab 4.729 € | Geizhals |
| Gigabyte AI TOP ATOM | 128 GB unified | 273 GB/s | ab 5.030 € | Geizhals |
| Mac Studio M5 Ultra 256 GB | 256 GB unified | ~1.200 GB/s | 10.999 € | Apple-Listenpreis; 512 GB ab Ende Oktober |
| Mac Studio M5 Ultra (Basis) | 96 GB unified, 1 TB SSD | ~1.200 GB/s | 6.599 € | 30-Core CPU / 64-Core GPU; 256 GB = +4.400 € |
| Mac Studio M5 Max (Basis) | 36 GB unified, 512 GB SSD | geringer | 2.999 € | Einstiegsmodell |
| RTX PRO 6000 Blackwell WS | 96 GB GDDR7 ECC | 1.792 GB/s | ab 12.999 € | Geizhals, nur die Karte (600 W) |
| AMD Ryzen AI Halo (Referenz) | 128 GB LPDDR5X-8000 + 2 TB | 256 GB/s | ~3.700 € (US) | Micro Center exklusiv, seit 06.07.2026; keine DE-Listung |
| GMKtec EVO-X2 | 128 GB + 2 TB SSD | 256 GB/s | ab 3.599 € | Geizhals, Preisstand 17.08.2026 |
| Framework Desktop 128 GB | 128 GB LPDDR5X | 256 GB/s | 3.449 € | Direktvertrieb Framework |
| Beelink GTR9 Pro | 128 GB + 2 TB, 2x 10GbE | 256 GB/s | ~4.349 $ | aktuell keine DE-Listung bei Geizhals |
| Framework Desktop 192 GB (Max+ 495) | 192 GB LPDDR5X-8533 | 273 GB/s | erwartet 4.000–5.000+ € | Q3 2026, Preis und Termin offen |
| Xiaomi AI Cube | bis 160 GB shared | O100: 1,22 TB/s | kein Preis | Prototyp; O100/D100 erst 2027 |
Alle Preise sind Momentaufnahmen. Der Speichermarkt bewegt sich derzeit wöchentlich – vor einer Bestellung immer erneut prüfen.
Was die Zahlen wirklich bedeuten
Bandbreite entscheidet über Token/Sekunde, nicht TOPS
Bei der Token-Generierung muss das Modell für jedes einzelne Token einmal komplett durch den Speicher gelesen werden. Die theoretische Obergrenze ist damit grob: Token/s ≈ Speicherbandbreite / Modellgröße in Byte
Ein 70B-Modell in Q4-Quantisierung belegt rund 40 GB. Auf Strix Halo mit 256 GB/s ergibt das theoretisch etwa 6 Token/s. Real messen Tester rund 10 bis 14 Token/s auf 70B-Modellen. Die Diskrepanz entsteht, weil Mixture-of-Experts-Modelle nicht alle Gewichte pro Token anfassen. Auf dem Mac Studio M5 Ultra mit rund 1,2 TB/s liegst du beim Vier- bis Fünffachen. Das ist der eigentliche Unterschied zwischen den drei Preisklassen, nicht die beworbene NPU-Leistung.
Prefill ist der zweite, oft unterschätzte Faktor
Beim Einlesen eines langen Kontexts zählt Rechenleistung, nicht Bandbreite. Genau hier rechtfertigt der DGX Spark seinen Aufpreis, und die RTX PRO 6000 mit 24.064 CUDA-Kernen und 1.792 GB/s spielt in einer eigenen Liga. Für RAG-Szenarien mit großen Dokumentenkontexten ist Prefill-Leistung relevanter als reine Generierungsgeschwindigkeit. Wer viele Chunks in den Kontext lädt, merkt den Unterschied bei der Zeit bis zum ersten Token deutlicher als bei der Ausgabegeschwindigkeit.
96 GB nutzbar, nicht 128 GB
Bei allen Strix-Halo-Boxen sind unter Linux etwa 96 der 128 GB als GPU-Speicher adressierbar. Der Rest bleibt dem System. Bei Apple ist die Aufteilung großzügiger. Wer die 128 GB als nutzbares Modellbudget einplant, verkalkuliert sich.
Die AMD-Halo-Familie
AMDs eigene Referenzbox heißt Ryzen AI Halo Developer Platform: Ryzen AI Max+ 395 (16 Zen-5-Kerne, 32 Threads), Radeon 8060S iGPU mit 40 Compute Units (RDNA 3.5), 128 GB LPDDR5X-8000 unified, 2 TB SSD, 10GbE, Wi-Fi 7, 120 W Systemleistung. Offiziell 3.999,99 $ – bislang Micro-Center-Exklusivware in den USA, ohne deutsche Angebote.
Praktisch kaufbar sind die OEM-Varianten mit identischem Silizium: GMKtec EVO-X2, Framework Desktop, Beelink GTR9 Pro, HP Z2 Mini G1a. Da alle denselben Chip nutzen, unterscheiden sie sich nur in Kühlung, Netzwerk, Reparierbarkeit und Support.
| Kriterium | Empfehlung |
|---|---|
| Günstigster Einstieg in 128 GB | GMKtec EVO-X2 |
| Homelab, leise Dauerlast, 2x 10GbE | Beelink GTR9 Pro |
| Reparierbarkeit und Aufrüstbarkeit | Framework Desktop |
| Business-IT mit Herstellergarantie | HP Z2 Mini G1a |
Die stärkere Ausbaustufe mit Ryzen AI Max+ 495, 192 GB RAM und 160 GB VRAM kommt im dritten Quartal 2026. Wenn du 192 GB brauchst, lohnt das Warten. Wenn 128 GB reichen, gibt es keinen Grund zu warten, denn der Max+ 395 bleibt unverändert im Programm.
Xiaomi: zwei Geschichten, die verwechselt werden
Star Core Super AI Computer: Auf Xiaomis Crowdfunding-Plattform Youpin gelistet, stammt aber nicht von Xiaomi, sondern vom chinesischen Hersteller Linglong. Ebenfalls Ryzen AI Max+ 395 mit 128 GB, ab 13.999 CNY – also kein eigener Chip, nur ein weiteres Strix-Halo-Gehäuse. Ein internationaler Marktstart ist nicht geplant.
Xiaomi AI Cube: Vorgestellt am 24. August 2026 auf Xiaomis Technologiekonferenz für Xring-Chips – ein Prototyp mit drei hauseigenen Chips bei 150 W Gesamtleistungsaufnahme:
| Chip | Rolle | Eckdaten |
|---|---|---|
| Xring O3 | Hauptprozessor | 10-Kern-CPU, G2-Ultra-NX-GPU mit 16 Kernen, NPU mit 200 TOPS, 3 nm |
| Xring O100 | Bandbreitenlast | 6 nm, 3D-Wafer-Level-Stacking, bis 1,22 TB/s Near-Memory-Bandbreite |
| Xring D100 | Rechenintensive KI | 3 nm, 20-Kern-CPU, 16-Kern-NPU, bis 160 GB shared memory, Modelle bis 200B |
Einordnung: O100 und D100 kommen erst 2027 auf den Markt, einen Preis oder Termin für den AI Cube gibt es nicht. Für eine Beschaffungsentscheidung in diesem Jahr also nicht relevant. Für die Marktbeobachtung schon: Wenn China eine eigene Speicherarchitektur mit 1,22 TB/s aufbaut, gerät NVIDIAs Preisgefüge mittelfristig unter Druck.
Warum Startpreis und heutiger Preis so weit auseinander liegen
Ursache ist die DRAM- und NAND-Preiskrise. Treiber ist der DRAM-Kontraktmarkt, nicht die Herstellermarge. Bei SSDs liegt das Preisniveau im August 2026 durchschnittlich 126 Prozent über dem Stand von Mitte September 2025.
| Produkt | Startpreis | Heute |
|---|---|---|
| Framework Desktop 128 GB | 1.999 $ | 3.449 $ / 3.449 € |
| GMKtec EVO-X2 128 GB | ~2.000 $ | 3.649,99 $ |
| Beelink GTR9 Pro 128 GB | ~1.999 $ | 4.349 $ |
| RTX PRO 6000 Blackwell (Liste) | 13.250 $ | 16.000 $ (+20,8 %) |
Konsequenz für die Beschaffung: Wer 128 GB unified memory braucht und den Preis tragen kann, sollte eher jetzt kaufen als auf sinkende Preise hoffen. Die Prognosen für den weiteren Verlauf 2026 zeigen nach oben.
Entscheidungshilfe
| Einsatzzweck | Empfehlung | Begründung |
|---|---|---|
| Entwicklung, Fine-Tuning-Experimente | ASUS Ascent GX10 (4.292 €) | CUDA-Kompatibilität, die weder Strix Halo noch Apple bietet |
| Inferenz-Demos beim Kunden | Framework Desktop / GMKtec EVO-X2 (ab 3.449 €) | Normaler x86-Rechner mit Windows oder Linux, keine Spezialdistribution |
| Hohe Generierungsgeschwindigkeit (>15 tok/s bei 70B) | Mac Studio M5 Ultra (ab 6.599 €) | Einzige Option mit ~1,2 TB/s, kostet dafür das Zwei- bis Dreifache |
| Maximale Prefill-Leistung, kurze Kontexte | RTX PRO 6000 (ab 12.999 €) | 1.792 GB/s, aber nur 96 GB und 600 W |
| 192 GB Speicherbedarf | Warten auf Max+ 495 (Q3 2026) | Preis erwartet 4.000–5.000+ € |
Quellen (Preisstand 26.08.2026)
- Geizhals.de: NVIDIA DGX Spark Founders Edition, ASUS Ascent, Lenovo ThinkStation PGX, Gigabyte AI TOP ATOM, RTX PRO 6000 Blackwell, GMKtec EVO-X2, AMD Ryzen AI Halo
- ComputerBase: Mac Studio mit M5 Ultra · Macwelt: Mac Studio jetzt mit M5 Max und M5 Ultra
- PCGamesHardware: Ryzen AI Halo: AMDs Mini-PC zum Maxi-Preis · Speicherpreise auf Rekordniveau
- Notebookcheck: Xiaomi Mini-PC mit 3 Prozessoren · Framework Desktop mit 192 GB
- ComputingForGeeks: Ryzen AI Max+ 395 Mini PCs Compared · MiniXPC: Xiaomi Crowdfunding Star Core
Unsere Empfehlung: Mac Mini M4 oder M5 Pro
Für die meisten Praxen und Kanzleien ist der Mac Mini Pro mit 64 GB Unified Memory die ideale Lösung:
- Preis Mac Mini M4 Pro: unter 2.800 € als einmalige Investition – wegen der Speicherpreis-Rallye 2026 vor Bestellung tagesaktuell prüfen
- Preis Mac Mini M5 Pro: Apples aktuelles Modell, Preise auf Anfrage
- Leistung: Betreibt 30B-Modelle flüssig mit etwa 30 Tokens pro Sekunde
- Unified Memory: GPU und CPU teilen sich den Speicher, ideal für große Sprachmodelle
- Stromverbrauch: 60 bis 80 Watt, deutlich geringer als ein GPU-Server
- Lautstärke: Flüsterleise, passt auf jeden Schreibtisch
Du arbeitest weiter an deinem gewohnten Arbeitsplatz
Du musst nicht am Mac Mini selbst arbeiten. Fleet Navigator routet die Inferenz über dein lokales Netzwerk auf andere Rechner. Du nutzt deinen Windows-PC, deinen Laptop oder deinen Arbeitsplatz-Mac wie gewohnt, die KI rechnet im Hintergrund auf dem Mac Mini.
Du benötigst dafür eine Fleet Navigator Enterprise Lizenz auf dem Mac Mini und eine Fleet Navigator Maat Lizenz auf jedem zusätzlichen Arbeitsplatz. So greifen mehrere Arbeitsplätze auf dieselbe lokale KI-Instanz zu, die Daten verlassen dein Büro nicht.
Das funktioniert genauso mit Linux-Rechnern und Multi-GPU-Workstations als Inferenz-Server. Die Arbeitsplätze benötigen auch hier eine Fleet Navigator Maat Lizenz und können die geroutete Inferenz an mehreren anderen Rechnern verwenden. Das gilt auch für Linux-Rechner mit Multi-GPU.
Was bedeuten 7B, 12B, 30B, 70B?
| Modellgröße | Gut für | Hardware-Bedarf |
|---|---|---|
| 3B–7B | Kurze Zusammenfassungen, Stichworte, einfache Diktate | Jeder moderne PC oder Laptop (16 GB RAM) |
| 12B | Vertragsentwürfe, Anamnese-Auswertung, Patientenbriefe | Mac Mini M4 Standard, mittlere GPU mit 12 GB VRAM |
| 30B | Anspruchsvolle Schriftsätze, medizinische Differentialdiagnose, komplexe Steuerfälle | Mac Mini M4 Pro 64 GB, Workstation mit 24 GB+ VRAM |
| 70B | Sehr lange Verträge, vergleichende Recherche | Zwei GPUs mit je 24 GB oder Mac Studio |
Die Zahl steht für die Parameter des KI-Modells – mehr Parameter = mehr Wissen, aber mehr Hardware nötig
Konfigurationen für jeden Anspruch – unsere Empfehlungen für deine Hardware
Vom Einstieg bis zur professionellen Multi-User-Lösung
Einstieg
ab ~1.500 €
Standard-PC oder Laptop
- RAM: 32 GB
- GPU: mindestens 6GB VRAM
- SSD Speicher: 50 GB frei
- OS: Windows 11, Linux oder macOS
- Geeignet für 7B- und 12B-Modelle
- Ideal für: Light Edition
⭐ Empfohlen
Empfohlen
ab ~2.800 €
Mac Mini M4/M5 Pro
- RAM: 32–64 GB
- GPU: NVIDIA RTX 3060+ (min. 12 GB VRAM)
- Alternative: Apple Mac M4+
- Speicher: 20 GB frei
- Geeignet für 12B–30B Modelle
- Ideal für: Enterprise Edition
Professionell
ab 3.449 €
Strix-Halo-Mini-PC (Ryzen AI Max+ 395)
- RAM: 128 GB Unified Memory (~96 GB für Modelle nutzbar)
- GPU: Radeon 8060S iGPU (40 Compute Units, RDNA 3.5)
- Empfehlung: Framework Desktop 3.449 € oder GMKtec EVO-X2 ab 3.599 €
- Speicher: 50 GB+ frei
- Geeignet für 30B–70B-Modelle (70B: 10–14 tok/s)
- Ideal für: Navigator Enterprise
High-End: Maximale Leistung für 70B-Modelle
Für sehr große Modelle, mehrere parallele Nutzer und maximale Geschwindigkeit
🍎 Apple Silicon
Mac Studio
ab 6.599 €
Apple Mac Studio M5 Ultra
- RAM: 96–256 GB Unified Memory
- Chip: Apple M5 Ultra, ~1,2 TB/s Speicherbandbreite
- Speicher: ab 1 TB SSD
- Geeignet für 70B-Modelle (>15 tok/s)
- Stromverbrauch: niedrig, flüsterleise
- Ideal für: Enterprise Edition
⚡ Maximale Leistung
NVIDIA DGX Spark
ab 4.292 €
GB10-Familie: ASUS Ascent GX10 ab 4.292 €, NVIDIA FE ab 5.785 €
- Speicher: 128 GB Unified Memory
- Chip: NVIDIA GB10 Grace Blackwell
- KI-Leistung: bis 1 PetaFLOP (FP4)
- Geeignet für Modelle bis 70B+
- Ökosystem: volles CUDA / NVIDIA AI
- Ideal für: Enterprise & Multi-User
Unsicher welche Hardware?
Wir beraten dich kostenlos – passend zu deiner Edition und deinen Anforderungen