Beliebte Suchanfragen:

Fleet Navigator läuft auf Consumer Hardware – kein Rechenzentrum nötig


Marktübersicht: Hardware für lokale LLM-Inferenz

Stand: 26. August 2026 · Preisquellen: Geizhals.de, Apple Store DE, Herstellerdirektvertrieb

GerätSpeicherBandbreiteStraßenpreis DEStatus / Bezugsquelle
NVIDIA DGX Spark FE (GB10)128 GB LPDDR5X unified273 GB/sab 5.785 €Geizhals, Preisstand 26.08.2026
ASUS Ascent GX10128 GB unified273 GB/sab 4.292 €Geizhals, günstigste GB10-Variante
Lenovo ThinkStation PGX128 GB unified273 GB/sab 4.729 €Geizhals
Gigabyte AI TOP ATOM128 GB unified273 GB/sab 5.030 €Geizhals
Mac Studio M5 Ultra 256 GB256 GB unified~1.200 GB/s10.999 €Apple-Listenpreis; 512 GB ab Ende Oktober
Mac Studio M5 Ultra (Basis)96 GB unified, 1 TB SSD~1.200 GB/s6.599 €30-Core CPU / 64-Core GPU; 256 GB = +4.400 €
Mac Studio M5 Max (Basis)36 GB unified, 512 GB SSDgeringer2.999 €Einstiegsmodell
RTX PRO 6000 Blackwell WS96 GB GDDR7 ECC1.792 GB/sab 12.999 €Geizhals, nur die Karte (600 W)
AMD Ryzen AI Halo (Referenz)128 GB LPDDR5X-8000 + 2 TB256 GB/s~3.700 € (US)Micro Center exklusiv, seit 06.07.2026; keine DE-Listung
GMKtec EVO-X2128 GB + 2 TB SSD256 GB/sab 3.599 €Geizhals, Preisstand 17.08.2026
Framework Desktop 128 GB128 GB LPDDR5X256 GB/s3.449 €Direktvertrieb Framework
Beelink GTR9 Pro128 GB + 2 TB, 2x 10GbE256 GB/s~4.349 $aktuell keine DE-Listung bei Geizhals
Framework Desktop 192 GB (Max+ 495)192 GB LPDDR5X-8533273 GB/serwartet 4.000–5.000+ €Q3 2026, Preis und Termin offen
Xiaomi AI Cubebis 160 GB sharedO100: 1,22 TB/skein PreisPrototyp; O100/D100 erst 2027

Alle Preise sind Momentaufnahmen. Der Speichermarkt bewegt sich derzeit wöchentlich – vor einer Bestellung immer erneut prüfen.

Was die Zahlen wirklich bedeuten

Bandbreite entscheidet über Token/Sekunde, nicht TOPS

Bei der Token-Generierung muss das Modell für jedes einzelne Token einmal komplett durch den Speicher gelesen werden. Die theoretische Obergrenze ist damit grob: Token/s ≈ Speicherbandbreite / Modellgröße in Byte

Ein 70B-Modell in Q4-Quantisierung belegt rund 40 GB. Auf Strix Halo mit 256 GB/s ergibt das theoretisch etwa 6 Token/s. Real messen Tester rund 10 bis 14 Token/s auf 70B-Modellen. Die Diskrepanz entsteht, weil Mixture-of-Experts-Modelle nicht alle Gewichte pro Token anfassen. Auf dem Mac Studio M5 Ultra mit rund 1,2 TB/s liegst du beim Vier- bis Fünffachen. Das ist der eigentliche Unterschied zwischen den drei Preisklassen, nicht die beworbene NPU-Leistung.

Prefill ist der zweite, oft unterschätzte Faktor

Beim Einlesen eines langen Kontexts zählt Rechenleistung, nicht Bandbreite. Genau hier rechtfertigt der DGX Spark seinen Aufpreis, und die RTX PRO 6000 mit 24.064 CUDA-Kernen und 1.792 GB/s spielt in einer eigenen Liga. Für RAG-Szenarien mit großen Dokumentenkontexten ist Prefill-Leistung relevanter als reine Generierungsgeschwindigkeit. Wer viele Chunks in den Kontext lädt, merkt den Unterschied bei der Zeit bis zum ersten Token deutlicher als bei der Ausgabegeschwindigkeit.

96 GB nutzbar, nicht 128 GB

Bei allen Strix-Halo-Boxen sind unter Linux etwa 96 der 128 GB als GPU-Speicher adressierbar. Der Rest bleibt dem System. Bei Apple ist die Aufteilung großzügiger. Wer die 128 GB als nutzbares Modellbudget einplant, verkalkuliert sich.

Die AMD-Halo-Familie

AMDs eigene Referenzbox heißt Ryzen AI Halo Developer Platform: Ryzen AI Max+ 395 (16 Zen-5-Kerne, 32 Threads), Radeon 8060S iGPU mit 40 Compute Units (RDNA 3.5), 128 GB LPDDR5X-8000 unified, 2 TB SSD, 10GbE, Wi-Fi 7, 120 W Systemleistung. Offiziell 3.999,99 $ – bislang Micro-Center-Exklusivware in den USA, ohne deutsche Angebote.

Praktisch kaufbar sind die OEM-Varianten mit identischem Silizium: GMKtec EVO-X2, Framework Desktop, Beelink GTR9 Pro, HP Z2 Mini G1a. Da alle denselben Chip nutzen, unterscheiden sie sich nur in Kühlung, Netzwerk, Reparierbarkeit und Support.

KriteriumEmpfehlung
Günstigster Einstieg in 128 GBGMKtec EVO-X2
Homelab, leise Dauerlast, 2x 10GbEBeelink GTR9 Pro
Reparierbarkeit und AufrüstbarkeitFramework Desktop
Business-IT mit HerstellergarantieHP Z2 Mini G1a

Die stärkere Ausbaustufe mit Ryzen AI Max+ 495, 192 GB RAM und 160 GB VRAM kommt im dritten Quartal 2026. Wenn du 192 GB brauchst, lohnt das Warten. Wenn 128 GB reichen, gibt es keinen Grund zu warten, denn der Max+ 395 bleibt unverändert im Programm.

Xiaomi: zwei Geschichten, die verwechselt werden

Star Core Super AI Computer: Auf Xiaomis Crowdfunding-Plattform Youpin gelistet, stammt aber nicht von Xiaomi, sondern vom chinesischen Hersteller Linglong. Ebenfalls Ryzen AI Max+ 395 mit 128 GB, ab 13.999 CNY – also kein eigener Chip, nur ein weiteres Strix-Halo-Gehäuse. Ein internationaler Marktstart ist nicht geplant.

Xiaomi AI Cube: Vorgestellt am 24. August 2026 auf Xiaomis Technologiekonferenz für Xring-Chips – ein Prototyp mit drei hauseigenen Chips bei 150 W Gesamtleistungsaufnahme:

ChipRolleEckdaten
Xring O3Hauptprozessor10-Kern-CPU, G2-Ultra-NX-GPU mit 16 Kernen, NPU mit 200 TOPS, 3 nm
Xring O100Bandbreitenlast6 nm, 3D-Wafer-Level-Stacking, bis 1,22 TB/s Near-Memory-Bandbreite
Xring D100Rechenintensive KI3 nm, 20-Kern-CPU, 16-Kern-NPU, bis 160 GB shared memory, Modelle bis 200B

Einordnung: O100 und D100 kommen erst 2027 auf den Markt, einen Preis oder Termin für den AI Cube gibt es nicht. Für eine Beschaffungsentscheidung in diesem Jahr also nicht relevant. Für die Marktbeobachtung schon: Wenn China eine eigene Speicherarchitektur mit 1,22 TB/s aufbaut, gerät NVIDIAs Preisgefüge mittelfristig unter Druck.

Warum Startpreis und heutiger Preis so weit auseinander liegen

Ursache ist die DRAM- und NAND-Preiskrise. Treiber ist der DRAM-Kontraktmarkt, nicht die Herstellermarge. Bei SSDs liegt das Preisniveau im August 2026 durchschnittlich 126 Prozent über dem Stand von Mitte September 2025.

ProduktStartpreisHeute
Framework Desktop 128 GB1.999 $3.449 $ / 3.449 €
GMKtec EVO-X2 128 GB~2.000 $3.649,99 $
Beelink GTR9 Pro 128 GB~1.999 $4.349 $
RTX PRO 6000 Blackwell (Liste)13.250 $16.000 $ (+20,8 %)

Konsequenz für die Beschaffung: Wer 128 GB unified memory braucht und den Preis tragen kann, sollte eher jetzt kaufen als auf sinkende Preise hoffen. Die Prognosen für den weiteren Verlauf 2026 zeigen nach oben.

Entscheidungshilfe

EinsatzzweckEmpfehlungBegründung
Entwicklung, Fine-Tuning-ExperimenteASUS Ascent GX10 (4.292 €)CUDA-Kompatibilität, die weder Strix Halo noch Apple bietet
Inferenz-Demos beim KundenFramework Desktop / GMKtec EVO-X2 (ab 3.449 €)Normaler x86-Rechner mit Windows oder Linux, keine Spezialdistribution
Hohe Generierungsgeschwindigkeit (>15 tok/s bei 70B)Mac Studio M5 Ultra (ab 6.599 €)Einzige Option mit ~1,2 TB/s, kostet dafür das Zwei- bis Dreifache
Maximale Prefill-Leistung, kurze KontexteRTX PRO 6000 (ab 12.999 €)1.792 GB/s, aber nur 96 GB und 600 W
192 GB SpeicherbedarfWarten auf Max+ 495 (Q3 2026)Preis erwartet 4.000–5.000+ €
Quellen (Preisstand 26.08.2026)

Unsere Empfehlung: Mac Mini M4 oder M5 Pro

Für die meisten Praxen und Kanzleien ist der Mac Mini Pro mit 64 GB Unified Memory die ideale Lösung:

  • Preis Mac Mini M4 Pro: unter 2.800 € als einmalige Investition – wegen der Speicherpreis-Rallye 2026 vor Bestellung tagesaktuell prüfen
  • Preis Mac Mini M5 Pro: Apples aktuelles Modell, Preise auf Anfrage
  • Leistung: Betreibt 30B-Modelle flüssig mit etwa 30 Tokens pro Sekunde
  • Unified Memory: GPU und CPU teilen sich den Speicher, ideal für große Sprachmodelle
  • Stromverbrauch: 60 bis 80 Watt, deutlich geringer als ein GPU-Server
  • Lautstärke: Flüsterleise, passt auf jeden Schreibtisch

Du arbeitest weiter an deinem gewohnten Arbeitsplatz

Du musst nicht am Mac Mini selbst arbeiten. Fleet Navigator routet die Inferenz über dein lokales Netzwerk auf andere Rechner. Du nutzt deinen Windows-PC, deinen Laptop oder deinen Arbeitsplatz-Mac wie gewohnt, die KI rechnet im Hintergrund auf dem Mac Mini.

Du benötigst dafür eine Fleet Navigator Enterprise Lizenz auf dem Mac Mini und eine Fleet Navigator Maat Lizenz auf jedem zusätzlichen Arbeitsplatz. So greifen mehrere Arbeitsplätze auf dieselbe lokale KI-Instanz zu, die Daten verlassen dein Büro nicht.

Das funktioniert genauso mit Linux-Rechnern und Multi-GPU-Workstations als Inferenz-Server. Die Arbeitsplätze benötigen auch hier eine Fleet Navigator Maat Lizenz und können die geroutete Inferenz an mehreren anderen Rechnern verwenden. Das gilt auch für Linux-Rechner mit Multi-GPU.


Was bedeuten 7B, 12B, 30B, 70B?

ModellgrößeGut fürHardware-Bedarf
3B–7BKurze Zusammenfassungen, Stichworte, einfache DiktateJeder moderne PC oder Laptop (16 GB RAM)
12BVertragsentwürfe, Anamnese-Auswertung, PatientenbriefeMac Mini M4 Standard, mittlere GPU mit 12 GB VRAM
30BAnspruchsvolle Schriftsätze, medizinische Differentialdiagnose, komplexe SteuerfälleMac Mini M4 Pro 64 GB, Workstation mit 24 GB+ VRAM
70BSehr lange Verträge, vergleichende RechercheZwei GPUs mit je 24 GB oder Mac Studio

Die Zahl steht für die Parameter des KI-Modells – mehr Parameter = mehr Wissen, aber mehr Hardware nötig


Konfigurationen für jeden Anspruch – unsere Empfehlungen für deine Hardware

Vom Einstieg bis zur professionellen Multi-User-Lösung

Einstieg

ab ~1.500 €

Standard-PC oder Laptop

  • RAM: 32 GB
  • GPU: mindestens 6GB VRAM
  • SSD Speicher: 50 GB frei
  • OS: Windows 11, Linux oder macOS
  • Geeignet für 7B- und 12B-Modelle
  • Ideal für: Light Edition

Professionell

ab 3.449 €

Strix-Halo-Mini-PC (Ryzen AI Max+ 395)

  • RAM: 128 GB Unified Memory (~96 GB für Modelle nutzbar)
  • GPU: Radeon 8060S iGPU (40 Compute Units, RDNA 3.5)
  • Empfehlung: Framework Desktop 3.449 € oder GMKtec EVO-X2 ab 3.599 €
  • Speicher: 50 GB+ frei
  • Geeignet für 30B–70B-Modelle (70B: 10–14 tok/s)
  • Ideal für: Navigator Enterprise

High-End: Maximale Leistung für 70B-Modelle

Für sehr große Modelle, mehrere parallele Nutzer und maximale Geschwindigkeit

🍎 Apple Silicon

Mac Studio

ab 6.599 €

Apple Mac Studio M5 Ultra

  • RAM: 96–256 GB Unified Memory
  • Chip: Apple M5 Ultra, ~1,2 TB/s Speicherbandbreite
  • Speicher: ab 1 TB SSD
  • Geeignet für 70B-Modelle (>15 tok/s)
  • Stromverbrauch: niedrig, flüsterleise
  • Ideal für: Enterprise Edition

Unsicher welche Hardware?

Wir beraten dich kostenlos – passend zu deiner Edition und deinen Anforderungen

Deinen Termin vereinbaren