Tot voor kort had je een serverrek vol videokaarten nodig om een groot AI-taalmodel zelf te draaien, buiten de cloud van OpenAI, Google of Anthropic om. Die drempel wordt nu een stuk lager gelegd door een handvol mini-pc’s ter grootte van een broodtrommel.
Op de techbeurs IFA in Berlijn lieten fabrikanten Acemagic, GMKtec en Framework begin september 2026 apparaten zien die zijn gebouwd rond AMD’s nieuwe chip Ryzen AI Max+ PRO 495 (Bron: VideoCardz). Het opvallendste cijfer: tot 192GB gedeeld werkgeheugen, 64GB meer dan de vorige generatie (Bron: Acemagic).
Wat is er nieuw aan deze chip
De Ryzen AI Max+ PRO 495 combineert 16 Zen 5-processorkernen met een Radeon 8065S-grafische chip en een aparte NPU (neurale rekeneenheid) die volgens AMD goed is voor 131 TOPS aan AI-rekenkracht (Bron: Acemagic). Wat is een NPU eigenlijk, en waarom zit die tegenwoordig in bijna elke nieuwe laptop? Dat lag al eerder onder de loep in ons uitlegstuk over NPU’s.
Beginner-tip“Gedeeld geheugen” (unified memory) betekent dat de processor en de grafische chip dezelfde geheugenpool gebruiken, in plaats van elk hun eigen, kleinere stukje. Daardoor kan een AI-model dat normaal niet in het geheugen van een videokaart past, hier wél volledig geladen worden.
Het grote verschil met een losse videokaart: bij Nvidia’s consumentenkaarten zit je vast aan zo’n 16 tot 32GB videogeheugen. Deze mini-pc’s bieden tot zes keer zoveel, wat vooral uitmaakt zodra een model niet meer in het geheugen past en de rest van het systeem moet bijspringen — met een merkbare vertraging tot gevolg.
Drie fabrikanten, drie varianten
- Acemagic F9A: een workstation van nog geen twee liter (158,5 × 158,5 × 81,5 mm) met tot 192GB LPDDR5x-8533-geheugen. Acemagic claimt op de eigen productpagina dat het systeem lokaal modellen tot zo’n 120 miljard parameters (Q4-kwantisatie) of MoE-modellen tot 300 miljard parameters aankan, en noemt DeepSeek V4 Flash als concreet voorbeeld (Bron: Acemagic). Pre-orders openen op 10 september 2026, levering in oktober; de instapprijs op de eigen site is $5.999 (Bron: Acemagic).
- GMKtec EVO X5 Pro: eveneens tot 192GB geheugen, met een vergelijkbare claim over modellen tot 300 miljard parameters. GMKtec heeft nog geen definitieve prijs gepubliceerd; levering wordt ook hier voor oktober verwacht (Bron: Guru3D).
- Framework Desktop: de bekende modulaire mini-pc krijgt een nieuwe uitvoering met de PRO 495-chip, 192GB geheugen en 6,6% meer geheugenbandbreedte dan de vorige versie, in een behuizing van 4,5 liter (Bron: VideoCardz).
Prijzen zijn nog niet bij alle fabrikanten definitief, maar de bandbreedte die nu circuleert ligt tussen ruim $5.000 en $8.000 voor een volledig uitgeruste 192GB-versie (Bron: Guru3D). Concurrenten Minisforum en Lenovo tonen vergelijkbare systemen in ongeveer dezelfde prijsklasse, met Lenovo’s ThinkCentre X Ultra als goedkoopste instap vanaf circa €3.100, al biedt die configuratie dan nog geen 192GB (Bron: Guru3D).
Voor wie is dit relevant
GevorderdenEen model “lokaal draaien” betekent dat de berekeningen op jouw eigen hardware gebeuren, niet op een server van de aanbieder. Dat is aantrekkelijk als je gevoelige data niet wilt delen met een cloudprovider, of als je onafhankelijk wilt zijn van API-kosten per token. Het is geen wondermiddel: lokale inferentie op deze chips is doorgaans trager dan een datacenter vol gespecialiseerde AI-versnellers. Meer over hoe die afweging precies werkt, lees je inonze uitleg over AI-inferentie.
Deze machines zijn geen vervanger voor een gewone laptop en ook niet bedoeld voor de gemiddelde consument: met prijzen tussen de $5.000 en $8.000 richten fabrikanten zich op ontwikkelaars, AI-onderzoekers en bedrijven die zelf modellen willen draaien zonder cloudkosten of privacyzorgen. Het past in een bredere trend waarbij chipmakers fors inzetten op AI-hardware buiten de cloud om. AMD nam eerder dit jaar zelf ook al chipontwerper Taalas over om AI-modellen direct in silicium te bakken, een heel andere route naar hetzelfde doel: AI dichter bij de gebruiker brengen (lees ons artikel over de overname van Taalas).
GevorderdenLet bij dit soort claims op het verschil tussen “kan het model laden” en “kan het model bruikbaar snel draaien”. Een MoE-model (mixture-of-experts) van 300 miljard parameters activeert per token maar een deel van die parameters, waardoor het geheugentechnisch haalbaar is. De daadwerkelijke rekensnelheid hangt nog altijd af van geheugenbandbreedte, niet alleen van geheugengrootte.
Wat nog onduidelijk is
Geen van de drie fabrikanten heeft onafhankelijk geteste prestatiecijfers gepubliceerd; de claims over “300B-modellen” komen vooralsnog van de fabrikanten zelf, niet van externe benchmarks. Ook de uiteindelijke consumentenprijzen liggen nog niet vast voor GMKtec en Framework. Zodra de eerste onafhankelijke tests verschijnen, actualiseren we dit artikel.
