Een AI-model met 27 miljard parameters had tot deze week zo’n 54 GB aan geheugen nodig — ruim meer dan de meeste laptops aankunnen, laat staan een telefoon. Het Amerikaanse PrismML perst diezelfde klasse model nu in 3,9 GB. Bonsai 27B, aangekondigd op 14 juli, draait daarmee als eerste model van dit formaat volledig op een iPhone (Bron: PrismML). Geen cloud, geen abonnement, geen internetverbinding nodig.
Wat heeft PrismML precies uitgebracht?
Bonsai 27B is geen nieuw model van de grond af, maar een extreem gecomprimeerde versie van Qwen3.6 27B, het open model van Alibaba. PrismML levert twee varianten. De ternary-versie gebruikt gewichten die alleen -1, 0 of +1 kunnen zijn en weegt 5,9 GB: bedoeld voor laptops, met de hoogste kwaliteit. De 1-bit-versie gaat nog een stap verder (alleen -1 of +1) en komt uit op 3,9 GB — klein genoeg voor het geheugenbudget van een iPhone 17 Pro (Bron: PrismML).
Het model is multimodaal (het verwerkt ook screenshots, documenten en camerabeelden), heeft een contextvenster van 262.000 tokens en staat onder de Apache 2.0-licentie gratis op Hugging Face. Wie het op een iPhone wil proberen, kan terecht bij de app Locally AI; ontwikkelaars krijgen tijdelijk een gratis preview-API.
Beginner-tip:die “parameters” zijn de interne knoppen waarmee een AI-model kennis opslaat — hoe meer, hoe capabeler doorgaans. Normaal kosten die 27 miljard knoppen elk 16 bits opslag. PrismML brengt dat terug naar ruim 1 bit per knop, vandaar de enorme krimp. Jij hoeft daar niets voor te doen: je downloadt gewoon een app en het model erbij.
Hoe kan een model van 54 GB in 3,9 GB passen?
De techniek heet extreme quantisatie. In plaats van elk gewicht op te slaan als een precies getal, rondt PrismML af naar één van twee (of drie) waarden, met per groepje gewichten een schaalfactor die de nuance terugbrengt. Dat levert 1,125 effectieve bits per gewicht op in de 1-bit-versie, tegenover 16 bits in het origineel (Bron: PrismML).
Opvallend is dat de compressie het hele taalnetwerk beslaat: embeddings, attention, MLP-lagen én de uitvoerlaag. Eerdere pogingen van andere partijen hielden vaak delen van het netwerk op hogere precisie, waardoor de winst beperkt bleef. PrismML — opgericht door onderzoekers van Caltech, met steun van onder meer Khosla Ventures, Google en Samsung — werkt al jaren aan precies dit probleem.
Gevorderden:de snelheidsclaims zijn serieus: tot 163 tokens per seconde (1-bit) op een RTX 5090 en 87 op een M5 Max, mede dankzij speculative decoding en custom low-bit kernels voor MLX en CUDA. Let wel op de telefoon-demo in de aankondiging: die draait met “cached & prefilled image context”, dus de vlotte beelden zeggen weinig over koude starts op een iPhone.
Wat merk jij hiervan?
Voor de gemiddelde gebruiker is dit vooral een privacy- en portemonnee-verhaal. Een lokaal model betekent dat je vragen, foto’s en documenten je toestel niet verlaten. Wie een AI-assistent zijn agenda, mail of medische vragen toevertrouwt, hoeft bij een on-device model niet na te denken over waar die data heen gaat: nergens heen. En als het model eenmaal op je toestel staat, kost elke vraag niets — geen maandabonnement, geen limiet op je gebruik.
Dat dit meer is dan een technisch kunstje, bleek dezelfde dag nog: PrismML-topman Babak Hassibi bevestigde tegenover CNBC dat Apple en andere bedrijven de modellen evalueren en dat er verkennende gesprekken lopen — “pril”, maar “de zaken vorderen mooi” (Bron: CNBC). Apple draait nu al delen van z’n AI lokaal op de iPhone en stuurt zwaardere verzoeken naar de cloud; technologie die grotere modellen op het toestel zelf laat draaien past precies in die strategie.
Er zit ook een offline-kant aan. Een model op je telefoon werkt in het vliegtuig, in de trein door Drenthe en tijdens een storing bij een cloudprovider. Apple, Google en Samsung bouwen om die reden al langer aan kleinere on-device-modellen — een beweging die we eerder beschreven in AI in je browser, zonder server; Bonsai 27B laat zien dat ook de zwaardere middenklasse die kant op kan.
Realistisch blijft: de allersterkste modellen draaien in de cloud en dat blijft voorlopig zo. PrismML positioneert Bonsai zelf ook als onderdeel van een hybride opzet, waarin privacygevoelige en routinetaken lokaal draaien en alleen de moeilijkste stappen naar een frontier-model in de cloud gaan.
De kanttekening: gemiddeldes verhullen de zwakke plek
PrismML meldt dat de ternary-versie 95% van de benchmark-scores van het origineel behoudt en de 1-bit-versie 90%, gemeten over vijftien benchmarks (Bron: PrismML). Dat gemiddelde verdient een kritische blik, en die kwam er ook meteen: in de discussie op Hacker News wezen ontwikkelaars direct op de spreiding onder dat gemiddelde (Bron: Hacker News).
Rekenen en programmeren blijven vrijwel op niveau (91,7 om 95,3 voor wiskunde in de 1-bit-versie). Maar agentic tool-gebruik — precies de vaardigheid die AI-agents nodig hebben om zelfstandig taken op je toestel uit te voeren — zakt in de 1-bit-versie van 80,0 naar 66,0 punten. Voor een model dat wordt verkocht op lokale AI-agents is dat de rij die ertoe doet. Het zijn bovendien cijfers van de maker zelf, “evaluated in thinking mode”; onafhankelijke tests moeten de claims nog bevestigen.
Waar kun je het proberen?
De modelgewichten staan op Hugging Face, in MLX-varianten voor Apple-hardware en GGUF-builds. Mac-gebruikers met voldoende geheugen kunnen de ternary-versie lokaal draaien (nieuw in lokale modellen? Onze uitleg Wat is Ollama? is een goed startpunt); iPhone-bezitters kunnen de 1-bit-versie testen via de genoemde Locally AI-app. Reken op dag-1-kinderziektes: gebruikers op Hacker News melden dat de modellen in tools als LM Studio nog niet werken zonder de aangepaste software-forks van PrismML zelf (Bron: Hacker News).
De komende weken worden interessanter dan de lanceerdag: dan verschijnen de eerste onafhankelijke benchmarks en blijkt of de batterij van een iPhone 17 Pro dit soort werk volhoudt. Wij houden de resultaten bij in de dagelijkse AI Radar.
