AI Nieuws6 minGevorderd

Bonsai 27B: dit AI-model draait volledig op je telefoon — wat merk jij ervan?

PrismML perst een 27-miljard-parameter AI-model in 3,9 GB, klein genoeg voor een iPhone 17 Pro. Wat dit betekent voor je privacy en je cloud-abonnement.

Miniatuur diorama-illustratie bij artikel 'Bonsai 27B: dit AI-model draait volledig op je telefoon — wat merk jij ervan?'

Een AI-model met 27 miljard parameters had tot deze week zo’n 54 GB aan geheugen nodig — ruim meer dan de meeste laptops aankunnen, laat staan een telefoon. Het Amerikaanse PrismML perst diezelfde klasse model nu in 3,9 GB. Bonsai 27B, aangekondigd op 14 juli, draait daarmee als eerste model van dit formaat volledig op een iPhone (Bron: PrismML). Geen cloud, geen abonnement, geen internetverbinding nodig.

Wat heeft PrismML precies uitgebracht?

Bonsai 27B is geen nieuw model van de grond af, maar een extreem gecomprimeerde versie van Qwen3.6 27B, het open model van Alibaba. PrismML levert twee varianten. De ternary-versie gebruikt gewichten die alleen -1, 0 of +1 kunnen zijn en weegt 5,9 GB: bedoeld voor laptops, met de hoogste kwaliteit. De 1-bit-versie gaat nog een stap verder (alleen -1 of +1) en komt uit op 3,9 GB — klein genoeg voor het geheugenbudget van een iPhone 17 Pro (Bron: PrismML).

Het model is multimodaal (het verwerkt ook screenshots, documenten en camerabeelden), heeft een contextvenster van 262.000 tokens en staat onder de Apache 2.0-licentie gratis op Hugging Face. Wie het op een iPhone wil proberen, kan terecht bij de app Locally AI; ontwikkelaars krijgen tijdelijk een gratis preview-API.

Beginner-tip:die “parameters” zijn de interne knoppen waarmee een AI-model kennis opslaat — hoe meer, hoe capabeler doorgaans. Normaal kosten die 27 miljard knoppen elk 16 bits opslag. PrismML brengt dat terug naar ruim 1 bit per knop, vandaar de enorme krimp. Jij hoeft daar niets voor te doen: je downloadt gewoon een app en het model erbij.

Hoe kan een model van 54 GB in 3,9 GB passen?

De techniek heet extreme quantisatie. In plaats van elk gewicht op te slaan als een precies getal, rondt PrismML af naar één van twee (of drie) waarden, met per groepje gewichten een schaalfactor die de nuance terugbrengt. Dat levert 1,125 effectieve bits per gewicht op in de 1-bit-versie, tegenover 16 bits in het origineel (Bron: PrismML).

Opvallend is dat de compressie het hele taalnetwerk beslaat: embeddings, attention, MLP-lagen én de uitvoerlaag. Eerdere pogingen van andere partijen hielden vaak delen van het netwerk op hogere precisie, waardoor de winst beperkt bleef. PrismML — opgericht door onderzoekers van Caltech, met steun van onder meer Khosla Ventures, Google en Samsung — werkt al jaren aan precies dit probleem.

Gevorderden:de snelheidsclaims zijn serieus: tot 163 tokens per seconde (1-bit) op een RTX 5090 en 87 op een M5 Max, mede dankzij speculative decoding en custom low-bit kernels voor MLX en CUDA. Let wel op de telefoon-demo in de aankondiging: die draait met “cached & prefilled image context”, dus de vlotte beelden zeggen weinig over koude starts op een iPhone.

Wat merk jij hiervan?

Voor de gemiddelde gebruiker is dit vooral een privacy- en portemonnee-verhaal. Een lokaal model betekent dat je vragen, foto’s en documenten je toestel niet verlaten. Wie een AI-assistent zijn agenda, mail of medische vragen toevertrouwt, hoeft bij een on-device model niet na te denken over waar die data heen gaat: nergens heen. En als het model eenmaal op je toestel staat, kost elke vraag niets — geen maandabonnement, geen limiet op je gebruik.

Dat dit meer is dan een technisch kunstje, bleek dezelfde dag nog: PrismML-topman Babak Hassibi bevestigde tegenover CNBC dat Apple en andere bedrijven de modellen evalueren en dat er verkennende gesprekken lopen — “pril”, maar “de zaken vorderen mooi” (Bron: CNBC). Apple draait nu al delen van z’n AI lokaal op de iPhone en stuurt zwaardere verzoeken naar de cloud; technologie die grotere modellen op het toestel zelf laat draaien past precies in die strategie.

Er zit ook een offline-kant aan. Een model op je telefoon werkt in het vliegtuig, in de trein door Drenthe en tijdens een storing bij een cloudprovider. Apple, Google en Samsung bouwen om die reden al langer aan kleinere on-device-modellen — een beweging die we eerder beschreven in AI in je browser, zonder server; Bonsai 27B laat zien dat ook de zwaardere middenklasse die kant op kan.

Realistisch blijft: de allersterkste modellen draaien in de cloud en dat blijft voorlopig zo. PrismML positioneert Bonsai zelf ook als onderdeel van een hybride opzet, waarin privacygevoelige en routinetaken lokaal draaien en alleen de moeilijkste stappen naar een frontier-model in de cloud gaan.

De kanttekening: gemiddeldes verhullen de zwakke plek

PrismML meldt dat de ternary-versie 95% van de benchmark-scores van het origineel behoudt en de 1-bit-versie 90%, gemeten over vijftien benchmarks (Bron: PrismML). Dat gemiddelde verdient een kritische blik, en die kwam er ook meteen: in de discussie op Hacker News wezen ontwikkelaars direct op de spreiding onder dat gemiddelde (Bron: Hacker News).

Rekenen en programmeren blijven vrijwel op niveau (91,7 om 95,3 voor wiskunde in de 1-bit-versie). Maar agentic tool-gebruik — precies de vaardigheid die AI-agents nodig hebben om zelfstandig taken op je toestel uit te voeren — zakt in de 1-bit-versie van 80,0 naar 66,0 punten. Voor een model dat wordt verkocht op lokale AI-agents is dat de rij die ertoe doet. Het zijn bovendien cijfers van de maker zelf, “evaluated in thinking mode”; onafhankelijke tests moeten de claims nog bevestigen.

Waar kun je het proberen?

De modelgewichten staan op Hugging Face, in MLX-varianten voor Apple-hardware en GGUF-builds. Mac-gebruikers met voldoende geheugen kunnen de ternary-versie lokaal draaien (nieuw in lokale modellen? Onze uitleg Wat is Ollama? is een goed startpunt); iPhone-bezitters kunnen de 1-bit-versie testen via de genoemde Locally AI-app. Reken op dag-1-kinderziektes: gebruikers op Hacker News melden dat de modellen in tools als LM Studio nog niet werken zonder de aangepaste software-forks van PrismML zelf (Bron: Hacker News).

De komende weken worden interessanter dan de lanceerdag: dan verschijnen de eerste onafhankelijke benchmarks en blijkt of de batterij van een iPhone 17 Pro dit soort werk volhoudt. Wij houden de resultaten bij in de dagelijkse AI Radar.

Veelgestelde vragen

Wat is Bonsai 27B precies?

Bonsai 27B is een AI-taalmodel van het Amerikaanse bedrijf PrismML, gebaseerd op het open model Qwen3.6 27B. PrismML comprimeerde het model zo ver (naar 1-bit- en ternary-gewichten) dat het in 3,9 tot 5,9 GB past. Daardoor draait het volledig op een telefoon of laptop, zonder cloud. Het model is multimodaal: het verwerkt naast tekst ook beelden, zoals screenshots en documenten.

Op welke telefoons en computers draait Bonsai 27B?

De 1-bit-versie (3,9 GB) past volgens PrismML binnen het geheugenbudget van een iPhone 17 Pro. De ternary-versie (5,9 GB) is bedoeld voor laptops. Het model draait via MLX op Apple-apparaten (Mac, iPhone, iPad) en via CUDA op NVIDIA-videokaarten. Op een MacBook met M5 Max haalt het tot 87 tokens per seconde; op een RTX 5090 tot 163.

Is Bonsai 27B gratis te gebruiken?

Ja. De modelgewichten staan op Hugging Face onder de Apache 2.0-licentie, die ook commercieel gebruik toestaat. PrismML biedt daarnaast tijdelijk een gratis developer-preview-API aan. Voor iPhone-gebruikers verwijst PrismML naar de app Locally AI om het model op het toestel te proberen.

Waarom zou je een AI-model lokaal op je telefoon willen draaien?

Twee redenen: privacy en onafhankelijkheid. Bij een lokaal model verlaten je vragen, documenten en foto's je toestel niet — er gaat niets naar een server in de VS. Daarnaast werkt het zonder internet en zonder abonnement: als het model eenmaal op je toestel staat, kost elke vraag niets extra. Voor de zwaarste taken blijven cloudmodellen als GPT-5 of Claude wel duidelijk sterker.

Hoe goed is Bonsai 27B vergeleken met het originele model?

PrismML meet zelf dat de ternary-versie 95% van de score van het originele Qwen3.6 27B behoudt en de 1-bit-versie 90%, over vijftien benchmarks. Maar de spreiding is groot: rekenen en programmeren blijven vrijwel op niveau, terwijl tool-gebruik in de 1-bit-versie van 80 naar 66 punten zakt. Het zijn bovendien cijfers van de maker zelf; onafhankelijke tests moeten nog volgen.

Bronnen

Waar deze informatie vandaan komt.