Verdieping6 minBeginner

Redeneermodellen uitgelegd: waarom AI eerst 'nadenkt'

Sommige AI-antwoorden laten even op zich wachten omdat het model eerst een kladversie maakt. Wat een redeneermodel is, wanneer het helpt en wat het kost.

Miniatuur diorama-illustratie bij artikel 'Redeneermodellen uitgelegd: waarom AI eerst 'nadenkt''

Als een AI-antwoord even op zich laat wachten, is het model vaak aan het “nadenken”: het schrijft eerst een kladversie met tussenstappen en geeft pas daarna het eigenlijke antwoord. Zo’n model heet een redeneermodel. Het is trager en duurder, maar bij rekensommen, puzzels en programmeerwerk maakt het duidelijk minder fouten.

Je komt het tegen onder namen als thinking, denkmodus of extended thinking. Dit stuk legt uit wat er gebeurt in die paar seconden, wanneer je er iets aan hebt, en waarom je de zichtbare denkstappen niet te letterlijk moet nemen.

Beginner-tipStel je een examen voor. Een gewoon taalmodel schrijft meteen het antwoord op. Een redeneermodel mag eerst kladpapier gebruiken: tussenstappen uitrekenen, iets doorstrepen, opnieuw beginnen. Het cijfer hangt alleen af van wat op het nette blad staat. Hoe een taalmodel überhaupt tekst maakt, lees je inHoe werkt AI?

Waarom een gewoon taalmodel struikelt

Een taalmodel voorspelt steeds het volgende stukje tekst. Dat werkt verrassend goed voor schrijven, samenvatten en uitleggen. Maar bij een vraag met vijf stappen legt het model zich al bij het eerste woord vast op een richting. Gaat stap twee mis, dan bouwt de rest daarop voort, en het model kijkt niet terug.

Mensen doen dat anders. Bij een lastige som schrijf je tussenstappen op, controleer je ze en begin je opnieuw als het niet klopt. Redeneermodellen zijn getraind om precies dat te doen, in tekst.

Wat er gebeurt als een model “nadenkt”

Het kernidee heet in het jargon test-time compute of inference-time compute: rekenkracht op het moment dat je de vraag stelt, in plaats van alleen tijdens de training. Onderzoekers van Google DeepMind en UC Berkeley lieten in augustus 2024 zien dat extra rekentijd per vraag in sommige gevallen meer oplevert dan een groter model (Bron: arXiv).

OpenAI bracht het idee op 12 september 2024 naar het grote publiek met o1. Het bedrijf schreef dat de prestaties van o1 stegen naarmate het model meer werd getraind én naarmate het langer mocht nadenken (Bron: OpenAI). De ruwe denkstappen hield OpenAI verborgen; gebruikers zagen een samenvatting.

Daarna ging het snel. Het Chinese DeepSeek bracht op 20 januari 2025 R1 uit, een open model onder een MIT-licentie dat zijn denkstappen wél volledig toonde en volgens DeepSeek op het niveau van o1 presteerde (Bron: DeepSeek). Anthropic volgde in februari 2025 met Claude 3.7 Sonnet, waarin je zelf kon kiezen tussen een gewoon antwoord en extended thinking (Bron: Anthropic).

Gevorderden“Langer nadenken” kan op meer manieren. Het model kan één lange keten van tussenstappen schrijven (chain-of-thought), meerdere oplossingen naast elkaar proberen en de beste kiezen (best-of-N), of een tweede model de tussenstappen laten beoordelen. Het gemeenschappelijke: je ruilt rekentijd per vraag in voor betrouwbaarheid.

Van schakelaar naar automatisch

De eerste redeneermodellen waren aparte modellen die je bewust koos. Dat verandert. Bij de lancering van GPT-5 op 7 augustus 2025 beschreef OpenAI een systeem met een snel model, een denkmodel en een router die per vraag kiest welke van de twee antwoordt (Bron: OpenAI). Anthropic noemt zijn variant adaptive thinking: het model beslist per vraag of en hoe lang het nadenkt, en een simpele feitvraag krijgt soms helemaal geen denkstap (Bron: Claude Docs).

Voor jou betekent dat: je hoeft minder vaak zelf een knop om te zetten. Wel houd je invloed. In de meeste apps kun je de denkmodus alsnog forceren, en via de API stel je in hoeveel moeite het model mag doen.

GevorderdenDie instelling heet bij beide grote aanbiederseffort. Anthropic kent de niveaus low, medium, high, xhigh en max; Claude Opus 5.5 staat standaard op medium, waarbij het model een eenvoudige vraag zonder denkstap mag beantwoorden (Bron: Claude Docs). OpenAI’s GPT-6.1 Sol, uitgebracht op 29 september 2026, kent dezelfde vijf niveaus, ook met medium als standaard (Bron: OpenAI). Hoger zetten helpt bij moeilijke taken, maar de denkstappen tellen mee als betaalde tokens en het antwoord laat langer op zich wachten. Wat het nieuwe OpenAI-model verder verandert, lees je inGPT-6.1 Sol: bijna Astra-niveau voor een vijfde van de prijs.

Wanneer loont het?

Nadenken kost tijd, en rekentijd kost geld en stroom. Een antwoord met denkstappen kan vele malen meer tekst genereren dan het antwoord dat je te zien krijgt. Wat dat rekenwerk per vraag vraagt aan chips en stroom, staat in Wat gebeurt er als je ChatGPT iets vraagt? Of dat de moeite waard is, hangt af van de vraag.

Loont vaakLoont zelden
Wiskunde en natuurkundeEen mail herschrijven of inkorten
Een programmeerfout opsporenEen tekst samenvatten of vertalen
Logische puzzels en planningen met veel voorwaardenEen snelle feitvraag
Vragen met één controleerbaar juist antwoordBrainstormen en creatief schrijven

Hoe je een vraag zo stelt dat elk model er beter mee omgaat, staat in Prompts schrijven voor AI.

Kun je de denkstappen vertrouwen?

Het is verleidelijk om de denkstappen te lezen als een eerlijk verslag. Dat zijn ze niet altijd. Anthropic testte dat in april 2025 door modellen stiekem een hint over het juiste antwoord te geven. Claude 3.7 Sonnet noemde die hint gemiddeld in 25% van de gevallen in zijn denkstappen, DeepSeek R1 in 39% (Bron: Anthropic). In de meeste gevallen gebruikten de modellen de hint dus zonder het te zeggen.

Daar komt bij dat meer nadenken geen garantie is tegen verzinsels. Een redeneermodel kan in zijn tussenstappen net zo stellig iets aannemen dat niet klopt; zie Waarom AI zo zelfverzekerd onzin vertelt. Hoe spectaculair redeneermodellen inmiddels presteren, en waarom vakmensen toch om controle vragen, zag je bij OpenAI’s claim over Navier-Stokes.

Stand van zaken, bijgewerkt 1 oktober 2026

De uitleg hierboven geldt ongeacht welk model er draait. Modelnamen en instellingen veranderen snel; die houden we hier bij.

OnderwerpStand
Claude (Anthropic)Adaptive thinking: het model kiest per vraag of en hoe lang het nadenkt. Claude Opus 5.5 (september 2026) staat standaard op effort medium
ChatGPT (OpenAI)GPT-5 (augustus 2025) introduceerde een router die kiest tussen snel antwoorden en nadenken. Nieuwste model: GPT-6.1 Sol (29 september 2026), in ChatGPT Work, Codex en de API, met effort van low tot max
Open modellenDeepSeek-R1 (januari 2025, MIT-licentie) maakte zichtbare denkstappen gangbaar bij open modellen
Eerste breed beschikbare redeneermodelOpenAI o1, 12 september 2024

Veelgestelde vragen

Wat is een redeneermodel?

Een taalmodel dat, voordat het antwoordt, eerst een reeks tussenstappen uitschrijft, een soort kladpapier. Daarin probeert het de vraag op te knippen, rekent het tussenstappen uit en controleert het zichzelf. Pas daarna volgt het eigenlijke antwoord. In apps heet dat bijvoorbeeld denkmodus, thinking of extended thinking.

Waarom duurt een AI-antwoord soms zo lang?

Vaak omdat het model in een denkmodus werkt. Het genereert dan eerst honderden of duizenden woorden aan tussenstappen die je niet of alleen samengevat ziet. Dat kost rekentijd. Bij een eenvoudige vraag is dat verspilling; bij een lastige rekensom of een programmeerfout levert het vaak een beter antwoord op.

Moet ik de denkmodus altijd aanzetten?

Nee. Gebruik hem voor vragen met meerdere stappen en één juist antwoord: wiskunde, logica, code, een lastige planning. Voor samenvatten, herschrijven, vertalen of een snelle feitvraag is de gewone modus sneller en meestal net zo goed. Veel apps kiezen inmiddels zelf of het model moet nadenken.

Kan ik de denkstappen van een AI vertrouwen?

Niet blind. De tussenstappen helpen om te zien hoe het model ongeveer redeneerde, maar het is geen betrouwbaar verslag van wat er binnenin gebeurde. Onderzoek van Anthropic uit april 2025 liet zien dat modellen een hint die ze gebruikten vaak niet noemden. Controleer dus het eindantwoord, niet alleen of de redenering er logisch uitziet.

Wat betekent test-time compute?

Het is de rekenkracht die een model gebruikt op het moment dat het jouw vraag beantwoordt, in tegenstelling tot de rekenkracht tijdens de training. Het idee achter redeneermodellen: in plaats van alleen een groter model te trainen, laat je een model per vraag langer rekenen. OpenAI schreef bij o1 dat de prestaties stegen naarmate het model langer mocht nadenken.

Bronnen

Waar deze informatie vandaan komt.

  1. DeepSeek — DeepSeek-R1 Release (20 januari 2025)api-docs.deepseek.com