Op 10 september 2026 bracht Cognition, het bedrijf achter AI-programmeeragent Devin, zijn nieuwste coding-model uit: SWE-2. Cognition noemt het zelf “ons meest geavanceerde coding-model tot nu toe” (Bron: Cognition). De cijfers die het bedrijf publiceerde onderbouwen die claim voor een deel — maar niet overal, en niet zonder kanttekeningen.
Wat SWE-2 anders maakt
SWE-2 is gebouwd op Kimi K3, een basismodel van 2,8 biljoen parameters, en daarbovenop getraind met reinforcement learning op een schaal die Cognition zelf “het multi-triljoen-parameter-regime” noemt. Concreet betekent dat: het model leert via proberen en corrigeren op grote hoeveelheden gesimuleerde programmeertaken, in plaats van alleen op vooraf gelabelde voorbeelden.
Beginner-tipReinforcement learning (RL) is een trainingsmethode waarbij een AI-model wordt beloond voor goede uitkomsten en afgestraft voor slechte — te vergelijken met een hond die traint met snoepjes. Bij coding-modellen betekent “goed” meestal: code die daadwerkelijk werkt en de juiste tests doorstaat.
Cognition zegt dat SWE-2 sneller tot een eerste echte wijziging komt (een mediaan van 18 stappen, tegen 48 bij voorganger SWE-1.7) en daarbij 58 procent minder “turns” en gemiddeld 81 procent minder kosten nodig heeft op de FrontierCode 1.1 Main-benchmark (Bron: Cognition).
De cijfers naast elkaar — en waar het misgaat
Op de benchmarks waar Cognition zichzelf mee vergelijkt, wisselen sterke en zwakke resultaten elkaar af.
| Benchmark | SWE-2 | Fable 5.1 | GPT-6 Astra |
|---|---|---|---|
| FrontierCode 1.1 Main | 50,0% | 50,9% | 53,3% |
| DeepSWE 1.1 | 73,0% | 67,4% | 74,1% |
| Terminal-Bench 2.1 | 92,8% | 91,4% | 89,9% |
| Terminal-Bench 4 | 27,3% | 55,8% | 57,9% |
De eerste drie rijen komen rechtstreeks uit Cognition’s eigen aankondiging. Op Terminal-Bench 2.1 scoort SWE-2 daar zelfs hoger dan GPT-6 Astra. Die laatste rij vertelt een ander verhaal: analist Nitish Garg van CellCog wees er de dag van de release al op dat SWE-2 op het zwaardere Terminal-Bench 4 “minder dan de helft van Fable 5.1” scoort — 27,3 procent tegen 55,8 procent (Bron: CellCog). Cognition vermeldde die vergelijking niet in de eigen blogpost.
GevorderdenTerminal-Bench test agentic taken in een echte terminal-omgeving — commando’s uitvoeren, bestanden beheren, foutmeldingen interpreteren — in plaats van alleen code schrijven in een geïsoleerde sandbox. Een groot verschil tussen versie 2.1 en 4 kan erop wijzen dat SWE-2 minder goed omgaat met complexere, meerstaps-agentworkflows dan met losse programmeeropdrachten.
De kostenclaim: 64 procent goedkoper dan wat precies?
Cognition presenteert SWE-2 als 64 procent goedkoper dan Fable 5.1 bij vergelijkbare prestaties, en ongeveer een kwart van de prijs van GPT-6 Astra (Bron: Cognition). Die claim is minder stevig dan hij klinkt. Garg wijst erop dat Cognition zelf geen prijs per miljoen tokens voor SWE-2 publiceerde: “Cognition publishes no price per million tokens for SWE-2.” De enige dollarbedragen in het blogbericht zijn de geschatte per-taak-kosten van de concurrenten, waaronder 3,28 dollar voor Fable 5.1 Medium (Bron: CellCog). Garg concludeert droog: elke SWE-2-prijs die je her en der ziet circuleren, is op 10 september “iemands schatting” geweest, geen bevestigd cijfer van Cognition zelf.
Belangrijk om te herhalen: alle benchmarkcijfers in dit artikel — behalve Terminal-Bench 4 — komen uit Cognition’s eigen blogpost. Onafhankelijke, herhaalde verificatie door externe partijen was bij het verschijnen van dit artikel nog niet gepubliceerd.
Waar je het kunt gebruiken
SWE-2 is sinds 10 september beschikbaar in Cognition’s eigen producten: Devin Desktop, de command line-versie, de webversie en Fusion (Bron: Cognition). Het is dus geen los model dat je via een externe API-aanbieder aanroept — je gebruikt het binnen Cognition’s eigen Devin-omgeving. Hoe SWE-2 zich verhoudt tot de bredere modellenmarkt, waaronder de prijs van GPT-6 Astra zelf, zetten we op een rij in ons overzicht van de grote AI-modellen en in wat GPT-6 Astra kost.
Waarom dit ertoe doet
Wat hier gebeurt is minder een doorbraak dan een patroon: elke paar maanden claimt een nieuwe coding-agent de prijs-prestatieverhouding te verbeteren zonder concessies aan kwaliteit. Cognition zet SWE-2 expliciet naast de grote generalistische modellen van concurrenten, en wint op een deel van de benchmarks — maar het gat op Terminal-Bench 4 en de onverifieerbare kostenclaim laten zien dat de eigen marketingcijfers van een AI-lab zelden het hele verhaal vertellen. Voor wie AI-programmeertools gebruikt of overweegt, is de les niet “SWE-2 is beter of slechter”, maar: kijk verder dan de benchmarktabel die het bedrijf zelf uitkiest. GPT-6 Astra zelf bracht trouwens ook een andere primeur met zich mee: het eerste model in de risicoklasse “Critical” voor cyber. En wie de redesign van een concurrerende coding-assistent wil zien: Claude Code kreeg deze maand een grote desktop-update.
