AI Nieuws6 minGevorderd

Cognition SWE-2: coding-model evenaart topmodellen, maar niet overal

Cognition lanceerde coding-model SWE-2: sterk op sommige benchmarks, ver achter op andere. En de veelgeprezen 64% kostenbesparing is niet te verifiëren.

Miniatuur diorama-illustratie bij artikel 'Cognition SWE-2: coding-model evenaart topmodellen, maar niet overal'

Op 10 september 2026 bracht Cognition, het bedrijf achter AI-programmeeragent Devin, zijn nieuwste coding-model uit: SWE-2. Cognition noemt het zelf “ons meest geavanceerde coding-model tot nu toe” (Bron: Cognition). De cijfers die het bedrijf publiceerde onderbouwen die claim voor een deel — maar niet overal, en niet zonder kanttekeningen.

Wat SWE-2 anders maakt

SWE-2 is gebouwd op Kimi K3, een basismodel van 2,8 biljoen parameters, en daarbovenop getraind met reinforcement learning op een schaal die Cognition zelf “het multi-triljoen-parameter-regime” noemt. Concreet betekent dat: het model leert via proberen en corrigeren op grote hoeveelheden gesimuleerde programmeertaken, in plaats van alleen op vooraf gelabelde voorbeelden.

Beginner-tipReinforcement learning (RL) is een trainingsmethode waarbij een AI-model wordt beloond voor goede uitkomsten en afgestraft voor slechte — te vergelijken met een hond die traint met snoepjes. Bij coding-modellen betekent “goed” meestal: code die daadwerkelijk werkt en de juiste tests doorstaat.

Cognition zegt dat SWE-2 sneller tot een eerste echte wijziging komt (een mediaan van 18 stappen, tegen 48 bij voorganger SWE-1.7) en daarbij 58 procent minder “turns” en gemiddeld 81 procent minder kosten nodig heeft op de FrontierCode 1.1 Main-benchmark (Bron: Cognition).

De cijfers naast elkaar — en waar het misgaat

Op de benchmarks waar Cognition zichzelf mee vergelijkt, wisselen sterke en zwakke resultaten elkaar af.

BenchmarkSWE-2Fable 5.1GPT-6 Astra
FrontierCode 1.1 Main50,0%50,9%53,3%
DeepSWE 1.173,0%67,4%74,1%
Terminal-Bench 2.192,8%91,4%89,9%
Terminal-Bench 427,3%55,8%57,9%

De eerste drie rijen komen rechtstreeks uit Cognition’s eigen aankondiging. Op Terminal-Bench 2.1 scoort SWE-2 daar zelfs hoger dan GPT-6 Astra. Die laatste rij vertelt een ander verhaal: analist Nitish Garg van CellCog wees er de dag van de release al op dat SWE-2 op het zwaardere Terminal-Bench 4 “minder dan de helft van Fable 5.1” scoort — 27,3 procent tegen 55,8 procent (Bron: CellCog). Cognition vermeldde die vergelijking niet in de eigen blogpost.

GevorderdenTerminal-Bench test agentic taken in een echte terminal-omgeving — commando’s uitvoeren, bestanden beheren, foutmeldingen interpreteren — in plaats van alleen code schrijven in een geïsoleerde sandbox. Een groot verschil tussen versie 2.1 en 4 kan erop wijzen dat SWE-2 minder goed omgaat met complexere, meerstaps-agentworkflows dan met losse programmeeropdrachten.

De kostenclaim: 64 procent goedkoper dan wat precies?

Cognition presenteert SWE-2 als 64 procent goedkoper dan Fable 5.1 bij vergelijkbare prestaties, en ongeveer een kwart van de prijs van GPT-6 Astra (Bron: Cognition). Die claim is minder stevig dan hij klinkt. Garg wijst erop dat Cognition zelf geen prijs per miljoen tokens voor SWE-2 publiceerde: “Cognition publishes no price per million tokens for SWE-2.” De enige dollarbedragen in het blogbericht zijn de geschatte per-taak-kosten van de concurrenten, waaronder 3,28 dollar voor Fable 5.1 Medium (Bron: CellCog). Garg concludeert droog: elke SWE-2-prijs die je her en der ziet circuleren, is op 10 september “iemands schatting” geweest, geen bevestigd cijfer van Cognition zelf.

Belangrijk om te herhalen: alle benchmarkcijfers in dit artikel — behalve Terminal-Bench 4 — komen uit Cognition’s eigen blogpost. Onafhankelijke, herhaalde verificatie door externe partijen was bij het verschijnen van dit artikel nog niet gepubliceerd.

Waar je het kunt gebruiken

SWE-2 is sinds 10 september beschikbaar in Cognition’s eigen producten: Devin Desktop, de command line-versie, de webversie en Fusion (Bron: Cognition). Het is dus geen los model dat je via een externe API-aanbieder aanroept — je gebruikt het binnen Cognition’s eigen Devin-omgeving. Hoe SWE-2 zich verhoudt tot de bredere modellenmarkt, waaronder de prijs van GPT-6 Astra zelf, zetten we op een rij in ons overzicht van de grote AI-modellen en in wat GPT-6 Astra kost.

Waarom dit ertoe doet

Wat hier gebeurt is minder een doorbraak dan een patroon: elke paar maanden claimt een nieuwe coding-agent de prijs-prestatieverhouding te verbeteren zonder concessies aan kwaliteit. Cognition zet SWE-2 expliciet naast de grote generalistische modellen van concurrenten, en wint op een deel van de benchmarks — maar het gat op Terminal-Bench 4 en de onverifieerbare kostenclaim laten zien dat de eigen marketingcijfers van een AI-lab zelden het hele verhaal vertellen. Voor wie AI-programmeertools gebruikt of overweegt, is de les niet “SWE-2 is beter of slechter”, maar: kijk verder dan de benchmarktabel die het bedrijf zelf uitkiest. GPT-6 Astra zelf bracht trouwens ook een andere primeur met zich mee: het eerste model in de risicoklasse “Critical” voor cyber. En wie de redesign van een concurrerende coding-assistent wil zien: Claude Code kreeg deze maand een grote desktop-update.

Veelgestelde vragen

Wat is Cognition SWE-2 precies?

SWE-2 is het nieuwste coding-model van Cognition, het bedrijf achter AI-programmeeragent Devin. Het is gebouwd op het basismodel Kimi K3 (2,8 biljoen parameters) en getraind met reinforcement learning specifiek gericht op programmeertaken. Cognition noemt het 'ons meest geavanceerde coding-model tot nu toe'.

Is SWE-2 beter dan GPT-6 Astra of Fable 5.1?

Wisselend. Op FrontierCode 1.1 Main scoort SWE-2 net onder beide (50,0% tegen 53,3% en 50,9%), op DeepSWE 1.1 ligt het tussenin, en op Terminal-Bench 2.1 scoort het juist hoger dan GPT-6 Astra. Op het zwaardere Terminal-Bench 4 zakt SWE-2 echter naar 27,3%, ruim onder Fable 5.1's 55,8% en GPT-6 Astra's 57,9%.

Klopt de claim dat SWE-2 64% goedkoper is?

Dat is onduidelijk. Analist Nitish Garg van CellCog wees erop dat Cognition zelf geen prijs per miljoen tokens voor SWE-2 publiceerde in de aankondiging — de enige dollarbedragen in het blogbericht zijn de geschatte per-taak-kosten van de concurrenten. De 64%-besparing is dus vooralsnog niet onafhankelijk te verifiëren.

Waar kan ik SWE-2 gebruiken?

SWE-2 is sinds 10 september 2026 beschikbaar binnen Cognition's eigen Devin-producten: Devin Desktop, de command line-tool, de webversie en Fusion. Het is geen los model dat je via een externe API-aanbieder aanroept.

Wat is Kimi K3, het model waarop SWE-2 is gebouwd?

Kimi K3 is een groot basismodel van 2,8 biljoen parameters. Cognition gebruikte het als fundament en trainde er bovenop met reinforcement learning op programmeertaken, in een schaal die het bedrijf zelf 'het multi-triljoen-parameter-regime' noemt.

Bronnen

Waar deze informatie vandaan komt.