AI Innovatie7 minGevorderd

AI scoort hoog op benchmarks, maar struikelt over bedrijfscode

Real-SWE test AI-codeeragents op echte, private bedrijfscode. Zelfs de beste lost minder dan de helft van de taken op. Wat dat zegt over benchmarkcijfers.

Miniatuur diorama-illustratie bij artikel 'AI scoort hoog op benchmarks, maar struikelt over bedrijfscode'

AI-modellen die hoog scoren op bekende programmeertests, ronden op de code van echte bedrijven nog geen helft van de taken goed af. Dat blijkt uit Real-SWE, een benchmark die Specific Labs op 10 september 2026 lanceerde. Het laat zien hoe groot het gat kan zijn tussen wat AI belooft op papier en wat het waarmaakt in de praktijk.

Beginner-tipEen benchmark is simpelweg een gestandaardiseerde test waarmee AI-modellen onderling vergeleken worden. Net als een schoolcijfer zegt het iets, maar niet alles. Zie ook de uitleg in onzebegrippenlijst.

Wat Real-SWE anders doet dan de meeste benchmarks

De meeste coderingsbenchmarks waarmee AI-labs adverteren, gebruiken taken uit publiek beschikbare code: open-sourceprojecten, bekende oefenopgaven, GitHub-issues die al jaren online staan. Dat is handig om te bouwen, maar het heeft een addertje: die code kan in de trainingsdata van een model hebben gezeten. Een model dat de oplossing al eens “gezien” heeft, scoort dan beter dan het in een écht nieuwe situatie zou doen.

Real-SWE, gebouwd door het bedrijf Specific Labs, omzeilt dat probleem bewust. De benchmark haalt zijn taken uit private, niet-openbare bedrijfscodebases: code die nooit op internet heeft gestaan en dus vrijwel zeker niet in de training van een model zat (Bron: Specific Labs). Voorbeelden zijn een app met meer dan 200.000 gebruikers en een fintechplatform. De taken zijn ook omvangrijker: de referentie-oplossing past een mediaan van 11 bestanden aan, tegenover 6 bij de benchmarks FrontierCode en DeepSWE. Dat ligt dichter bij hoe een verandering in een bestaand bedrijfssysteem er in het echt uitziet.

Specific Labs test geen losse modellen maar combinaties van model en werkomgeving (de “harness”), zoals Fable 5.1 in Claude Code en GPT-6 Astra in Codex CLI. De ranglijst draait op tien taken, met acht pogingen per taak per combinatie: 640 pogingen in totaal. Dat is een kleine steekproef, dus kleine verschillen tussen modellen zeggen weinig.

De cijfers: de beste haalt nog geen helft

De resultaten zijn een koude douche voor wie gewend is aan de indrukwekkende scores die AI-labs zelf publiceren.

Model (harness)Opgeloste taken, stand 28 sep 2026Stand 23 sep 2026 (archief)
GPT-6 Astra, OpenAI (Codex CLI)46,25%33,8%
Fable 5.1, Anthropic (Claude Code)45,0%38,8%
Gemini 3.8 Flash, Google (Gemini CLI)38,75%31,2%
GLM 5.3 (Claude Code)37,5%28,8%
Muse Spark 1.3, Meta (Muse Code)36,25%23,8%
Grok 4.6, xAI (Grok Build)32,5%32,5%
GPT-5.6 Sol, OpenAI (Codex CLI)26,25%16,2%
Kimi K3 (Kimi Code)20,0%18,8%

Geen enkele combinatie lost de helft van de taken op (Bron: Specific Labs). Bij de lancering lag de lat nog lager: toen stond Fable 5.1 bovenaan met 38,8% (archiefversie). Specific Labs heeft de ranglijst sindsdien bijgewerkt zonder op de pagina toe te lichten wat er veranderde. Veel nieuwsberichten over Real-SWE noemen daarom nog de oude cijfers.

Ook korte pogingen gaan vaak mis. Van de pogingen waarin een agent binnen 10 minuten klaar was, mislukte 57,4%; van de langere pogingen 66,2% (Bron: Specific Labs). Snel klaar zijn is dus geen teken dat het werk goed is gedaan.

Waarom het misgaat: niet domme code, maar half werk

Je zou verwachten dat een model dat faalt, gewoon foute code schrijft: een typefout, een verkeerde functie, een crash. Volgens Specific Labs is de meest voorkomende faalreden iets anders: het model implementeert niet alles wat er gevraagd werd. Andere veelvoorkomende oorzaken zijn een goed idee dat verkeerd op de rest van het systeem wordt aangesloten, en een aanname over het systeem die de agent niet controleert. Code die bestaande functionaliteit kapotmaakt, komt juist weinig voor (Bron: Specific Labs).

GevorderdenDat verschil is precies waarom “AI kan 80% van mijn code schrijven” in de praktijk weinig zegt over hoeveel tijd je bespaart. Een taak die voor 80% klopt maar een randgeval, een edge-case-check of een impliciete aanname mist, kost je vaak bijna evenveel reviewtijd als wanneer je het zelf had geschreven — soms meer, omdat je eerst moet ontdekken wát er mist.

In een bestaande, jarenlang gegroeide bedrijfscodebase zitten die impliciete aannames overal: een functienaam die iets anders doet dan de naam doet vermoeden, een uitzondering die ergens anders in het systeem wordt afgevangen, een collega die “vanzelfsprekend” ook de tests wilde bijwerken. Een publieke oefentaak is daarvan ontdaan; een echte bedrijfstaak niet.

Wat dit zegt over de kloof tussen marketing en praktijk

Dit patroon is inmiddels bekend in AI-land: onderzoek naar AI-agents die zelfstandig wetenschappelijk werk moeten doen, kwam eerder dit jaar tot een vergelijkbare conclusie — knap op het papier, ver van “af” in de praktijk (lees onze analyse van dat onderzoek). Ook incidenten waarbij AI-agents buiten hun bedoelde taak traden, lieten zien dat de vlotte demo en de onvoorspelbare praktijk twee verschillende dingen zijn (lees meer).

GevorderdenDe valkuil is niet dat labs liegen over hun cijfers — de scores kloppen doorgaans gewoon voor de test die ze afnemen. De valkuil is de vertaalslag die je zelf maakt: “88% op benchmark X” wordt in je hoofd al snel “dit model doet 88% van mijn werk goed”, terwijl X en jouw werk weinig met elkaar te maken hoeven te hebben.

Wat je hiermee kunt als gebruiker

Je hoeft geen programmeur te zijn om hier iets aan te hebben. Gebruik je AI voor iets waar je zelf de kwaliteit niet makkelijk kunt controleren — een juridische samenvatting, een financiële berekening, een stuk code dat je niet zelf leest — vraag jezelf dan af: is de test waarop dit model goed scoorde, wel te vergelijken met wat ik ermee ga doen? Bij twijfel is de veiligste vuistregel dat een AI-antwoord een eerste versie is om te controleren, niet een eindproduct om te vertrouwen — precies zoals Real-SWE laat zien dat zelfs “bijna goed” vaak net dat stukje mist dat het verschil maakt.

Specific Labs heeft de ranglijst sinds de lancering al bijgewerkt en nodigt AI-labs uit hun modellen te laten testen, dus de tabel hierboven is een momentopname, geen eindstand. Wat wél overeind blijft, is de les: een schoon testresultaat en een rommelige praktijk zijn twee verschillende werelden. De tweede is degene waarin jij AI daadwerkelijk gebruikt.

Veelgestelde vragen

Wat is Real-SWE precies?

Real-SWE is een benchmark van het Amerikaanse bedrijf Specific Labs, gelanceerd op 10 september 2026. Het test AI-codeeragents op taken uit echte, private bedrijfscodebases die Specific Labs van bedrijven in licentie nam, in plaats van op publiek beschikbare testsets. Omdat die code nooit online heeft gestaan, is het zeer onwaarschijnlijk dat een model haar uit zijn trainingsdata kent. De huidige ranglijst draait op tien taken, met acht pogingen per taak per model.

Welk AI-model scoort het beste op Real-SWE?

In de ranglijst van 28 september 2026 staat GPT-6 Astra van OpenAI (via Codex CLI) bovenaan met 46,25%, direct gevolgd door Fable 5.1 van Anthropic (via Claude Code) met 45%. Daarna volgen Gemini 3.8 Flash (38,75%), GLM 5.3 (37,5%) en Muse Spark 1.3 (36,25%). Bij de lancering op 10 september stond Fable 5.1 nog bovenaan met 38,8%; Specific Labs heeft de cijfers sindsdien bijgewerkt.

Waarom scoren AI-modellen zoveel lager op Real-SWE dan op andere benchmarks?

Deels omdat taken uit publieke benchmarks (gedeeltelijk) in de trainingsdata van een model kunnen zitten, waardoor een model een antwoord kan 'herkennen' in plaats van het probleem op te lossen. Real-SWE gebruikt taken uit private codebases die nooit online stonden. Daarnaast vragen echte bedrijfstaken kennis van bedrijfsregels en eigen codeconventies. Volgens Specific Labs laten modellen daarbij vaak een deel van de gevraagde functionaliteit weg of bouwen ze op aannames die ze niet controleren.

Betekent dit dat AI niet kan programmeren?

Nee. Het betekent dat AI beduidend minder goed is in de rommelige, contextrijke werkelijkheid van een bestaande bedrijfscodebase dan de gepolijste marketingcijfers suggereren. Voor afgebakende, kleine taken met een heldere opdracht werkt AI vaak prima; zodra een taak in een grotere, unieke codebase moet passen met veel impliciete aannames, loopt het vaker mis.

Is dit alleen een probleem voor programmeurs?

Nee. Het onderliggende patroon — dat AI schitterend scoort op de tests die bedrijven zelf publiceren maar tegenvalt zodra je 'm loslaat op je eigen, unieke situatie — geldt breder dan code. Het is een goede vuistregel voor iedereen die AI gebruikt: een indrukwekkend benchmarkcijfer zegt vooral iets over de test, niet automatisch over jouw taak.

Bronnen

Waar deze informatie vandaan komt.

  1. Real-SWE — Specific Labswithspecific.comSpecific Labs
  2. Y Combinator — Real-SWE launchycombinator.com