Verdieping6 minBeginner

Het web vergeet steeds sneller, en AI versnelt het

Een kwart van de webpagina's uit 2013-2023 is verdwenen. Nieuwssites blokkeren nu ook het archief dat ze zou bewaren. Wat dat betekent als jij iets terugzoekt.

Miniatuur diorama-illustratie bij artikel 'Het web vergeet steeds sneller, en AI versnelt het'

Je klikt op een bronlink onder een artikel uit 2019 en krijgt een 404. Je zoekt een oud persbericht terug en het staat er niet meer. Het overkomt iedereen wel eens, en het voelt als pech. Het is inmiddels eerder de regel.

Pew Research Center telde webpagina’s die tussen 2013 en 2023 online stonden en kwam erop uit dat een kwart daarvan verdwenen is. Dat verschijnsel heet link rot en bestaat al zolang het web bestaat. Wat er in 2026 bij is gekomen, is een tweede beweging die de eerste versnelt.

Het archief wordt buitengesloten

De afgelopen twee jaar hebben veel uitgevers AI-crawlers de toegang tot hun site ontzegd. Begrijpelijk: ze willen niet dat hun werk gratis in een taalmodel verdwijnt dat vervolgens hun lezers wegkaapt.

Daarna gebeurde er iets wat niemand had bedacht. AI-bedrijven kwamen alsnog bij die artikelen, via de Wayback Machine. Het archief bewaarde immers al een kopie, en dat archief blokkeerde niemand.

De reactie van uitgevers laat zich raden. Steeds meer nieuwssites houden nu ook het Internet Archive buiten de deur. De Electronic Frontier Foundation waarschuwde in maart dat dit de AI-training nauwelijks zal tegenhouden, terwijl het wél het historische register van het web uitwist. Uitgevers verdedigen zich tegen de ene partij en raken daarbij de dienst kwijt die hun eigen werk bewaarde.

Zo verdwijnt het geheugen van het web niet omdat iemand dat wil, maar als bijvangst van een conflict tussen twee andere partijen.

Er lopen meer machines dan mensen

Ondertussen verschuift wie het web eigenlijk nog bezoekt. Cloudflare, dat een groot deel van het internetverkeer ziet langskomen, meldt dat verkeer van AI-systemen dat van menselijke bezoekers inmiddels heeft ingehaald, en verwacht dat het verschil de komende jaren nog fors oploopt.

Voor een site betekent dat iets ongemakkelijks: de pagina wordt vaker opgehaald dan ooit, en tegelijk komt er minder bezoek. Wikipedia is daar het duidelijkste voorbeeld van. De encyclopedie wordt door vrijwel elke chatbot geraadpleegd, maar de lezer die vroeger op de bronvermelding klikte en soms bleef hangen of doneerde, blijft weg. Het materiaal circuleert, de infrastructuur eronder niet.

Wat je zelf kunt doen

Voor de meeste mensen is dit een probleem dat pas zichtbaar wordt op het moment dat je iets wilt nakijken. Een paar dingen helpen dan wel:

  • Bewaar wat je nodig hebt, meteen. Op web.archive.org staat onderaan Save Page Now. Plak de URL en er wordt direct een kopie gemaakt, als de site dat toelaat.
  • Link naar de archiefkopie naast het origineel. In een scriptie, offerte of raadsstuk voorkomt dat dat je bron over twee jaar niets meer bewijst.
  • Vertrouw een chatbot-antwoord niet zonder werkende bron. Verwijst het naar een pagina die niet meer bestaat, dan valt er ook niets te controleren.

Er komt geen moment waarop het web ineens leeg is. Het slijt, pagina voor pagina, en het valt pas op als je iets terug wilt zoeken dat er vorig jaar nog stond.

Veelgestelde vragen

Hoeveel van het web is echt verdwenen?

Pew Research Center onderzocht webpagina's die tussen 2013 en 2023 online stonden en vond dat ongeveer een kwart daarvan niet meer bereikbaar is. Dat gaat niet alleen om hobbysites: het gaat ook om nieuwsberichten, overheidspagina's en bronnen waar elders naar verwezen wordt. Het verschijnsel heet link rot, en het is ouder dan AI. Wat nieuw is, is de snelheid en de reden waarom pagina's nu ook bewust achter een slot verdwijnen.

Waarom blokkeren nieuwssites het Internet Archive?

Veel uitgevers hebben AI-crawlers de toegang tot hun site ontzegd, omdat ze niet willen dat hun artikelen zonder vergoeding in taalmodellen belanden. Vervolgens bleek dat sommige AI-bedrijven die blokkade omzeilden door de gearchiveerde kopie in de Wayback Machine op te halen. De reactie van uitgevers was om ook het archief buiten de deur te zetten. Het gevolg is dat het openbare geheugen van het web dunner wordt, terwijl de AI-modellen intussen gewoon getraind blijven worden.

Wat is de Wayback Machine precies?

Het is de archiefdienst van het Internet Archive, een Amerikaanse non-profit die sinds 1996 kopieën van webpagina's bewaart. Je plakt een URL in en krijgt te zien hoe die pagina er op een eerdere datum uitzag. Journalisten, onderzoekers, advocaten en gewone lezers gebruiken hem om te controleren wat er ooit ergens stond. Dat maakt hem tot de facto het collectieve geheugen van het web, zonder dat iemand hem die rol formeel heeft gegeven.

Wat merk ik hier zelf van?

Vooral als je iets wilt nakijken. Een bronlink onder een artikel uit 2019 die nergens meer heen gaat. Een oude productpagina, een verwijderd persbericht, een gemeentelijke pagina die na een website-vernieuwing is verdwenen. En indirect: als een chatbot je een antwoord geeft en de onderliggende pagina bestaat niet meer, kun je niet meer controleren of het klopt.

Kan ik zelf iets bewaren voordat het weg is?

Ja. Op web.archive.org kun je onderaan bij Save Page Now een URL invoeren; het Internet Archive maakt dan direct een kopie, mits de site dat toestaat. Voor pagina's die je zelf belangrijk vindt, is het opslaan als PDF of het bewaren van een screenshot met datum een verstandige aanvulling. Voor bronvermelding in werk of studie geldt: link naar de archiefkopie naast de originele URL.

Bronnen

Waar deze informatie vandaan komt.