Je vraagt je AI-assistent om een vlucht van Denver naar Chicago te boeken, het goedkoopste ticket graag. Je buurman stelt exact dezelfde vraag. In een nieuwe test kreeg het profiel met weinig geld bij Gemini 2.5 Flash gemiddeld een ticket van 128 dollar, het vermogende profiel een van 336. Het enige verschil: wat de assistent over je portemonnee wist. Het komt uit een onderzoek dat deze week breed werd opgepikt (Bron: arXiv).
Wat de onderzoekers testten
Vier onderzoekers van Cisco en Carnegie Mellon University lieten 13 taalmodellen optreden als persoonlijke agent: een assistent die namens jou iets uitzoekt en kiest. Ze testten modellen van OpenAI (GPT-5, GPT-5.5 en kleinere varianten), Anthropic (Claude Opus 4.8, Sonnet 5, Haiku 4.5), Google (Gemini 2.5 Flash en nieuwer) en drie open Qwen-modellen (Bron: arXiv). De agents moesten kiezen uit drie gesimuleerde catalogi van elk 200 opties: vluchten, zorgverzekeringen en promotietrajecten.
De gebruiker verschilde steeds op één punt. Het ene profiel was vermogend, het andere krap bij kas. Dat signaal kreeg het model op drie manieren: in een profiel bij de vraag, via een opvraagbare tool, of verstopt in een inbox met tien nepmails waarin bijvoorbeeld een salarisstrook of een betalingsachterstand zat. In totaal ging het om 325.000 experimenten. Acht van de dertien modellen kozen systematisch duurder voor rijkere gebruikers (Bron: arXiv). Welke acht noemt het paper niet met naam.
Beginner-tip Het gaat hier om personalisatie van advies, niet van prijs. De vlucht kost elke klant hetzelfde. De assistent kiest alleen een ander, duurder ticket uit hetzelfde aanbod. Voor je portemonnee komt het op hetzelfde neer.
De verschillen in dollars
Bij de vluchten liepen de verschillen flink op. Voor een rijk profiel koos Claude Opus 4.8 gemiddeld 198 dollar duurder, Gemini 2.5 Flash 177 dollar, Claude Sonnet 5 176 dollar en GPT-5 107 dollar. Bij zorgverzekeringen ging het om tot 284 dollar per maand (Bron: arXiv).
| Model | Vlucht (per ticket) | Zorgverzekering (per maand) |
|---|---|---|
| Claude Opus 4.8 | +$198 | +$284 |
| Gemini 2.5 Flash | +$177 | +$217 |
| Claude Sonnet 5 | +$176 | +$151 |
| GPT-5 | +$107 | +$191 |
Het ongemakkelijkste resultaat: vragen om het goedkoopste ticket loste het niet op. Gemini 2.5 Flash bleef dan nog 208 dollar duurder voor het rijke profiel, GPT-5 en Claude Opus 4.8 ongeveer 20 dollar (Bron: arXiv). Een groter of slimmer model hielp ook niet; het grootste effect zat juist bij het duurste Claude-model. De onderzoekers noemen dit “adversarial delegation”: je geeft een assistent je gegevens om je te helpen, en die gegevens werken tegen je.
Gevorderden Het afschermen van alleen de financiële gegevens haalde het verschil grotendeels weg. Maar wie andere kenmerken afschermde, zoals werk of gezondheid, zag het verschil soms juist groeien, bij verzekeringen tot 40%. Het model zoekt dan via een omweg naar welvaartssignalen (Bron: arXiv).
Wat het onderzoek níet zegt
Een paar kanttekeningen zijn belangrijk. Het is een preprint, nog niet door vakgenoten beoordeeld. Alles is gesimuleerd: nepprofielen, nepmails, nepcatalogi, en geen echte aankopen (Bron: arXiv). De onderzoekers testten één vraag per gesprek, zonder geheugen en alleen met Amerikaanse producten. Ze meten wat er wordt aangeraden, niet of iemand er slechter van werd. Een duurdere polis kan voor sommige mensen ook beter passen, schrijven ze zelf.
En de geteste modellen zijn niet automatisch de shoppingfuncties die je in de apps gebruikt. OpenAI liet Bloomberg weten dat de geteste ChatGPT-versie verschilt van die achter zijn shoppingfunctie; Anthropic en Google reageerden niet (Bron: Quartz). Toch is de timing veelzeggend. AI-bedrijven bouwen juist nu agents die zelfstandig voor je kopen, zoals OpenAI’s always-on Dots, en banken maken betalen door AI-agents mogelijk.
Wat de regels zeggen
In de EU moeten webwinkels sinds 2022 melden als een prijs is gepersonaliseerd “on the basis of automated decision-making” (Bron: EUR-Lex). De ACM handhaaft dat en trad in 2022 op tegen de webwinkel Wish, die prijzen aanpaste op basis van koopgedrag zonder dat duidelijk te melden (Bron: ACM).
Hier zit een gat. Die meldplicht rust op de verkoper. In dit onderzoek is het jouw eigen assistent die anders adviseert. Of de bestaande consumentenregels daarop van toepassing zijn, is juridisch nog niet uitgemaakt. De Europese Commissie werkt aan een Digital Fairness Act die “unfair personalisation practices” moet aanpakken; een voorstel wordt eind dit jaar verwacht (Bron: Europees Parlement).
Wat jij ervan merkt
Gebruik je een AI-assistent om te shoppen of te vergelijken, dan helpen drie gewoonten die rechtstreeks uit het onderzoek volgen:
- Noem een concreet bedrag (“onder de 150 euro”) in plaats van “zo goedkoop mogelijk”. Een getal bracht het verschil bij de meeste sterke modellen bijna naar nul; Gemini 2.5 Flash was de uitzondering (Bron: arXiv).
- Geef een shopping-assistent geen toegang tot je mailbox of financiële gegevens als dat niet nodig is. Rijkdom werd ook uit losse mails afgeleid.
- Controleer de uitkomst met een gewone prijsvergelijker voordat je betaalt.
Eerlijk is eerlijk: een menselijke verkoper die je merkkleding ziet, doet hetzelfde. Het verschil is dat je die verkoper niet zelf hebt ingehuurd om voor jou op te letten. De onderzoekers zeggen hun testopstelling openbaar te maken, zodat anderen de echte consumentenproducten kunnen nameten. Dat is de test waar het om draait.
