---
title: "AI-factchecker: een oordeel is nog geen bewijs"
date: 2026-10-04
author: "1704media"
featured_image: "https://1704media.nl/wp-content/uploads/2026/10/ai-factchecker-oordeel-bewijs.jpg"
categories:
  - name: "automatisering"
    url: "/category/automatisering.md"
---

# AI-factchecker: een oordeel is nog geen bewijs

*Illustratie: een oordeel kun je pas controleren als het bewijs erbij ligt.*

1704media

In de herstelversie van een artikel op mijn luchtvaartsite staan nieuwe bedragen. De oude fout is eruit. Alleen: de rekensom die ervoor in de plaats komt, klopt óók niet. Mijn AI-factchecker houdt het artikel opnieuw tegen.

Dat gebeurde tijdens een correctieronde op 29 september. Het KLM-artikel rekende voor wat een stel aan broodjes en wijn kwijt zou zijn op een retourvlucht. In de herstelversie stonden €48 en €64. Dat moesten €52 en €60 zijn.

Precies het soort fout waarvoor ik een AI-factchecker wil gebruiken. Maar hoeveel vertrouwen verdient die controleur zelf?

Ik laat AI helpen met mijn websites, tools en artikelen. Daarbij wil ik dat een tweede AI het werk beoordeelt voordat het naar buiten gaat. Dat is handig. Het wordt gevaarlijk zodra ik “goedgekeurd” ga lezen als “de feiten zijn gecontroleerd”.

Daarom liet ik mijn reviewer testen. De uitslag bleek minder eenvoudig dan een goed of slecht rapportcijfer.

## Waarom kregen tegengehouden artikelen toch geen punt?

Voor de proef van 29 september kregen twintig artikelversies een bewust aangebrachte wijziging die als fout bedoeld was. Elke versie ging twee keer langs de reviewer. Dat leverde veertig beoordelingen op.

De opgeslagen baseline-resultaten zijn voor dit artikel opnieuw geteld. Dit kwam eruit:

Oordeel van de reviewer

Aantal beoordelingen

Afgekeurd

36

Niet klaar: onvoldoende bewijs

4

Goedgekeurd

0

Totaal

40

*Eigen proef van 29 september 2026: twintig gemuteerde versies, ieder tweemaal beoordeeld. Dit zijn geen veertig onafhankelijke artikelen en geen algemene nauwkeurigheidsscore.*

Geen van deze testversies kreeg toestemming van de reviewer om door te gaan. Toch gaf de test maar 33 van de 40 punten.

Die twee uitkomsten spraken elkaar niet tegen. De puntentelling stelde een andere vraag: keurde de reviewer af én noemde hij de oorspronkelijke of gewijzigde waarde in zijn lijst met problemen?

Vier beoordelingen kregen geen punt omdat de reviewer onvoldoende bewijs had om een oordeel te geven. Drie andere kregen geen punt terwijl het artikel wel was afgekeurd. De bedoelde waarde was daar niet herkend volgens de telregel.

“Zeven punten gemist” was dus iets anders dan “zeven foute artikelen goedgekeurd”. Wie alleen de score leest, kan het systeem precies verkeerd beoordelen.

## Mijn meetlat rekende twijfel als een fout

Die telregel was mijn verantwoordelijkheid. Een reviewer die zegt “ik kan dit nog niet controleren” deed in de test automatisch iets verkeerd. Terwijl dat voor publicatie een verstandige uitkomst kan zijn.

Ook het zoeken naar een getal in het antwoord was een beperkte controle. Een reviewer kan de juiste waarde noemen zonder de hele claim te begrijpen. Of een probleem uitleggen met andere woorden en daardoor een punt missen.

De oorspronkelijke telregel werkte zo:

Antwoord van de reviewer

Punt

Afgekeurd, oorspronkelijke of gewijzigde waarde genoemd

1

Afgekeurd, die waarde niet genoemd

0

Niet klaar

0

Goedgekeurd

0

*Deze regel gold voor de gemuteerde testversies. Hij beoordeelde een tekstmatch, geen volledige feitencontrole.*

Daar komt een ongemakkelijker vraag bij: was iedere aangebrachte wijziging werkelijk een feitenfout? Een gewijzigd getal in een verzonnen voorbeeldscène is niet vanzelf een onjuiste bewering over de buitenwereld. Het label “fout” in mijn testbestand maakt dat getal nog niet fout.

Dit probleem kende ik al van mijn [juridische zoekmachine](https://1704media.nl/juridische-zoekmachine-50-naar-93/). Ook daar bleken verwachte antwoorden in de test niet allemaal te kloppen. De nieuwe proef liet zien hoe makkelijk zo’n meetfout terugkomt bij een ander systeem.

Anthropic beschrijft hetzelfde methodische risico in zijn [uitleg over agentevaluaties](https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents): automatische beoordelaars kunnen te beperkt zijn, en wat een agent beweert is iets anders dan de werkelijke uitkomst. Een betere score vraagt daarom ook een betrouwbare beoordeling.

Dat maakt deze proef bruikbaar om problemen te vinden. Het maakt hem nog geen bewijs dat mijn reviewer een bepaald percentage van alle feiten goed controleert.

## Kan een AI-factchecker een onvolledige bron herkennen?

Bij het nalopen van de uitkomsten kwamen ook claims voorbij die onjuist leken doordat de brontekst was afgekapt. Toen de volledige tekst werd nagelezen, bleken die claims wel te kloppen.

Een link naar een bron was dus niet genoeg. De controleur moest ook het relevante stuk kunnen lezen. Een bron achter een betaalmuur, een mislukte download of een te kort fragment kan een oordeel veranderen.

Een andere fout was minder technisch. In een eerder artikel stond dat betrokkenen niet op een uitnodiging hadden gereageerd. De bron zei dat ze niet op vragen van een journalist hadden gereageerd. Dat lijkt dichtbij elkaar te liggen. Het zijn verschillende gebeurtenissen.

Bij de [correctie van dat artikel](https://ai-rechtshulp.nl/openai-medicare-senaat-hoorzitting-melding/) is die bewering aangepast. Zo’n verschuiving is precies waarom ik een bronpassage naast de claim wil zien.

Bewering

Controleerbaar verschil

“Ze reageerden niet op de uitnodiging.”

De bron beschreef geen reactie op journalistieke vragen. Dat bewijst geen ontbrekend antwoord op de uitnodiging.

“De AI kon geen bevestiging vinden.”

De bron kan onbereikbaar of onvolledig zijn. Ontbrekende bevestiging maakt een claim nog niet onjuist.

Een goede controle laat zien waar de bewering ophoudt en het bewijs begint. Bij ontbrekend bewijs hoort “nog niet te beoordelen” gewoon een geldig antwoord te zijn.

## Ook de nieuwe KLM-berekening was fout

Het zou te makkelijk zijn om na deze proef te zeggen dat AI-review nergens goed voor is. In het dossier zijn vier al gepubliceerde artikelen inhoudelijk gecorrigeerd. De reviewer hielp bij het vinden van echte fouten en ving bij KLM vervolgens ook de nieuwe rekenfout.

De tweede rekenfout zag er zo uit:

In het herstelconcept

Na opnieuw rekenen

€48

€52

€64

€60

*De bedragen uit de correctieronde voor een stel dat op de heen- en terugvlucht een broodje en wijn neemt. De twee uitkomsten horen bij verschillende broodjesprijzen.*

In het [gecorrigeerde KLM-artikel](https://mijnluchtvaart.nl/klm-grand-cafe-betaalde-catering-europa/) zijn de aangepaste uitleg en bedragen terug te lezen. Dat is een nuttiger resultaat dan een model dat alleen zegt dat het zijn best heeft gedaan.

Maar de artikelen stonden al online. Mijn eerdere werkwijze had die problemen dus niet allemaal tegengehouden. De herstelronde laat zowel de waarde van een extra controle als de tekortkoming van mijn eigen publicatieproces zien.

Dit werk gebeurde met AI-agents. De hertelling en de broncontrole in dit dossier zijn geen volledige menselijke feitencontrole. Ik ga een botreview geen menselijke goedkeuring noemen. De verantwoordelijkheid voor wat op mijn sites staat, blijft bij mij.

De proef is bovendien een momentopname van 29 september. Op 2 oktober zijn mijn instructies voor inhoud en bewijs aangepast. De oude uitkomsten zeggen daardoor niet hoe iedere beoordeling onder de huidige instellingen uitvalt. Daarvoor is een nieuwe meting nodig.

## Goedkeuring zonder bronpassage vind ik te goedkoop

Mijn bezwaar tegen een tweede AI als automatische goedkeurknop is simpel: een ondernemer heeft weinig aan een geruststellend antwoord dat hij niet kan controleren.

Vraag bij een belangrijke claim om de exacte passage, de vindplaats en de uitleg waarom die passage de bewering ondersteunt. Controleer ook of de AI die bron werkelijk kon lezen. Anders stapel je beoordelingen terwijl de ontbrekende informatie ontbreekt.

- **Rekensom:** reken opnieuw, in plaats van een taalmodel te vragen of het bedrag geloofwaardig klinkt.
- **Bronclaim:** open de oorspronkelijke mededeling en vergelijk de formulering.
- **Medische of juridische inhoud:** passende vakkennis blijft nodig. De proef hierboven bewijst daar geen veiligheid.

Een verzorgd antwoord kan die controle makkelijker maken. Het kan hem ook verbergen. Dat is dezelfde grens die ik tegenkom wanneer ik [software met AI bouw](https://1704media.nl/vibe-coding-production-software-workflow/): iets overtuigends laten verschijnen en aantonen dat het werkt, vragen ander bewijs.

Wie [bedrijfsprocessen automatiseert](https://1704media.nl/bedrijfsprocessen-automatiseren/), moet daarom ook de uitzonderingen inrichten. Een artikel laten wachten omdat een bron ontbreekt, kan precies de bedoeling zijn.

## Vindt jouw controleur een fout die je bewust toevoegt?

Je hoeft mijn hele test niet na te bouwen. Pak vóór je volgende publicatie één artikel met een getal dat rechtstreeks in een bron staat. Werk met een kopie, zodat je geen onjuiste informatie op je website zet.

1. **Leg het juiste getal vast.** Bewaar de bronpassage en schrijf op wat de controleur moet herkennen.
2. **Verander dat ene getal in de kopie.** Laat de controleur de tekst met de bron erbij beoordelen. Benoemt hij de gewijzigde claim, of keurt hij af vanwege iets anders?
3. **Herhaal met de juiste tekst.** Dezelfde controle moet een juiste claim niet om dezelfde reden afkeuren.
4. **Maak de bron ontoegankelijk in de test.** Meld duidelijk dat de controleur hem niet kan raadplegen. Geeft hij dan toe dat het bewijs ontbreekt, of keurt hij de claim toch als bevestigd goed?

Bewaar de antwoorden naast elkaar. Eén geslaagde proef geeft geen algemene zekerheid. Eén duidelijke misser kan wel meteen laten zien waar je werkwijze tekortschiet.

Wie over [media en internet](https://1704media.nl/) schrijft, moet ook de fouten in zijn eigen werkwijze laten zien. Bij een volgende meetronde wil ik de publicatiestop, het herkennen van de bedoelde fout en het ontbreken van bewijs apart kunnen beoordelen. Pas dan wordt zichtbaar welke controle werkelijk beter is geworden.

Bij jouw volgende batch mag de nuttigste uitkomst één artikel zijn dat blijft liggen. Zorg dan dat erbij staat welke claim nog niet gecontroleerd is en welke bron daarvoor ontbreekt. Daar kun je iets mee.