---
title: "Mijn juridische zoekmachine scoorde 50%. Zo ging hij naar 93%"
date: 2026-08-01
author: ""
categories:
  - name: "Uncategorized"
    url: "/category/uncategorized.md"
---

# Mijn juridische zoekmachine scoorde 50%. Zo ging hij naar 93%

Mijn juridische zoekmachine scoorde 50%. Niet op gevoel, maar gemeten: van de vijftien testvragen waarvan ik vooraf wist welk arrest het juiste antwoord was, vond hij er acht niet. Een dag later stond hij op 93%. Dit is wat er tussen die twee metingen gebeurde, inclusief de twee fouten die ik onderweg in mijn eigen test vond.

## Eerst meten, dan pas sleutelen

De tool (een zoekmachine over bijna een miljoen Nederlandse rechterlijke uitspraken) voelde goed. Antwoorden zagen er overtuigend uit, de bronnen klopten. Maar “voelt goed” is geen cijfer. Dus bouwde ik een vaste testset: vijftien vragen in gewone mensentaal, elk met het standaardarrest dat een jurist zou verwachten. “Ik zag mijn kind aangereden worden en heb daar psychische schade van” hoort het Taxibus-arrest op te leveren. Duizenden juristen kennen dat rijtje; mijn zoekmachine bleek er dus meer dan de helft van te missen.

Het mooie van zo’n testset: elke wijziging daarna is geen mening meer maar een getal. Het vervelende: het getal was 50.

## De verrassing: mijn test zat er zelf naast

Bij het naspitten van de missers vond ik twee fouten in mijn eigen meetlat. Eén vraag verwachtte een “arbeidsongeval-arrest” dat bij controle het Jetblast-arrest bleek te zijn (dat gaat over een waarschuwingsbord bij een vliegveld). En mijn Didam-verwijzing wees naar een uitspraak over een overnachtingshaven. De zoekmachine werd dus deels afgerekend op antwoorden die zelf fout waren. Les: verifieer je ground truth net zo hard als je systeem.

## Wat het verschil maakte

Drie ingrepen, elk gemeten. De eerste: het taalmodel dat vragen vertaalt naar juridische termen bleek ECLI-nummers (de kentekens van uitspraken) gewoon te *verzinnen*. Vraag je om het nummer van het Deliveroo-arrest, dan krijg je iets dat er sprekend op lijkt maar niet bestaat. De naam “Deliveroo” kent het model wél feilloos. Dus vraag ik nu om namen en vertaalt een tabel die ik zelf tegen de databank heb gecontroleerd ze naar echte nummers.

De tweede: gezag. Een arrest van de Hoge Raad hoort te winnen van een willekeurige rechtbankuitspraak met toevallig gelijkende tekst, dus dat weegt nu mee in de ranking.

De derde was de doorbraak, en die is gratis: **de rechtspraak wijst zelf naar haar standaardarresten**. Een hofuitspraak over platformwerk citeert het Deliveroo-arrest letterlijk in zijn beoordeling. Dus als meerdere gevonden uitspraken hetzelfde Hoge Raad-arrest citeren, is dát vrijwel zeker het arrest dat je zoekt. Geen AI voor nodig; gewoon tellen welke nummers in de gevonden teksten staan. Van 80 naar 93% met een regex.

## Waarom ik de cijfers publiceer

Juridische AI-tools beloven allemaal betrouwbaarheid, maar vrijwel niemand meet het en niemand zet zijn cijfers online. Terwijl juristen daar (terecht) als eerste naar vragen. Ik heb de methode en de actuele scores daarom gewoon op de site gezet, inclusief wat er nog mis gaat: [zo meten wij de kwaliteit van de zoeker](https://ai-rechtshulp.nl/zo-meten-wij/). Die ene misser die overblijft (het skeelerarrest, voor de liefhebbers) staat er ook bij. Eerlijkheid is goedkoper dan een keurmerk-logo en overtuigt beter.

De volgende stap is de testset laten groeien met wat echte gebruikers vragen. Vijftien vragen is een begin, geen bewijs. Maar het verschil tussen “wij zijn betrouwbaar” en “wij scoorden vanmorgen 93% op deze vijftien vragen, kijk zelf” is precies het verschil waar ik deze tool op bouw.