Datakwaliteit voor AI: Voorkom dat je AI-pilot Strandt op Vervuilde Data

Waarom vervuilde data AI-projecten laat mislukken en hoe je datakwaliteit pragmatisch verbetert zonder een jarenlang dataprogramma.

In de B2B-sector groeit het enthousiasme om Large Language Models (LLM's) en generatieve AI in te zetten voor automatisering, kennisdeling en klantenservice. Organisaties starten vol goede moed met een pilot om offertes te analyseren, klantdossiers samen te vatten of interne kennisbanken te bevragen. Toch haalt een schokkend hoog percentage van deze pilots de productiefase niet. De oorzaak ligt zelden aan het gekozen AI-model of de technologie. De echte boosdoener is vrijwel altijd slechte datakwaliteit.

Artificial Intelligence werkt volgens het onverbiddelijke principe van garbage in, garbage out. Zelfs het meest geavanceerde LLM produceert onbetrouwbare, verwarrende of ronduit schadelijke antwoorden wanneer de onderliggende databronnen vervuild zijn. In dit artikel behandelen we de vier grootste datakwaliteitsproblemen die AI-projecten laten stranden, leggen we uit hoe je datakwaliteit snel toetst vóór de start van een pilot, en bieden we een pragmatische aanpak om data op te schonen zonder dat je eerst een meerjarig corporate data governance-traject hoeft op te starten.

De 4 Cruciale Datakwaliteitsproblemen bij AI-implementaties

Wanneer een organisatie start met een AI-project scoping, wordt vaak aangenomen dat de aanwezige bedrijfssystemen (zoals CRM, ERP, SharePoint of ticketsystemen) 'schoon genoeg' zijn omdat medewerkers er dagelijks mee werken. Mensen zijn echter uitstekend in staat om compenserend te handelen: zij herleiden de context, negeren typfouten en weten welke mappen ze moeten vermijden. Een AI-model mist deze intuïtie en neemt alle invoerdata meedogenloos serieus.

In de praktijk zien we AI-pilots stranden op vier specifieke dataproblemen:

1. Duplicaten en Dubbele Entiteiten

Wanneer een klant, product of project in meerdere systemen of mappen onder licht afwijkende namen voorkomt (bijvoorbeeld "Acme Corp B.V.", "Acme Corp" en "Acme Nederland"), raakt een AI-model in verwarring. Bij het genereren van een klantsamenvatting pakt het model slechts een deel van de geschiedenis op, of voegt het tegenstrijdige gegevens uit verschillende dossiers samen tot één hallucerend antwoord.

2. Verouderde en Vervallen Records

Documenten in bedrijfssystemen hebben zelden een duidelijke verloopdatum. In kennisbanken en netwerkschijven zwerven versies van beleidsdocumenten uit 2018 rond naast de actuele richtlijnen van 2026. Wanneer een AI-systeem via Retrieval-Augmented Generation (RAG voor beginners) zoekt naar de juiste informatie, kan een verouderde PDF met een hogere tekstuele overeenkomst de actuele procedure verdringen. Dit leidt tot foute adviezen aan medewerkers of klanten.

3. Ontbrekende Velden en Onvolledige Attributen

Traditionele software werkt met gestructureerde databases waarin velden verplicht of optioneel zijn. In de praktijk laten medewerkers optionele velden vaak leeg, of vullen ze 'N.v.t.' of een dummywaarde in. Als je AI inzet om patronen te herkennen, workflows te automatiseren of rapportages op te stellen, leiden ontbrekende attributen tot gaten in de analyse of incorrect geclassificeerde werkstromen.

4. Stille Betekenisverschillen (Semantic Drift)

Dit is wellicht het meest verraderlijke probleem. Stille betekenisverschillen ontstaan wanneer verschillende afdelingen dezelfde term anders interpreteren, of wanneer een definitie door de jaren heen is veranderd. Binnen de afdeling Finance betekent "Omzet" wellicht gefactureerde omzet exclusief BTW, terwijl Sales rekent met gecontracteerde jaarwaarde (ARR). Als een LLM documenten van beide afdelingen combineert zonder expliciete context, ontstaan er rapportages die inhoudelijk niet kloppen.

Praktijkvoorbeeld: Een juridische dienstverlener zette een AI-assistent in om jurisprudentie en interne dossiers te doorzoeken. Omdat oude conceptversies van adviezen in dezelfde SharePoint-omgeving stonden als de definitief ondertekende documenten, citeerde de AI regelmatig ingetrokken of afgewezen argumenten. Pas na een grondige herstructurering van de brondata werd de AI-assistent betrouwbaar.

De Valkuil van het "Jarenlange Dataprogramma"

Wanneer organisaties ontdekken dat hun datakwaliteit ondermaats is, vervallen ze regelmatig in het andere uiterste. Ze stoppen de AI-ambities volledig en starten een grootschalig, organisatiebreed Data Governance Programma op. Er worden datastewards aangewezen, dure Master Data Management (MDM) software aangeschaft en maandenlang gesproken over beleidsstukken.

Hoewel gestructureerde governance op de lange termijn waardevol is, betekent het voor een AI-initiatief vaak de genadeslag. De markt beweegt te snel om twee jaar te wachten op 'perfecte data'. Bovendien is het onmogelijk om alle data in een organisatie vooraf 100% schoon te maken. De kunst is om datakwaliteit **pragmatisch en doelgericht** aan te pakken, specifiek voor de use-case die je wilt lanceren.

De Snelle Data-Audit: Toets Datakwaliteit Vóór de Pilot

Om te voorkomen dat je kostbare tijd verspilt aan een gedoemde proefopstelling, voer je tijdens de fase van een AI-pilot in 30 dagen een snelle data-audit uit op de geselecteerde bronset. Deze audit duurt idealiter maximaal 3 tot 5 werkdagen en richt zich op de specifieke dataset van de pilot.

Een doeltreffende snelle audit bestaat uit de volgende vier stappen:

  1. Afbakening van de bronset (Data Scope): Selecteer uitsluitend de data die direct noodzakelijk is voor de specifieke use-case. Hoe kleiner de initiële dataset, hoe sneller je deze kwalitatief hoogwaardig krijgt.
  2. Steekproefgewijze kwaliteitscheck: Neem een representatieve steekproef van 50 tot 100 documenten of records. Laat een domeinexpert (bijvoorbeeld een senior acceptant of klantenservicemedewerker) deze dataset beoordelen op juistheid, volledigheid en actualiteit.
  3. Representatieve testvragen opstellen: Stel een set van 20 tot 30 reële vragen of opdrachten op met door experts geverifieerde antwoorden (de zogenaamde ground truth).
  4. Nulmeting uitvoeren: Laat het AI-systeem deze vragen beantwoorden met de rauwe, onbewerkte data. Analyseer foutieve antwoorden en herleid direct welke datakwaliteitsfout (duplicaat, verouderd, ontbrekend veld of begripsverwarring) de fout veroorzaakte.

Pragmatische Data-Schoonmaak: De 80/20 Regel voor AI-Data

Zodra de kwetsbaarheden in de dataset helder zijn, start de pragmatische opschoning. Gebruik hierbij de 80/20 regel: herstel alleen de data die direct impact heeft op de nauwkeurigheid van de beoogde AI-toepassing.

Filteren aan de Poort (Pre-processing & Metadata)

Plaats niet zomaar een complete schijf of database in een RAG-index of AI-pipeline. Bouw een pre-processing filter. Zorg dat documenten zonder duidelijke datum of eigenaar automatisch worden uitgesloten van de indexatie, of voeg expliciete metadata toe zoals status="definitief" en geldig_tot="2026-12-31". Dit voorkomt dat het AI-model concepten of verlopen documenten raadpleegt.

Gestructureerde Context Toevoegen

Wanneer er sprake is van stille betekenisverschillen, kun je dit vaak oplossen zonder alle brondocumenten te herschrijven. Voeg een centraal begrippenkader (een taxonomy of system prompt glossary) toe aan het AI-systeem. Hierin definieer je expliciet wat termen betekenen binnen de context van deze specifieke toepassing.

Data-Hygiëne als onderdeel van AI Governance

Een pragmatische data-schoonmaak is geen eenmalige actie, maar een doorlopend proces. Borg afspraken over wie verantwoordelijk is voor het onderhoud van de data in je organisatie. Dit sluit naadloos aan bij je bredere AI-governance voor het MKB.

Checklist: Is jouw data klaar voor een AI-pilot?

Loop deze vragen door voordat je start met het bouwen van een AI-toepassing op je eigen organisatiebronnen:

  • Is de brondataset afgebakend tot uitsluitend de documenten/records die strikt noodzakelijk zijn?
  • Zijn conceptversies, dubbele bestanden en verouderde gearchiveerde documenten gefilterd of afgeschermd?
  • Heeft minimaal één inhoudelijk expert een steekproef van de dataset gecontroleerd op feitelijke juistheid?
  • Zijn vaktermen en bedrijfsspecifieke definities expliciet vastgelegd in een begrippenlijst?
  • Is er een duidelijke eigenaar aangewezen voor de brondata die verantwoordelijk is voor de actualiteit?
  • Is er een testset van minimaal 20 representatieve scenario's met bekende, correcte antwoorden beschikbaar?

Van Succesvolle Pilot naar Betrouwbare Productie

Datakwaliteit is geen eenmalig vinkje, maar een fundament. Door vóór de pilot te investeren in een gerichte snelle audit en een pragmatische schoonmaak van de relevante data, voorkom je dat je AI-project strandt in frustratie en onbetrouwbare resultaten. Bovendien leg je hiermee een solide basis om straks op een verantwoorde manier van pilot naar productie te schalen.

Wil je sparren over de datakwaliteit binnen jouw organisatie of hulp bij het uitvoeren van een snelle AI-data-audit? De specialisten van LLMnet Consultancy helpen je graag om jouw data AI-ready te maken.