Skip to content
Stratalytic

DATA DRIVEN DECISIONS

Data Strategie

Slechte data kost geld: datakwaliteit verbeteren in 5 stappen

Gepubliceerd:

Dashboard met datavisualisaties die de impact van datakwaliteit op bedrijfsresultaten tonen

Kernpunten: Slechte datakwaliteit kost grote organisaties gemiddeld $12,9 miljoen per jaar volgens Gartner. Voor het MKB gaat het om duizenden tot tientallen duizenden euro's aan verspilde tijd, gemiste kansen en verkeerde beslissingen. Dit artikel beschrijft vijf concrete stappen om de datakwaliteit structureel te verbeteren, inclusief tooling en subsidiemogelijkheden via de WBSO.

De verborgen kosten van slechte data

Datakwaliteit is een van die onderwerpen waar elke ondernemer het belang van erkent, maar waar in de praktijk weinig structureel aan wordt gedaan. De cijfers zijn ontnuchterend. Gartner schat dat slechte datakwaliteit organisaties gemiddeld $12,9 miljoen per jaar kost. IBM plaatst de totale kosten van slechte data in de Verenigde Staten op $3,1 biljoen per jaar. Voor het gemiddelde Nederlandse MKB-bedrijf zijn die bedragen minder astronomisch, maar niet minder pijnlijk.

Stel dat een handelsonderneming met 30 medewerkers en een omzet van 5 miljoen euro te maken heeft met duplicaten in het klantbestand, verouderde contactgegevens en inconsistente productcodes. Het effect is direct meetbaar. Accountmanagers bellen klanten die al bediend zijn door een collega. Facturen gaan naar verkeerde adressen. Voorraadtellingen kloppen niet omdat hetzelfde product onder drie verschillende codes staat geregistreerd. Het Harvard Business Review berekende dat kenniswerkers tot 50% van hun tijd besteden aan het opsporen en corrigeren van datafouten, of aan het bevestigen van data waarvan ze vermoeden dat die niet klopt.

De indirecte kosten zijn minstens zo groot. Managementbeslissingen op basis van onbetrouwbare data leiden tot verkeerde investeringen, marketingcampagnes slaan de plank mis omdat de klantsegmentatie niet klopt, en verouderde klantgegevens leveren compliancerisico's op. Volgens MIT Sloan vertrouwt slechts 16% van de managers de data die ze ontvangen voor hun besluitvorming. Dat wantrouwen is niet irrationeel. Het is een logisch gevolg van jarenlang datamanagement op de automatische piloot.

Vijf veelvoorkomende datakwaliteitsproblemen

De meeste dataproblemen in het MKB zijn niet exotisch. Ze zijn voorspelbaar, herkenbaar en daardoor ook oplosbaar. Het eerste en meest voorkomende probleem is duplicatie. Dezelfde klant staat drie keer in het CRM, telkens met een iets andere schrijfwijze. "Van der Berg", "V.d. Berg" en "Vandenberg" zijn voor een computer drie verschillende entiteiten. Onderzoek van Experian laat zien dat 94% van de bedrijven vermoedt dat hun klantdata duplicaten bevat. Bij de meeste bedrijven gaat het om 10-30% van alle records.

Het tweede probleem is ontbrekende waarden. Velden die leeg zijn omdat ze niet verplicht waren bij invoer, of omdat de informatie simpelweg niet beschikbaar was op het moment van registratie. Een klantenbestand zonder e-mailadressen bij 40% van de records is waardeloos voor e-mailmarketing, maar dat wordt pas zichtbaar wanneer de campagne wordt opgezet. Het ontbreken van geboortedata maakt leeftijdssegmentatie onmogelijk. Lege velden voor branche of bedrijfsgrootte ondermijnen elke poging tot B2B-doelgroepanalyse.

Het derde probleem is inconsistente formattering. Datums die soms als "07-04-2026", soms als "2026/04/07" en soms als "7 april 2026" worden opgeslagen. Telefoonnummers met en zonder landcode. Bedragen met en zonder BTW. Adressen met en zonder huisnummertoevoeging. Deze inconsistenties maken het onmogelijk om betrouwbaar te filteren, sorteren of koppelen. Volgens een onderzoek van Informatica besteden data-teams gemiddeld 40% van hun tijd aan het standaardiseren van formaten in plaats van aan analyse.

Het vierde probleem zijn verouderde gegevens. Medewerkers die niet meer in dienst zijn maar nog wel in het systeem staan. Leveranciers die al jaren niet meer actief zijn. Klanten die verhuisd zijn maar waarvan het adres nooit is bijgewerkt. Data veroudert sneller dan de meeste bedrijven beseffen: volgens Dun & Bradstreet veroudert jaarlijks ongeveer 30% van de B2B-contactgegevens.

Het vijfde probleem is het ontbreken van een single source of truth. Dezelfde informatie wordt bijgehouden in het CRM, in Excel-bestanden, in de boekhoudsoftware en in de hoofden van medewerkers. Niemand weet welke bron de juiste is. Bij 60% van de MKB-bedrijven is er geen eenduidig vastgesteld bronsysteem per datadomein. Het resultaat is dat elke afdeling werkt met een eigen versie van de waarheid.

Stap 1: audit de data

De eerste stap naar betere datakwaliteit is weten waar de organisatie staat. Een data-audit is geen maandenlang project. Het is een gestructureerde inventarisatie die in één tot twee weken rond is. Begin met het identificeren van de vijf belangrijkste databronnen. Voor de meeste MKB-bedrijven zijn dat het CRM-systeem, de boekhoudsoftware, het e-mailmarketingplatform, het ERP-systeem en eventuele Excel-bestanden die als schaduwdatabases fungeren.

Meet per bron vier kernindicatoren. Volledigheid: welk percentage van de verplichte velden is ingevuld? Uniciteit: hoeveel procent van de records is uniek versus duplicaat? Consistentie: volgen de waarden een vast formaat? Actualiteit: wanneer zijn de records voor het laatst bijgewerkt? Een pragmatische aanpak is per bron een steekproef van 200-500 records nemen en handmatig beoordelen. Dat geeft binnen enkele dagen een betrouwbaar beeld van de huidige staat.

Documenteer de bevindingen in een simpele scoretabel. Per databron, per kwaliteitsdimensie, een score van 1 tot 5. Dit wordt de nulmeting en het referentiepunt voor alle verbeteringen die volgen. Volgens datamanagementconsultants ontdekken bedrijven die zo'n nulmeting doen gemiddeld 3 tot 5 keer meer problemen dan ze vooraf verwachtten.

Stap 2: definieer kwaliteitsregels

Na de audit is duidelijk waar de problemen zitten. De volgende stap is het vastleggen van expliciete regels waaraan de data moet voldoen. Dit klinkt bureaucratisch, maar het hoeft niet meer te zijn dan een gedeeld document van twee tot drie pagina's. Definieer per dataveld het verwachte formaat, de toegestane waarden en of het veld verplicht is.

Een voorbeeld: voor het veld "telefoonnummer" geldt dat het formaat +31-6-XXXXXXXX is, dat het veld verplicht is voor alle actieve klanten en dat nummers zonder landcode automatisch worden aangevuld met +31. Voor het veld "klantstatus" geldt dat de toegestane waarden "actief", "inactief" en "prospect" zijn, dat vrije tekst niet is toegestaan en dat elke klant precies één status heeft. Deze regels hoeven niet perfect te zijn bij de eerste opzet. Het belangrijkste is dat ze bestaan en dat het hele team ze kent.

Betrek bij het opstellen van deze regels de mensen die dagelijks met de data werken. De salesmedewerker weet welke klantvelden essentieel zijn. De boekhouder weet welke financiële formaten problemen opleveren. De marketeer weet welke segmentatievelden nodig zijn voor effectieve campagnes. Die kennis bundelen in een gedeelde set kwaliteitsregels schept draagvlak en voorkomt dat de regels alleen op papier bestaan. Bedrijven met gedocumenteerde datakwaliteitsregels zien volgens DAMA International 40-60% minder nieuwe datafouten binnen het eerste jaar.

Stap 3: maak de invoer schoon bij de bron

De meest kosteneffectieve manier om datakwaliteit te verbeteren is het voorkomen van fouten op het moment van invoer. Elke fout die niet in het systeem terechtkomt, hoeft later niet te worden opgespoord en gecorrigeerd. De verhouding is scheef: volgens de 1-10-100-regel van David Loshin kost een datafout 1 euro om te voorkomen, 10 euro om te corrigeren en 100 euro aan schade als de fout ongemerkt doorwerkt.

Herzie daarvoor de invoerformulieren en -processen. Maak velden verplicht die volgens de kwaliteitsregels ingevuld moeten zijn. Gebruik dropdowns en keuzelijsten in plaats van vrije tekstvelden waar dat mogelijk is. Implementeer real-time validatie die invoerfouten direct signaleert. Een postcodeveld dat automatisch controleert of de ingevoerde combinatie van postcode en huisnummer bestaat. Een e-mailveld dat syntaxcontrole uitvoert. Een BTW-nummerveld dat via de VIES-database controleert of het nummer geldig is.

Leg medewerkers uit waarom schone data-invoer telt. Dit hoeft geen dagenlange training te zijn. Een sessie van een uur over de concrete gevolgen van slordig invoeren heeft meer effect dan welk beleidsdocument dan ook. Laat zien hoeveel tijd het team kwijt is aan het corrigeren van fouten. Laat zien welke klanten verloren zijn gegaan door een verkeerd telefoonnummer. Maak het tastbaar en persoonlijk.

Stap 4: automatiseer validatie

Handmatige controle is niet schaalbaar. Zodra de kwaliteitsregels zijn gedefinieerd en de invoerprocessen zijn verbeterd, is de volgende stap het automatiseren van de validatie. Elke keer dat data binnenkomt of verandert, controleert het systeem dan automatisch of die aan de vastgestelde regels voldoet.

Voor bedrijven die werken met een modern dataplatform biedt tooling als dbt (data build tool) ingebouwde testfunctionaliteit. Eenvoudige tests controleren bij elke datatransformatie of velden niet leeg zijn, of waarden binnen het verwachte bereik vallen en of referenties naar andere tabellen kloppen. Een dbt-test die controleert of elke order een geldig klant-ID heeft, is vier regels code. Een test die controleert of omzetcijfers niet negatief zijn, is drie regels. De investering in het opzetten van deze tests is minimaal vergeleken met de uren handmatige controle die ze uitsparen.

Voor meer geavanceerde validatie is Great Expectations een veelgebruikte open-source tool. Daarin staan "verwachtingen" over de data: de kolom "leeftijd" bevat waarden tussen 18 en 120, de kolom "e-mail" bevat altijd een @-teken, het totaal aantal records wijkt niet meer dan 10% af van gisteren. Great Expectations genereert automatisch documentatie van de datakwaliteitsregels en rapporteert overtredingen. Bedrijven die geautomatiseerde datavalidatie implementeren, melden gemiddeld 60-80% minder datafouten die de productieomgeving bereiken.

Een eenvoudiger alternatief voor bedrijven die nog niet werken met een dataplatform is het opzetten van geautomatiseerde checks in Google Sheets of Excel via scripts of add-ons. Zelfs een wekelijks geautomatiseerd rapport dat controleert op duplicaten, lege velden en afwijkende waarden is een grote stap vooruit ten opzichte van geen controle.

Stap 5: monitor continu

Datakwaliteit is geen eenmalig project maar een doorlopend proces. Data degradeert voortdurend: medewerkers vertrekken, klanten verhuizen, systemen worden geïntegreerd, nieuwe bronnen komen erbij. Zonder continue monitoring glijdt alles onvermijdelijk terug naar de situatie van voor de verbeteracties.

Stel een maandelijks datakwaliteitsrapport op dat de vier kernindicatoren uit de audit bijhoudt: volledigheid, uniciteit, consistentie en actualiteit. Definieer drempelwaarden waarbinnen de scores moeten blijven en escaleer wanneer een score onder de drempel zakt. Een pragmatische doelstelling voor de meeste MKB-bedrijven is een datakwaliteitsscore van minimaal 85% op alle vier de dimensies. Dat klinkt als een hoge lat, maar het is haalbaar met de voorgaande vier stappen als fundament.

Wijs een data-eigenaar aan per domein. Dit hoeft geen fulltime functie te zijn. Het is de persoon die verantwoordelijk is voor de kwaliteit van een specifieke dataset. De salesmanager is eigenaar van het klantbestand. De operations manager is eigenaar van de voorraaddata. De financieel directeur is eigenaar van de financiële data. Expliciet belegd eigenaarschap voorkomt de situatie waarin "iedereen" verantwoordelijk is en dus "niemand" actie onderneemt. Organisaties met benoemde data-eigenaren scoren volgens het Data Governance Institute gemiddeld 35% hoger op datakwaliteitsmetingen dan organisaties zonder.

Plan elk kwartaal een diepgaande analyse van de trends in datakwaliteit, met ruimte om nieuwe probleemgebieden te identificeren en de kwaliteitsregels bij te werken. De datakwaliteitscyclus is niet lineair maar iteratief. Elke cyclus brengt nieuwe inzichten die de volgende cyclus beter maken.

Tooling die helpt

Het goede nieuws is dat het wiel niet opnieuw uitgevonden hoeft te worden. Er zijn beproefde tools beschikbaar voor elke stap in het datakwaliteitsproces, van open-source tot enterprise-grade.

Voor data-transformatie en testing is dbt de de facto standaard in de moderne datastack. Het is open-source, goed gedocumenteerd en heeft een actieve community. dbt maakt datatransformaties versiebeheerbaar, testbaar en documenteerbaar. De tests draaien automatisch bij elke run van de datapijplijn, waardoor fouten worden gesignaleerd voordat ze de rapportages bereiken. Meer dan 40.000 bedrijven wereldwijd gebruiken dbt, van startups tot Fortune 500-ondernemingen.

Great Expectations biedt een framework voor het definiëren, documenteren en valideren van verwachtingen over data. Het integreert met alle gangbare dataplatforms en genereert automatisch datadocumentatie. Voor MKB-bedrijven die hun datakwaliteit serieus willen aanpakken maar niet de middelen hebben voor een enterpriseplatform voor data governance, is Great Expectations een uitstekend startpunt.

Voor deduplicatie zijn er gespecialiseerde tools zoals Dedupe.io (open-source Python library), die machine learning gebruikt om duplicaten te identificeren zelfs wanneer records niet exact overeenkomen. OpenRefine (voorheen Google Refine) is een gratis desktoptool voor het opschonen en transformeren van data die bijzonder geschikt is voor eenmalige schoonmaakacties op CSV- en Excel-bestanden. Voor bedrijven die hun data in een cloud-warehouse hebben, bieden platforms als Snowflake en BigQuery ingebouwde functies voor datakwaliteitsmonitoring.

De keuze voor tooling hangt af van de huidige technische volwassenheid. Een bedrijf dat zijn data voornamelijk in Excel beheert, begint met OpenRefine en gestructureerde spreadsheet-validatie. Een bedrijf met een cloud-datawarehouse implementeert dbt-tests en Great Expectations. Een bedrijf dat al een volwassen dataplatform heeft, voegt monitoringdashboards toe en automatiseert het volledige kwaliteitsproces.

WBSO: subsidie voor data engineering R&D

Hier wordt het interessant voor MKB-bedrijven die serieus investeren in datakwaliteit. Het ontwikkelen van geautomatiseerde datakwaliteitsprocessen, het bouwen van data-integratiepijplijnen en het implementeren van geavanceerde validatielogica kan in aanmerking komen voor de WBSO (Wet Bevordering Speur- en Ontwikkelingswerk). De WBSO biedt een korting op de loonheffing of een aftrekpost voor zelfstandigen die technisch-wetenschappelijk onderzoek of technische ontwikkeling uitvoeren.

De crux zit in het woord "ontwikkeling". Standaard implementatie van bestaande software valt niet onder de WBSO. Maar het ontwikkelen van een bedrijfsspecifiek data-integratieplatform dat meerdere bronnen koppelt en automatisch datakwaliteit bewaakt, kan wel in aanmerking komen. Het bouwen van machine-learningmodellen voor deduplicatie op basis van de specifieke datasets is technische ontwikkeling. Het ontwerpen van een framework voor data governance met geautomatiseerde compliance-controles kan als systematisch opgezette ontwikkeling worden aangemerkt.

De WBSO levert startende ondernemers een korting op de loonheffing van 40% over de eerste 350.000 euro aan S&O-loonkosten en 16% daarboven. Voor zelfstandigen geldt een vaste aftrekpost. Dit kan een aanzienlijke bijdrage leveren aan de financiering van het datakwaliteitsproject. De aanvraag verloopt via RVO en moet zijn ingediend voordat het werk begint. Meer informatie over de voorwaarden en het aanvraagproces staat op onze WBSO-pagina.

Heeft het datakwaliteitsproject een onderzoeks- of samenwerkingscomponent? Dan kan de MIT-regeling aanvullende financiering bieden voor haalbaarheidsstudies die voorafgaan aan het daadwerkelijke ontwikkeltraject. Gestapelde subsidies halen het maximale rendement uit de investering in datakwaliteit.

Conclusie: datakwaliteit als concurrentievoordeel

Datakwaliteit verbeteren is geen technisch project voor de IT-afdeling. Het is een bedrijfsbreed initiatief dat direct doorwerkt in de omzet, de kosten en de besluitvorming. De vijf stappen in dit artikel, van audit tot continue monitoring, vormen een aanpak die meeschaalt van een eenpersoonsbedrijf tot een organisatie met honderden medewerkers.

De bedrijven die hun datakwaliteit structureel op orde hebben, nemen betere beslissingen, werken efficiënter en zijn beter voorbereid op de inzet van geavanceerde technologieën als machine learning en AI. Want het maakt niet uit hoe geavanceerd het algoritme is: als de data die erin gaat niet klopt, is de output waardeloos. Of zoals de aloude wijsheid in dataland luidt: garbage in, garbage out. Het verschil is dat de weg om die garbage eruit te halen nu bekend is.

Ontvang de AI-subsidieradar

Eén e-mail per maand met nieuwe subsidies, deadlines en wat er voor het mkb veranderde. Vijf minuten leestijd.

Uitschrijven met één klik. Nooit spam.

Laten we kennismaken

Een half uur over waar in de operatie data iets oplevert, en waar niet. Geen slides.

Rutger Geerlings, founder of Stratalytic

Rutger Geerlings

Solution Architect

Ontdek wat data en AI concreet kunnen opleveren

Laatste cases

Alle cases