Skip to content
Stratalytic

DATA DRIVEN DECISIONS

Data Strategie

AI-ready? Waarom het datafundament belangrijker is dan de juiste tool

Gepubliceerd:

Team dat samenwerkt aan een datagedreven strategie met dashboards en analyses

Kernpunten: De meeste bedrijven die met AI beginnen, investeren in tools voordat hun data op orde is. Uit onderzoek blijkt dat circa 80% van de tijd in AI-projecten opgaat aan datavoorbereiding, en dat slechte datakwaliteit de belangrijkste reden is waarom AI-initiatieven mislukken. Dit artikel laat zien waarom een sterk datafundament de voorwaarde is voor elke succesvolle AI-toepassing, hoe de basis er in 8 weken ligt, en welke subsidies de investering aanzienlijk verlagen.

Waarom de meeste AI-projecten falen, en waarom het niet aan de technologie ligt

Ongeveer 80% van de AI-projecten levert niet het verwachte resultaat op, en de oorzaak ligt vrijwel nooit bij het algoritme of de tool. Het probleem begint bij de data die het systeem voedt. Wanneer informatie verspreid zit over tientallen spreadsheets, CRM-velden incompleet zijn en definities per afdeling verschillen, kan zelfs het meest geavanceerde AI-model geen betrouwbare uitkomsten produceren.

Gartner rapporteert dat organisaties gemiddeld 12,9 miljoen dollar per jaar verliezen door slechte datakwaliteit. Voor het MKB betekent dat gemiste omzet, verkeerde beslissingen en verspilde projectbudgetten. Het patroon is herkenbaar: een bedrijf investeert 50.000 tot 100.000 euro in een AI-pilot, ontdekt halverwege dat de onderliggende data ongeschikt is, en moet het project pauzeren of afschrijven. De tool werkt prima, maar de input is waardeloos.

Dit fenomeen staat bekend als "garbage in, garbage out" en het is zo oud als de informatica zelf. Toch herhalen bedrijven de fout omdat de AI-markt tools verkoopt, geen fundamenten. Leveranciers demonstreren indrukwekkende mogelijkheden op schone datasets, maar de kloof tussen die demo en de eigen datasituatie is vaak groter dan verwacht. Een machine-learningmodel dat fraude detecteert op een standaarddataset presteert volstrekt anders wanneer het gevoed wordt met inconsistente, onvolledige transactiedata uit de eigen boekhouding.

De les is helder: investeer eerst in het datafundament, dan pas in AI-tooling. Bedrijven die deze volgorde aanhouden, rapporteren drie keer hogere slagingspercentages bij AI-implementaties. Het verschil zit niet in budget of technische kennis, maar in de discipline om de basis op orde te brengen voordat de geavanceerde toepassingen aan de beurt zijn.

Wat een datafundament eigenlijk is

Een datafundament is de technische en organisatorische basis die ervoor zorgt dat alle relevante bedrijfsdata betrouwbaar, toegankelijk en bruikbaar is voor analyse en automatisering. Het is geen product van de plank, maar een combinatie van architectuur, processen en afspraken die samen bepalen hoe goed de organisatie met data kan werken.

Concreet bestaat een datafundament uit vier lagen die op elkaar voortbouwen. De eerste laag is databronnen en integratie. Hier gaat het om de verbinding tussen alle operationele systemen: ERP, CRM, webshop, boekhouding, productieregistratie en eventuele externe databronnen. Een solide integratielaag zorgt ervoor dat data automatisch en gestandaardiseerd samenkomt, in plaats van handmatig gekopieerd te worden via exports en Excel-bestanden.

De tweede laag is opslag en structuur. Een centraal data warehouse of data lakehouse slaat alle geïntegreerde data op in een gestructureerd formaat met consistente definities. Hier worden klant-ID's gelijkgetrokken, datumformaten gestandaardiseerd en duplicaten opgeschoond. Deze laag vormt letterlijk het fundament waarop alles rust. Onderzoek van McKinsey toont aan dat bedrijven met een gecentraliseerd data warehouse 23% sneller datagedreven beslissingen nemen dan organisaties die met verspreide databronnen werken.

De derde laag is datakwaliteit en governance. Dit omvat de regels, processen en tooling die ervoor zorgen dat data correct, compleet en actueel blijft. Denk aan validatieregels bij invoer, automatische kwaliteitscontroles, eigenaarschap per databron en procedures voor het corrigeren van fouten. Zonder governance verzandt elk datafundament binnen maanden in dezelfde chaos die het moest oplossen.

De vierde laag is toegankelijkheid en analysegereedheid. Data die correct is opgeslagen maar niet toegankelijk voor de juiste mensen, levert niets op. Deze laag omvat dashboards, rapportagetools, API's en de documentatie die gebruikers in staat stelt zelfstandig met data te werken. Voor AI-toepassingen betekent dit dat datasets in het juiste formaat beschikbaar zijn, voorzien van metadata en versiebeheer.

Vijf signalen dat de data niet AI-ready is

Wie minstens drie van de volgende vijf signalen herkent, heeft data die in de huidige staat niet geschikt is als basis voor AI-toepassingen. Deze signalen wijzen op fundamentele gebreken die eerst opgelost moeten worden.

Het eerste signaal is dat dezelfde vraag verschillende antwoorden oplevert, afhankelijk van wie hem beantwoordt of welk systeem geraadpleegd wordt. Wanneer sales een ander omzetcijfer rapporteert dan finance, of wanneer het aantal actieve klanten verschilt tussen CRM en facturatiesysteem, ontbreken eenduidige definities. AI-modellen die getraind worden op inconsistente data, produceren onbetrouwbare voorspellingen. Uit onderzoek van Harvard Business Review blijkt dat slechts 3% van de data in een gemiddeld bedrijf voldoet aan basale kwaliteitsnormen.

Het tweede signaal is dat meer dan 15% van de kritieke datavelden leeg of ongeldig is. Controleer het CRM: hoeveel contactpersonen hebben geen e-mailadres, functietitel of branchecode? Hoeveel orders missen een bron of campagnelabel? Ontbrekende waarden zijn meer dan een cosmetisch probleem. Ze vormen gaten in het patroon die een AI-model ofwel negeert, ofwel verkeerd interpreteert. Een churn-voorspelmodel op klantdata waarin 30% van de interactiehistorie ontbreekt, zal systematisch klanten verkeerd classificeren.

Het derde signaal is dat de organisatie meer dan twee uur per week besteedt aan het handmatig combineren van data uit verschillende bronnen. Dit gebeurt vaak via Excel-exports die samengevoegd worden met VLOOKUP-formules. Elke handmatige stap introduceert foutkansen en vertraging. Bovendien is het niet schaalbaar: wat werkt met honderd rijen, faalt bij tienduizend. Organisaties die dit herkennen, besteden naar schatting 40% van hun analysetijd aan datavoorbereiding in plaats van aan daadwerkelijke analyse.

Het vierde signaal is dat er geen gedocumenteerde definities bestaan voor kernbegrippen. Wat is een "actieve klant"? Iemand die in de afgelopen 12 maanden heeft gekocht? Of iemand met een lopend contract? Als deze definitie niet formeel is vastgelegd en consistent wordt toegepast, interpreteert elk team het begrip op eigen wijze. AI-modellen vereisen eenduidige labels en definities om patronen te herkennen; ambiguïteit is hun kryptoniet.

Het vijfde signaal is dat de data alleen in Excel-bestanden staat, lokaal opgeslagen op laptops. Volgens onderzoek werkt 82% van het MKB nog primair met spreadsheets voor bedrijfskritische data. Dit is begrijpelijk maar onhoudbaar zodra AI-toepassingen in beeld komen. Excel biedt geen versiebeheer, geen automatische validatie, geen gelijktijdige bewerking door meerdere gebruikers en geen API-toegang voor AI-systemen. De stap van spreadsheet naar database is de meest fundamentele stap in het bouwen van een datafundament.

Een datafundament in acht weken

Een datafundament hoeft geen langdurig en kostbaar traject te zijn. Met een gerichte aanpak ligt er in 8 weken een werkende basis die direct bruikbaar is voor analyse en later uitgebreid kan worden richting AI-toepassingen. De sleutel is pragmatisme: begin met de belangrijkste datastromen en breid geleidelijk uit.

Week 1 en 2 zijn voor de data-audit. Die inventariseert alle databronnen in de organisatie, van ERP en CRM tot spreadsheets en handmatige registraties. Per bron wordt vastgelegd welke data erin zit, hoe actueel die is, wie verantwoordelijk is en hoe de data momenteel gebruikt wordt. Tegelijk komt de eerste AI-usecase in beeld. Die usecase stuurt de prioritering van het fundament: welke data moet als eerste op orde komen? Een audit van een gemiddeld MKB-bedrijf met 5 tot 8 databronnen kost meestal 3 tot 5 werkdagen.

In week 3 en 4 wordt de centrale dataopslag ingericht. Dat kan een cloud data warehouse zijn zoals BigQuery of Snowflake, of een lichtere oplossing als PostgreSQL, afhankelijk van schaal en ambitie. Dan volgen het datamodel, de naamconventies en de eerste definities in een data dictionary. De kosten van cloudopslag zijn bij MKB-volumes verwaarloosbaar: reken op 50 tot 200 euro per maand voor de eerste terabytes.

Week 5 en 6 zijn voor de eerste datapipelines, die automatisch data ophalen uit de bronsystemen en laden in het warehouse. Tools als Airbyte, Fivetran of maatwerkscripts via Python zorgen ervoor dat data dagelijks of real-time gesynchroniseerd wordt. Daarmee verdwijnen de handmatige exports en blijft de centrale opslag altijd actueel. Gemiddeld heeft een MKB-bedrijf 4 tot 6 kritieke databronnen die in deze fase aangesloten worden.

In week 7 en 8 volgen de datakwaliteitscontroles en de eerste dashboards. Geautomatiseerde checks signaleren wanneer data ontbreekt, duplicaten ontstaan of waarden buiten verwachte bereiken vallen. Dashboards geven direct inzicht in de data die nu centraal beschikbaar is. Na deze 8 weken staat er een werkend datafundament dat klaar is voor de eerste AI-experimenten.

De totale investering voor dit traject ligt meestal tussen 15.000 en 40.000 euro, afhankelijk van het aantal databronnen en de complexiteit van het systeemlandschap. Dit is een fractie van de kosten van een mislukt AI-project op een gebrekkige databasis.

De rol van subsidies bij het bouwen van het datafundament

Het opbouwen van een datafundament komt in aanmerking voor meerdere Nederlandse innovatiesubsidies, samen goed voor 30 tot 60% van de investering. Dat maakt de businesscase nog overtuigender en verlaagt de drempel om te starten.

De WBSO (Wet Bevordering Speur- en Ontwikkelingswerk) is de meest toegankelijke subsidie voor datafundament-projecten. Bevat het project technische nieuwheid, bijvoorbeeld het ontwikkelen van een domeinspecifiek datamodel, het bouwen van maatwerkintegraties of het implementeren van geautomatiseerde kwaliteitscontroles, dan zijn de loonkosten en uitbestede R&D-kosten deels fiscaal aftrekbaar. De WBSO verlaagt de kosten van de uren die meetellen effectief met 30 tot 40%. In 2025 maakten ruim 22.000 bedrijven gebruik van de WBSO, wat aantoont dat de regeling breed toegankelijk is.

De SLIM-subsidie is specifiek gericht op leren en ontwikkelen in het MKB. Gaat het datafundament-project gepaard met het opleiden van medewerkers in datageletterdheid, dashboardgebruik of data governance, dan dekt SLIM tot 60% van die opleidingskosten. Dit is bijzonder relevant omdat een datafundament pas iets oplevert wanneer medewerkers er effectief mee kunnen werken.

Voor omvangrijkere trajecten die doorlopen naar AI-implementatie biedt de MIT R&D-subsidie mogelijkheden. Deze subsidie ondersteunt technisch innovatieve projecten met een bijdrage van 35% tot een maximum van 350.000 euro. Wanneer het datafundament de basis vormt voor een vernieuwende AI-toepassing, kan het volledige traject onder deze regeling vallen.

Het combineren van subsidies, ook wel subsidiestapeling genoemd, kan de eigen bijdrage terugbrengen tot 40 tot 50% van de totale investering. Een datafundament-traject van 30.000 euro kost na WBSO-aftrek en eventuele SLIM-subsidie effectief 15.000 tot 20.000 euro. Voor die investering ligt er een basis die niet alleen AI mogelijk maakt, maar ook de dagelijkse rapportage, prognoses en operationele besluitvorming direct verbetert.

Wanneer is het juiste moment om met AI te starten?

Het juiste moment om met AI te starten is niet wanneer de technologie perfect is, maar wanneer het datafundament drie basisvoorwaarden vervult: de kerndata is gecentraliseerd en gestandaardiseerd, er is minimaal 12 maanden historische data beschikbaar voor de beoogde toepassing, en er ligt een concreet bedrijfsprobleem dat aantoonbaar baat heeft bij voorspellende of automatiserende technologie.

Wacht niet op perfectie. Een datafundament is nooit "af"; het groeit mee met de organisatie en de ambities. De fout die veel bedrijven maken is eindeloos blijven voorbereiden zonder ooit de stap naar toepassing te zetten. Het doel van de 8-wekenbenadering is precies dat te doorbreken: een werkbare basis, en meteen een eerste AI-pilot daarop.

De Nederlandse markt beweegt snel. Volgens onderzoek van het CBS heeft inmiddels 24% van de bedrijven met meer dan 10 werknemers AI-toepassingen in gebruik, een verdubbeling ten opzichte van twee jaar geleden. Bedrijven die nu hun datafundament op orde brengen, zijn binnen een kwartaal klaar voor hun eerste AI-implementatie. Bedrijven die wachten, lopen het risico dat concurrenten die voorsprong eerder pakken.

De praktische volgende stap is helder. Start met een data-audit om de huidige situatie in kaart te brengen. Bepaal de meest waardevolle AI-usecase. Reken de subsidiekansen door die de investering verlagen. En begin met bouwen. Een solide datafundament is niet alleen de voorwaarde voor AI, het is de voorwaarde voor elke vorm van datagedreven ondernemen. De tool volgt later. Het fundament komt nu.

Ontvang de AI-subsidieradar

Eén e-mail per maand met nieuwe subsidies, deadlines en wat er voor het mkb veranderde. Vijf minuten leestijd.

Uitschrijven met één klik. Nooit spam.

Laten we kennismaken

Een half uur over waar in de operatie data iets oplevert, en waar niet. Geen slides.

Rutger Geerlings, founder of Stratalytic

Rutger Geerlings

Solution Architect

Ontdek wat data en AI concreet kunnen opleveren

Laatste cases

Alle cases