Skip to content
Stratalytic

DATA DRIVEN DECISIONS

AI & Machine Learning

Machine learning model laten bouwen: wat kost het echt en waar gaat het geld heen?

Gepubliceerd:

Team werkt aan een machine-learningmodel met datavisualisaties

Kernpunten: Een machine learning model laten bouwen kost tussen 10.000 en 150.000 euro, afhankelijk van complexiteit, datakwaliteit en integratievereisten. Het grootste deel van het budget gaat niet naar het model zelf, maar naar datavoorbereiding en validatie. Dit artikel geeft een transparante kostenverdeling, vergelijkt drie complexiteitsniveaus en laat zien hoe subsidies de netto-investering met 30-50% kunnen verlagen.

Datavoorbereiding vreet 40% van elk ML-budget op, en dat percentage stijgt als de data verspreid, onvolledig of inconsistent is, wat bij 70% van de MKB-bedrijven het geval is

De vraag "wat kost een machine learning model?" is vergelijkbaar met "wat kost een huis?" Het antwoord hangt af van tientallen variabelen, van de staat van de data tot de complexiteit van het probleem en de vereiste nauwkeurigheid. Toch is het mogelijk om concrete bandbreedtes te geven die helpen bij het budgetteren en bij het beoordelen van leveranciersoffertes.

Wat veel ondernemers verrast, is dat het eigenlijke modelwerk (het selecteren en trainen van algoritmen) maar 30% van het totale projectbudget uitmaakt. De rest gaat op aan datavoorbereiding (40%), validatie en testen (15%) en deployment naar productie (15%). Die verdeling is geen teken van inefficiëntie; ze laat zien waar de echte complexiteit zit. Een model is maar zo goed als de data waarop het getraind is, en het meeste werk zit in het schoonmaken, combineren en verrijken van die data.

In dit artikel verdelen we de kosten per projectfase, vergelijken we drie complexiteitsniveaus en geven we handvatten voor een realistisch budget.

Fase 1: datavoorbereiding en -exploratie (40% van het budget)

Datavoorbereiding is de fase waarin ruwe bedrijfsdata wordt omgezet in een bruikbare dataset voor modeltraining. Dit omvat data-inventarisatie (welke data is er, waar staat het, hoe is de kwaliteit), datacleaning (ontbrekende waarden, duplicaten, inconsistenties verwijderen), feature engineering (nieuwe variabelen afleiden die voorspellende waarde hebben) en datavalidatie (controleren of de voorbereide dataset representatief en betrouwbaar is).

Bij een eenvoudig project met schone data uit een enkele bron kost deze fase 3.000 tot 8.000 euro. Bij een middelgroot project met drie tot vijf databronnen en matige datakwaliteit loopt dit op tot 10.000 tot 25.000 euro. Bij complexe projecten met tientallen bronnen, ongestructureerde data of strenge privacy-vereisten kan datavoorbereiding 25.000 tot 60.000 euro kosten.

De spreiding komt doordat de datakwaliteit sterk verschilt per bedrijf. Een bedrijf dat drie jaar lang netjes CRM-data heeft bijgehouden in Salesforce, heeft een fundamenteel ander startpunt dan een bedrijf dat verkoopdata in Excel-bestanden bewaart, klantgegevens in een legacy-systeem heeft en productiedata handmatig noteert. Onderzoek van IBM schat dat slechte datakwaliteit bedrijven gemiddeld 12,9 miljoen dollar per jaar kost aan verloren productiviteit en verkeerde beslissingen. Hoewel dat cijfer betrekking heeft op grote ondernemingen, is het effect naar verhouding ook voor het MKB aanzienlijk.

Fase 2: modelontwikkeling en training (30% van het budget)

De modelontwikkelingsfase omvat het selecteren van geschikte algoritmen, het trainen van modellen op de voorbereide data, het tunen van hyperparameters en het vergelijken van verschillende benaderingen. Dit is de fase die de meeste aandacht krijgt in de media, maar in de praktijk het meest gestandaardiseerd is dankzij volwassen open-source libraries als scikit-learn, TensorFlow en PyTorch.

Voor een eenvoudig voorspelmodel (lineaire regressie, beslisbomen, standaard classificatie) kost deze fase 2.000 tot 6.000 euro. Het model wordt getraind op voorbereide data, geoptimaliseerd en gedocumenteerd. Doorlooptijd: twee tot vier weken.

Een model van middelhoge complexiteit (ensemblemethoden, gradient boosting, tijdreeksanalyse) vereist meer experimentatie en kost 8.000 tot 18.000 euro. Hier komen meerdere modelbenaderingen naast elkaar te staan, wordt uitgebreider getuned en is meer domeinexpertise nodig. Doorlooptijd: vier tot acht weken.

Complexe modellen (deep learning, computer vision, NLP, reinforcement learning) kosten 18.000 tot 45.000 euro aan ontwikkeltijd. Deze modellen vereisen gespecialiseerde kennis, meer rekenkracht voor training en uitgebreidere experimentatie. Doorlooptijd: acht tot zestien weken. Bovendien komen hier aanzienlijke rekenkosten bij: GPU-training op cloud-platforms kost 2 tot 15 euro per uur, en een complex model kan honderden GPU-uren training vergen.

Fase 3: validatie en testen (15% van het budget)

Validatie bepaalt of het model daadwerkelijk betrouwbaar genoeg is voor productie-inzet. Dit omvat cross-validatie, het testen op onafhankelijke datasets, het meten van prestatiemetrieken en het evalueren van het model onder verschillende scenario's (edge cases, seizoensinvloeden, datadrift).

De kosten voor validatie liggen tussen 1.500 en 8.000 euro voor eenvoudige modellen en 8.000 tot 22.000 euro voor complexe modellen. Ondernemers bezuinigen regelmatig op deze fase, maar goedkoop is hier duurkoop. Een model dat in de testomgeving 95% nauwkeurigheid haalt maar in productie afzakt naar 70% omdat het niet goed gevalideerd is op realistische scenario's, kost meer dan de besparing op validatie ooit waard was.

Een cruciaal onderdeel van validatie is het meten van de zakelijke waarde. Een model met 85% nauwkeurigheid dat 200.000 euro per jaar aan voorraadkosten bespaart, is waardevoller dan een model met 95% nauwkeurigheid dat 100.000 euro bespaart. Validatie moet daarom altijd de vertaalslag maken van technische metrieken naar wat het model oplevert.

Fase 4: deployment en integratie (15% van het budget)

Bij het in productie nemen van een model lopen veel projecten vast. Onderzoek van Gartner uit 2025 toont aan dat maar 53% van de ontwikkelde ML-modellen daadwerkelijk in productie komt. De rest strandt in de experimenteerfase, niet door technische tekortkomingen maar door gebrekkige deployment-planning.

Deployment omvat het inrichten van een productie-omgeving, het bouwen van een API of integratie met bestaande systemen, het opzetten van monitoring en alerting, en het documenteren van het model voor onderhoud. De kosten variëren van 2.000 tot 8.000 euro voor een eenvoudige API-deployment tot 15.000 tot 35.000 euro voor volledige integratie in complexe bedrijfssystemen.

Daarnaast zijn er doorlopende kosten voor hosting en inference. Een eenvoudig model dat enkele honderden voorspellingen per dag doet, kost 50 tot 200 euro per maand aan cloud-compute. Een model dat duizenden real-time voorspellingen per minuut verwerkt, kost al snel 1.000 tot 5.000 euro per maand. Voor de meeste MKB-toepassingen liggen de maandelijkse inference-kosten tussen 100 en 500 euro.

Drie complexiteitsniveaus vergeleken

Een eenvoudig ML-project (klantsegmentatie, eenvoudige vraagvoorspelling, leadscoring) kost in totaal 10.000 tot 25.000 euro en duurt zes tot twaalf weken. De data komt uit een tot twee bronnen, het model is relatief standaard en de deployment is eenvoudig. Dit is het instapniveau voor MKB-bedrijven die voor het eerst met machine learning werken.

Een middelgroot ML-project (geavanceerde voorspelmodellen, recommender systems, prijsoptimalisatie) kost 25.000 tot 60.000 euro en duurt drie tot vijf maanden. Meerdere databronnen worden gecombineerd, er is meer experimentatie nodig en de deployment vereist integratie met bestaande systemen. Dit niveau levert doorgaans de hoogste ROI: complex genoeg om echt iets op te leveren, maar niet zo complex dat de kosten uit de hand lopen.

Een complex ML-project (computer vision, NLP-modellen, real-time systemen, multi-model architecturen) kost 60.000 tot 150.000 euro en duurt vijf tot twaalf maanden. Dit zijn projecten die gespecialiseerde expertise, veel rekenkracht en uitgebreide validatie vereisen. De businesscase moet stevig zijn om deze investering te rechtvaardigen: doorgaans een verwachte opbrengst van minimaal 200.000 euro per jaar.

Verborgen kosten waar niemand over praat

Naast de directe projectkosten zijn er kosten die regelmatig over het hoofd worden gezien. Modelonderhoud is de belangrijkste: een ML-model is geen software die eenmaal gebouwd wordt en vervolgens jarenlang ongewijzigd draait. Data verandert, klantgedrag verschuift, marktomstandigheden evolueren. Zonder regelmatig onderhoud gaat elk model achteruit. Reken op 15-25% van de initiële projectkosten per jaar voor onderhoud, hertraining en doorontwikkeling.

Daarnaast zijn er de kosten van change management: het trainen van medewerkers om met modelvoorspellingen te werken, het aanpassen van werkprocessen en het opbouwen van vertrouwen in datagedreven besluitvorming. Deze kosten zijn moeilijk te kwantificeren maar reëel. Een model dat perfecte voorspellingen levert maar door niemand wordt gebruikt, heeft een ROI van nul.

Ten slotte is er het risico van scope creep. De scope van ML-projecten verschuift vaak tijdens het project, zodra er interessante patronen in de data opduiken. Stel vooraf een helder projectcharter op met concrete doelstellingen, meetbare succescriteria en een vastgesteld budget. Nieuwe inzichten die buiten scope vallen, worden geparkeerd voor een vervolgproject.

Hoe subsidies de investering verlagen

Machine-learningprojecten komen bij uitstek in aanmerking voor technologiesubsidies. De WBSO-regeling compenseert tot 32% van de loonkosten voor technisch-wetenschappelijk onderzoek, en ML-modelontwikkeling valt hier volledig onder. Bij een project van 50.000 euro aan loonkosten kan de WBSO-besparing oplopen tot 16.000 euro.

De MIT-regeling biedt daarnaast subsidie voor haalbaarheidsstudies en R&D-samenwerkingsprojecten. Voor een haalbaarheidsstudie naar een ML-toepassing is 35% subsidie mogelijk, tot maximaal 20.000 euro. Dit is een uitstekende manier om het risico van een eerste ML-project te beperken.

Voor specifiek AI-gerichte projecten biedt de AI-subsidie aanvullende financiering. Door meerdere regelingen te combineren daalt de netto-investering met 30-50%. Met gecombineerde subsidies kan een project van 60.000 euro bruto dalen naar 30.000-40.000 euro netto, wat de businesscase aanzienlijk versterkt.

De juiste partner kiezen voor een ML-project

De keuze van een ML-partner is minstens zo bepalend voor succes als de technische aanpak. Let bij de selectie op drie criteria. Ten eerste: ervaring met vergelijkbare projecten in de sector. Vraag om referenties en case studies, niet om generieke presentaties. Een partner die eerder voorraadoptimalisatie heeft gebouwd voor een groothandel, brengt domeinkennis mee die maanden inwerktijd scheelt.

Ten tweede: transparantie over kosten en doorlooptijd. Een betrouwbare partner geeft een realistisch budget met een bandbreedte van 20-30%, niet een vaste prijs zonder ruimte voor de inherente onzekerheid van ML-projecten. Wees wantrouwig bij partners die exacte bedragen garanderen voordat ze de data gezien hebben.

Ten derde: eigendom en overdracht. Alle code, modellen, documentatie en trainingsdata moeten na afloop eigendom van de opdrachtgever zijn. Dit is niet onderhandelbaar. Zonder eigendom blijft het bedrijf voor onderhoud en doorontwikkeling blijvend afhankelijk van de partner, en die kwetsbaarheid wil niemand. Leg deze afspraken contractueel vast voordat het project start.

Het budget realistisch plannen

Begin met het definiëren van het businessprobleem en de verwachte opbrengst. Bespaart een voorspelmodel naar verwachting 100.000 euro per jaar aan voorraadkosten, dan is een investering van 30.000-50.000 euro goed te rechtvaardigen. Bij een verwachte besparing van 20.000 euro per jaar past een eenvoudiger model van 10.000-15.000 euro beter.

Plan het budget in fasen. Start met een discovery-fase van 3.000-5.000 euro waarin de haalbaarheid en datakwaliteit worden beoordeeld. Is de conclusie positief, dan volgt het volledige project. Blijkt de data niet geschikt, dan is dat duidelijk geworden voor een fractie van het totale budget.

Reserveer minimaal 20% van het projectbudget voor onvoorziene kosten en scope-aanpassingen. ML-projecten zijn inherent exploratief, en de kans op verrassingen in de data is groot. Een buffer van 20% vangt die op zonder het project in gevaar te brengen.

Conclusie: investeer bewust en gefaseerd

Een machine learning model laten bouwen is een investering die zich bij de juiste toepassing ruimschoots terugverdient. Wat telt: realistische verwachtingen, een gefaseerde aanpak en het benutten van beschikbare subsidies. Begin met een helder businessprobleem, toets de haalbaarheid in een korte discovery-fase en bouw daarna stap voor stap aan een productiewaardige oplossing.

Wat zou een ML-model in de eigen situatie kosten? Neem contact op voor een vrijblijvende indicatie op basis van de data, het probleem en de ambitie.

Ontvang de AI-subsidieradar

Eén e-mail per maand met nieuwe subsidies, deadlines en wat er voor het mkb veranderde. Vijf minuten leestijd.

Uitschrijven met één klik. Nooit spam.

Laten we kennismaken

Een half uur over waar in de operatie data iets oplevert, en waar niet. Geen slides.

Rutger Geerlings, founder of Stratalytic

Rutger Geerlings

Solution Architect

Ontdek wat data en AI concreet kunnen opleveren

Laatste cases

Alle cases