Wat is data-analyse? Van vraag naar controleerbaar inzicht (2026)
Data-analyse zet gegevens om in een controleerbaar antwoord op een vraag, met aandacht voor bron, definitie, onzekerheid en actie.
Data-analyse is het beantwoorden van een concrete vraag met gegevens die je kunt herleiden en controleren. Het is meer dan tellen of een grafiek maken: je maakt ook duidelijk wat de bron meet, wat ontbreekt en welke conclusie wel of niet past.
Stappenplan
1. Begin met de vraag
Formuleer bijvoorbeeld: "Welke productgroep heeft de meeste retouren in kwartaal twee?" Werk dit uit in een analyseplan, inclusief periode en gebruiker.
2. Controleer de gegevens
Kijk naar herkomst, unieke sleutel, volledigheid en definities via de tien datakwaliteitschecks. Een lokale CSV-controle kan de eerste structuurproblemen zichtbaar maken.
3. Bereken, vergelijk en duid
Kies een berekening die de vraag beantwoordt, vergelijk alleen gelijksoortige perioden en benoem onzekerheden. Een stijging kan ook ontstaan door een gewijzigde registratie of populatie.
Controleerbaar voorbeeld
Een team wil weten waarom retouren stijgen. Je vergelijkt aantallen én percentage retouren per productgroep, met dezelfde definitie en periode. Daarna controleer je of een nieuw retourformulier de registratie veranderde. De conclusie is dan niet "productgroep X is slecht", maar een toetsbare aanwijzing voor vervolgonderzoek.
CBS legt in zijn open-data-uitleg nadruk op metadata bij cijfers. Die context is ook bij je eigen bron nodig.
Data-analyse is een keten van keuzes
Data-analyse wordt betrouwbaar wanneer je de hele keten kunt uitleggen: vraag, populatie, bron, definitie, bewerking, controle, interpretatie en actie. Een grafiek of dashboard is slechts een mogelijke laatste vorm. Je kunt een klein bestand goed analyseren als die keten zichtbaar is; een grote dataset levert weinig op wanneer niemand weet wat een record, datum of status betekent.
Begin met een beslisvraag. Een bruikbare vraag noemt een groep, periode en vergelijking, bijvoorbeeld: “Welke fictieve productgroep heeft in kwartaal twee het hoogste retourpercentage, gemeten op definitief geboekte retouren?” Zo voorkom je dat je achteraf een interessante grafiek zoekt bij data die toevallig beschikbaar is. Leg vraag, eigenaar en grenzen vast in een analyseplan.
Van bron naar verantwoord inzicht
- Inventariseer de bron, eigenaar, exportmoment en bekende vertraging.
- Definieer wat één record is en controleer sleutel, volledigheid en periode.
- Leg teller, noemer, filters, eenheid en afronding voor elke berekening vast.
- Bewerk reproduceerbaar en bewaar een ongewijzigde bronlaag.
- Valideer aantallen, totalen en een vooraf gekozen steekproef.
- Kies een visualisatie die de beslisvraag ondersteunt.
- Formuleer conclusie, onzekerheid en vervolgactie los van elkaar.
De CBS-uitleg over StatLine als open data is een praktisch voorbeeld van dit principe: cijfers hebben metadata, definities en structuur nodig om juist te worden geïnterpreteerd. Bij je eigen bron zijn die rollen verdeeld over bron-eigenaar, datamodel en werkinstructie. Een getal zonder die context is hoogstens een aanwijzing.
Synthetisch voorbeeld: retouren onderzoeken
Een fictief team ziet dat retouren in kwartaal twee stijgen. Het onderzoekt niet alleen het aantal retourregels, maar ook het percentage retouren per productgroep. De teller is het aantal definitieve retouren; de noemer het aantal geleverde orders uit dezelfde productgroep en periode. Geannuleerde orders zijn uitgesloten. De bron-eigenaar bevestigt dat in beide kwartalen hetzelfde statusveld wordt gebruikt.
Eerst telt het team unieke ordercodes, controleert het drie vooraf gekozen fictieve voorbeelden in de bron en kijkt het naar ontbrekende productgroepen. Daarna blijkt dat het retourformulier halverwege het kwartaal is gewijzigd. De conclusie is dus niet “productgroep B is slechter”, maar: “De gemeten stijging valt samen met een gewijzigde registratie; vergelijkbaarheid vóór en na 15 mei is beperkt.” Dat is een bruikbaar resultaat, want het bepaalt welke controle volgt.
Vervolgens kan het team de periode splitsen, de oude en nieuwe definitie apart rapporteren of een aanvullende procescontrole doen. Met KPI's kiezen leg je de ratio vast; met grafiek kiezen toon je hem zonder een oorzakelijk verhaal te suggereren.
Onzekerheid is onderdeel van het antwoord
Een analyse hoeft niet te eindigen met één absoluut oordeel. Vermeld welke records ontbreken, of een periode tussentijds is, welke definitie is gewijzigd en welke alternatieve verklaringen er zijn. Een samenhang tussen twee reeksen bewijst niet dat de ene de andere veroorzaakt. Een gemiddelde kan bovendien uitschieters of verschillen tussen groepen verbergen. Deel daarom waar passend verdeling, aantallen en segmenten.
Voer validatie in lagen uit. De eerste laag is technisch: rijen, types, dubbele sleutels en format. De tweede is inhoudelijk: betekenen status en datum wat de analyse veronderstelt? De derde is besluitgericht: zou een redelijke afwijking de vervolgactie veranderen? De tien datakwaliteitschecks ordenen deze controles. Voor een CSV-export kan de lokale CSV-scan een eerste, privacyvriendelijk structuursignaal geven.
Privacy en herstel
Neem alleen velden mee die nodig zijn voor de vraag. Een interne sleutel en geaggregeerde waarde zijn vaak voldoende; namen, contactgegevens en vrije tekst zijn dat meestal niet. De AVG-beginselen op EUR-Lex maken doelbinding en dataminimalisatie expliciet. De lokale CSV-scan verstuurt geen inhoud, maar je moet zelf ook geen persoonsgegevens in een online vraag of screenshot plakken.
Als een controle faalt, stop je de conclusie, bewaar je bronversie en wijzigingslog en herstel je de oorzaak bij bron, definitie of bewerking. Herbereken daarna vanaf de bron en herhaal dezelfde controles. Als je het probleem niet kunt oplossen, verklein je de claim of rapporteer je dat de vraag nog niet betrouwbaar te beantwoorden is. Dat is beter dan een overtuigend maar oncontroleerbaar dashboard publiceren.
Veelgemaakte fouten
- Een dashboard met analyse verwarren. Een visual is geen bewijs van een juiste definitie.
- Beschikbare data de vraag laten bepalen. Begin bij besluit en populatie.
- Een totaal als volledig zien. Groepen, perioden of statusregels kunnen ontbreken.
- Kwaliteitsproblemen wegfilteren. Maak ze zichtbaar en herstel bij de bron.
- Onzekerheid als zwakte verbergen. Benoem grenzen zodat de lezer passend handelt.
Gebruik om een vraag en controlepad af te bakenen eerst dataset opschonen en bronnen combineren zonder joinfouten. Werk daarbij zonder bestanden of persoonsgegevens in gedeelde feedback.
Officiële bronnen
Veelgestelde vragen
- Is data-analyse hetzelfde als een dashboard?
- Nee. Een dashboard is een mogelijke weergave; analyse begint bij een vraag en eindigt bij een onderbouwde interpretatie.
- Heb ik veel data nodig?
- Nee. Een kleine, goed gedefinieerde dataset kan bruikbaarder zijn dan een grote bron met onduidelijke betekenis.
- Kan ik analyseren met Excel of Sheets?
- Ja, als je bron, bewerking en controles passen bij de omvang en het risico van de vraag.
- Wat is een correlatie?
- Een samenhang tussen twee metingen; die bewijst niet dat de ene de oorzaak van de andere is.
- Wanneer is een conclusie betrouwbaar?
- Wanneer vraag, bron, definitie, bewerking en onzekerheden herleidbaar zijn voor de lezer.
Lees ook
Hulp nodig bij jouw situatie?
Kom je er niet uit? Stuur kort wat context, wat je wilt bereiken en waar je vastloopt. Dan kijken we samen naar een passende volgende stap.