Dataset opschonen: een controleerbaar stappenplan (2026)
Schoon een dataset op zonder definities te verliezen: bewaar de bron, leg regels vast, herstel bewust en controleer opnieuw.
Een dataset opschonen betekent niet dat je alles wat afwijkt verwijdert. Je bewaart de bron, kiest regels die je kunt uitleggen en controleert na iedere bewerking wat er veranderde.
Stappenplan
1. Bewaar bron en doel
Maak een ongewijzigde kopie en noteer bron, exportdatum, periode en analysevraag. Doe eerst een lokale CSV-controle, zodat je uitgangspunt bekend is.
2. Standaardiseer zonder betekenis te veranderen
Maak hoofdletters, spaties, datums en eenheden consistent. Verander geen waarde omdat die onwaarschijnlijk voelt. Als n.v.t. en leeg iets anders betekenen, houd ze apart.
3. Behandel ontbrekende en dubbele waarden met een regel
Definieer per kolom wat ontbrekend betekent. Gebruik een unieke sleutel voordat je dubbele rijen samenvoegt of verwijdert. De datakwaliteitschecks helpen om die beslissing te toetsen.
4. Documenteer de bewerking
Noteer bijvoorbeeld: "kolom bedrag: komma naar punt voor numerieke import" en tel rijen voor en na. Controleer vóór het vernieuwen van rapporten ook welke KPI's de bewerking gebruikt. Power Query ondersteunt herhaalbare transformaties; Microsoft adviseert in zijn best practices eerst data te profileren en stappen klein te houden.
Controleerbaar voorbeeld
In een orderexport staat Noord, noord en NOORD. Maak een nieuwe kolom regio_schoon met getrimde, gestandaardiseerde waarden. Laat regio_bron staan. Vergelijk daarna de aantallen per regio met de bron en leg vast welke drie vormen zijn samengevoegd.
Opschonen is een wijziging, geen cosmetische stap
Een opgeschoonde dataset moet je kunnen terugvertalen naar de bron. Bewaar daarom altijd een ongewijzigde bronlaag, een bewerkingslaag en een korte wijzigingslog. De bronlaag blijft zoals ontvangen, ook als een datum als tekst is opgeslagen of een regio extra spaties bevat. In de bewerkingslaag voeg je regels toe die iemand anders kan herhalen. Daarmee voorkom je dat een fout wordt verborgen door een nette tabel.
Start met een profiel: tel rijen, unieke sleutels, lege waarden, minimum- en maximumdatum en relevante totalen. Kies daarna slechts één bewerking tegelijk. Microsoft raadt in Power Query best practices aan data vroeg te profileren en transformaties klein en herhaalbaar te houden. Die werkwijze is ook verstandig wanneer je met een ander hulpmiddel werkt.
Herstelregels die je vooraf vastlegt
Leg per kolom vast welke waarden zijn toegestaan en wat je doet als een waarde daarvan afwijkt. Voor een bedrag kun je bijvoorbeeld decimalen standaardiseren, maar alleen nadat je valuta en notatie hebt geverifieerd. Voor een datum kies je een echte datumwaarde en noteer je tijdzone of daggrens als die voor de vraag relevant is. Voor een categorienaam kun je omringende spaties verwijderen en hoofdletters standaardiseren, zolang je de bronwaarde bewaart.
Een ontbrekende waarde is geen standaardgeval. “Leeg” kan onbekend, niet van toepassing, nog niet ingevuld of fout geïmporteerd betekenen. Maak dus per betekenis een regel: bewaren als onbekend, uitsluiten met teller, aanvullen uit een geautoriseerde bron of terugleggen bij de bron-eigenaar. Vervang niet stilzwijgend door nul. De datakwaliteitschecks geven de context die je nodig hebt om zo'n regel te toetsen.
Verwerk alleen velden die voor de vraag nodig zijn. Een opschoonstap hoeft geen naam, adres of vrije notitie te zien wanneer een interne recordcode genoeg is. Dit sluit aan bij de beginselen over doelbinding en minimale verwerking in artikel 5 AVG op EUR-Lex. De techniek van opschonen is geen grond om gegevens breder te gebruiken of langer te bewaren.
Synthetisch voorbeeld: regio's zonder bronverlies
Een fictieve export bevat de waarden “ Noord ”, “noord”, “NOORD” en “Onbekend” in een regiokolom. Maak een nieuwe kolom regio_schoon. Daarin worden de eerste drie vormen “Noord”; “Onbekend” blijft een aparte, zichtbare categorie. Bewaar daarnaast regio_bron. Tel vóór de stap 120 rijen en tel daarna opnieuw 120 rijen. Vergelijk vervolgens de som van de bedragen en het aantal unieke recordcodes. Alleen de schrijfwijze mag zijn gewijzigd, niet de populatie.
Schrijf de regel op als: “trim omringende spaties, standaardiseer hoofdlettergebruik, geen lege waarde aanvullen.” Noteer uitvoerder, datum en versie van de bron. Als je later ontdekt dat “NOORD” een interne afdeling was en geen regio, kun je het effect terugzoeken en de regel corrigeren. Zonder bronkolom of log zou die fout vrijwel niet te herstellen zijn.
Bij dubbele rijen bepaal je eerst de unieke combinatie. Twee gelijke regels kunnen twee echte gebeurtenissen zijn. Een echte dubbeling kun je pas verwijderen wanneer bijvoorbeeld recordcode, gebeurtenistype en tijdstip samen hetzelfde unieke event vertegenwoordigen. Controleer die beslissing ook in bronnen combineren en joinfouten, want een join kan dubbelingen veroorzaken die niet al in de bron stonden.
Validatie en terugdraaien
Na elke bewerking vergelijk je minimaal rijaantal, unieke sleutel, aantal ontbrekende waarden en relevant totaal met de vorige laag. Kies daarnaast enkele vooraf bepaalde voorbeelden en controleer ze terug in de bron. Een verandering die je niet kunt verklaren is een stop-signaal, geen afronding. Noteer ook onzekerheid: misschien is de datumindeling niet vast te stellen of ontbreekt een deel van de periode.
Bij een fout herstel je door terug te keren naar de onveranderde bronlaag, de bewerkingsregel aan te passen en alle volgende stappen opnieuw uit te voeren. Wijzig geen waarden handmatig in het eindrapport, want dan verdwijnt de reproduceerbaarheid. Bij twijfel publiceer je de KPI niet of markeer je hem als voorlopig. De lokale CSV-controle kan structuursignalen geven, maar vervangt deze inhoudelijke validatie niet.
Veelgemaakte fouten
- Een bronkolom overschrijven. Maak een nieuwe kolom voor de gestandaardiseerde waarde.
- Twee betekenissen onder één label vegen. Behoud onbekend, niet van toepassing en leeg waar nodig.
- Handmatige correcties niet loggen. Dan kan niemand dezelfde uitkomst reconstrueren.
- Alle uitschieters verwijderen. Een opvallende waarde kan juist een echte gebeurtenis zijn.
- Na een wijziging alleen de grafiek bekijken. Controleer ook sleutels, rijen en totalen.
Ga na de herstelstap verder met KPI's en definities of leg de volledige route vast in een analyseplan. Voor een beoordeling volstaat een synthetische structuur zonder bronwaarden.
Officiële bronnen
Veelgestelde vragen
- Moet ik de originele dataset aanpassen?
- Nee. Bewaar de bron onveranderd en maak een aparte, reproduceerbare bewerkingsstap.
- Mag ik lege waarden vervangen?
- Alleen wanneer de betekenis van leeg is vastgesteld en de vervangregel bij de analysevraag past.
- Hoe verwijder ik dubbele rijen?
- Definieer eerst welke kolommen samen een uniek record vormen en controleer uitzonderingen.
- Waarom zijn datums vaak een probleem?
- Tekst, tijdzones en verschillende dag-maandvolgordes kunnen dezelfde datum anders laten lijken.
- Hoe houd ik de bewerking controleerbaar?
- Leg per stap de regel, eigenaar, datum en aantallen voor en na vast.
Lees ook
Hulp nodig bij jouw situatie?
Kom je er niet uit? Stuur kort wat context, wat je wilt bereiken en waar je vastloopt. Dan kijken we samen naar een passende volgende stap.