Wat vroeger ETL heette (extract, transform, load) is voor de meeste organisaties ELT geworden: data eerst binnenhalen in een warehouse en daarna transformeren met SQL. Dat klinkt als een detail, maar het scheelt enorm in onderhoud. De zwaarte zit niet langer in zelfgeschreven code, maar in goede afspraken over lagen, tests en versiebeheer. Voor het mkb en de mid-market is dat vrijwel altijd de verstandigste route.
Hoe wij uw pipeline opzetten
Het binnenhalen van data uit standaardsystemen doen we met tools als Fivetran of Airbyte. Die hebben kant-en-klare connectors voor honderden bronnen, dus daar hoeft niemand code voor te schrijven. Het transformeren gebeurt in dbt: alle logica in SQL, in versiebeheer en met tests, zodat een wijziging niet stilletjes iets anders kapotmaakt. Het inplannen en bewaken van de runs regelen we met Airflow, Dagster of dbt Cloud zelf.
De data zelf zetten we in lagen op. Onderaan een ruwe laag die één op één gelijk is aan de bron, zodat u altijd kunt terugkijken. Daarboven een laag waarin we types, namen en dubbelingen opschonen. En bovenaan de modellen waar uw rapportages op draaien. Op elke laag staan tests op zaken als lege velden, dubbele sleutels en onverwachte waarden, en we maken zichtbaar waar elke tabel vandaan komt. Zo blijft het voor uw eigen team te volgen.
Wanneer maatwerk nodig is
Niet alles past in standaardtooling. Voor systemen die op uw eigen servers draaien en geen connector hebben, schrijven we gericht maatwerk. Datzelfde geldt voor echte realtime-stromen via Kafka of Kinesis en voor transformaties waar machine learning bij komt kijken. In de meeste mid-market situaties is dat maatwerk minder dan een vijfde van het werk. We zetten het alleen in waar het echt iets oplost, niet omdat het kan.
Wat het kost en hoe lang het duurt
Een eerlijk antwoord op de prijs hangt af van drie dingen: hoeveel bronnen u koppelt, hoe vaak de data moet verversen en hoe ingewikkeld de transformaties zijn. Een handvol standaardbronnen die eens per dag binnenkomen is een ander verhaal dan vijftien systemen met realtime-eisen. Daarom plakken we hier geen bedrag op. Wel maken we het snel concreet: na één gesprek over uw bronnen en wensen krijgt u een vaste prijs en een planning, geen open einde.
Qua doorlooptijd ziet u sneller resultaat dan veel mensen denken. De eerste bronnen gekoppeld en uw belangrijkste rapportages gemodelleerd staat doorgaans binnen zes tot twaalf weken. Daarna breiden we per onderdeel uit, zodat u onderweg al waarde ziet in plaats van pas aan het eind.
Waar het vaak misgaat
De meeste vastgelopen pipelines hebben dezelfde oorzaken. Losse scripts in productie zonder orchestratie, die omvallen zodra een bron verandert en die niemand meer durft aan te raken. dbt zonder tests, waardoor u precies de datafouten terugkrijgt die u wilde oplossen. Realtime streaming opgetuigd voor cijfers die prima eens per dag mochten landen. En pipelines waarin niet is vastgelegd waar data vandaan komt, zodat na anderhalf jaar niemand het meer overziet. Wij bouwen tests en herkomst vanaf het begin in, zodat uw team het later zelf kan beheren.
Klaar om te bouwen?
Beschrijf in een korte mail hoeveel bronnen u heeft, hoe vaak de data moet verversen en hoe ingewikkeld de transformaties zijn. U spreekt meteen met de senior data consultant die uw pipeline zou bouwen en hoort binnen een werkdag waar u aan toe bent.
Verwant: Freelance data consultant, dbt implementatie aanpak, Fivetran of Airbyte implementatie.