Een Belgische overheidsorganisatie binnen de defensiesector bouwt een on-premise Data Exchange Platform om veilig en soeverein datagebruik over meerdere domeinen heen te ondersteunen. Als Senior Data Engineer in Brussel ontwikkelt u Python- en SQL-pipelines met Dagster, dbt en Delta Lake, van de ingestie van heterogene bronnen tot dataproducten binnen een duidelijk governancekader en de ontsluiting ervan voor BI. Het programma wordt uitgevoerd door een klein team binnen de Belgische defensiesector, in samenwerking met een Data Architect, Solution Architect en BI Developer.
De missie
Het platform draait on-premise omdat de organisatie strikte controles vereist op het vlak van beveiliging, datagovernance en datasoevereiniteit. De lakehouse-architectuur steunt op Bronze-, Silver- en Gold-lagen, Delta Lake-tabellen, ACID-transacties en time travel, waarbij dbt en DuckDB instaan voor analytische transformaties. De bronnen omvatten bestanden, API’s en relationele databases, met incrementele en streaming-ingestie binnen meerdere domeinen.
U werkt binnen de data engineering-stream, samen met de Data Architect, Solution Architect en BI Developer. Uw werk omvat betrouwbare ingestie, transformatie, orkestratie, metadatabeheer en de ontsluiting van de Gold-laag voor rapporteringstools. U implementeert Dagster-assets, monitort productieruns, handelt fouten af en automatiseert alerts zodat de pipelines traceerbaar blijven. De functie vormt de verbinding tussen de kwaliteit van productiepipelines, governance-documenten, technische beslissingen en bruikbare datasets voor gebruikers met gecontroleerde toegang.
Uw verantwoordelijkheden
- Idempotente data-acquisitiepipelines ontwerpen en opleveren met ETL- en ELT-patronen voor bestanden, API’s en relationele databases, inclusief Kafka-gebaseerde streamingflows.
- Bronze-, Silver- en Gold-transformaties bouwen met dbt en daarbij SCD2-, upsert- en append-only-patronen toepassen om een correcte datahistoriek te bewaren.
- Delta Lake-tabellen en exports onderhouden, met behoud van ACID-consistentie en betrouwbare toegang tot dataproducten binnen het governancekader.
- Dagster-assets orkestreren, productieruns monitoren, fouten afhandelen en alerts automatiseren zodat de pipelines traceerbaar blijven.
- Technische en businessmetadata publiceren in DataHub, end-to-end lineage onderhouden en Gold-datasets ontsluiten voor rapportering in Power BI.
Uw profiel
Essentiële vaardigheden
- Python, SQL, Pandas en Apache Spark vanuit het perspectief van data engineering toepassen om productiepipelines te bouwen en problemen op te lossen.
- Aantoonbare hands-on ervaring met dbt-core hebben voor models, snapshots, macros, tests en profiles.
- Data-architectuur, lakehouse- en datalakepatronen begrijpen, met inbegrip van het ontwerp van Bronze-, Silver- en Gold-lagen.
- Kafka gebruiken voor event-driven ingestie en werken met relationele platformen zoals MSSQL en PostgreSQL, met inbegrip van geavanceerde SQL en CDC.
- Werken met Delta Lake-functionaliteiten, waaronder ACID-transacties, time travel, OPTIMIZE en VACUUM.
- Dagster of gelijkwaardige orkestratieconcepten gebruiken en vlot werken in Linux-, OpenShift- en PowerShell-ontwikkelomgevingen.
- Praktijken voor datagovernance en metadatabeheer toepassen met DataHub of gelijkwaardige tools, met inbegrip van lineage en technische documentatie.
- Technische beslissingen duidelijk communiceren, zelfstandig werken aan complexe pipelines over meerdere domeinen heen en doeltreffend samenwerken met collega’s uit architectuur en BI.
- De Belgische nationaliteit hebben, wat vereist is voor dit programma.