Data Engineer
Heeft u gewerkt met datavitrines (DWH-laag)?
Waarom overweeg je momenteel vacatures?
Heeft u gewerkt met parameters en hints die het gebruik van Broadcast Join bepalen?
Hoe maakte je meestal het schema van de database — deed je dat handmatig in de database, bewaarde je de scripts ergens, of gebruikte je Liquibase? Wat was het proces?
Is er misschien ervaring op het gebied van Data Science — werken met modellen, statistieken?
Welke fysieke strategieën voor het uitvoeren van join kent u?
Hoe garandeer je de wereldwijde uniciteit van de primaire sleutel in PostgreSQL bij sharding?
Welke fysieke JOIN-mechanisme wordt gebruikt bij het samenvoegen van de transactietabel met de kalender tabel op basis van de ongelijkheid (datum <= datum)?
Hoe werkt de Nested Loop Join en wat is de algoritmische complexiteit ervan? Wat is de complexiteit van alle drie de algoritmes?
Wat heb je nog meer in Python geschreven naast Airflow DAG?
Welke fysieke JOIN-algoritmen werken in databases?
Vertel me over je Python-niveau: wat je hebt gebruikt, hoe diep je objectgeoriënteerd programmeren kent
Hoe werkt Hash Join?
Wat is shuffle in Spark en waarom is het belangrijk om het te minimaliseren?
Wat kun je me vertellen over SOAP API?
Welke datakwaliteitscontroles werden uitgevoerd in Data Vault?
In welke gevallen kan een Gematerialiseerde Weergave in ClickHouse gegevens missen of juist dupliceren?
Hoe bepaalt Spark dat een tabel klein genoeg is voor een broadcast join (bovenlimiet)?
Heeft u unittests geschreven? Heeft u die ervaring?
Hoe onderscheid je technische en zakelijke datavalidaties, en wie moet de eisen daarvoor opstellen?