Data Engineer
Wat kun je me vertellen over SOAP API?
Wat is de variabele var, van welk type is deze?
Waar moet je op letten qua geheugen, snelheid en nauwkeurigheid bij het parseren van grote XML-bestanden?
Hoe las je precies Parquet?
Heeft u direct met Spark gewerkt? Wat is het nadeel ervan?
Aan welke Scala-projecten heb je eerder gewerkt? Deel specifieke taken en prestaties in deze technologie.
Hoe heb je de Airflow DAG en jobs geschreven: handmatig of met sjablonen?
Zijn er gevallen geweest van interactie met relationele databases?
Wat is semantische versiebeheer? Wanneer moet je major, minor, patch verhogen?
Welke magische methoden van Python moeten worden overwogen?
Met afhankelijkheden tussen jobs, tussen DAGs — gebruikte u sensoren zodat ze achter elkaar meerdere jobs konden starten?
Hoe organiseer je je projecten? Schrijf je een README of iets anders?
Wanneer is ThreadPoolExecutor geschikt?
Met Kafka is niets moeilijk, het belangrijkste is het verwerken van gegevens — welke nuances moeten in overweging worden genomen?
Had je ad-hoc taken ondanks een duidelijke specificatie, en hoe sta je tegenover ad-hoc verzoeken en prioriteitswijzigingen?
Heeft u ooit met decorators in Python gewerkt? Wat zijn ze en waar worden ze toegepast?
Hoe hebt u optimalisatieproblemen opgelost wanneer een query lang duurt en een volledige scan uitvoert? Hoe zou u een nieuwe dergelijke taak aanpakken?
Hoe zijn Spark-partities gerelateerd aan partities in tabellen (bijvoorbeeld in Iceberg)?
Wanneer kun je de CSV-formaatfamilie gebruiken?
Hoe pas je een functie toe op alle rijen of elementen in pandas?