Data Engineer
Met welke databases hebt u gewerkt? Hoe werkt MongoDB en hoe schaalt het?
Hoe hebben jullie vastgesteld dat de invoer al bestaat en niet opnieuw hoeft te worden opgeslagen?
NULL plus 5 — hoeveel wordt dat?
Kan je in Spark parallel gegevens lezen uit één Parquet-bestand, of alleen met één kern in een taak?
Wat is RDD in Apache Spark en hoe verschilt het van andere abstracties van Spark?
Heb je statistische controles gedaan?
Kun je een decorator maken en toepassen zonder de @-syntax?
Als de planning van de DAG @daily is, hoe laat wordt deze dan daadwerkelijk gestart?
Wat zijn decorators in Python?
Waarvoor dienen de "mappen"/voorvoegsels in S3 naast het gemak?
Hoe is de parallelle uitloading van een grote tabel uit PostgreSQL naar Spark technisch gerealiseerd in het geval [context]?
Hoe implementeer je een ongelijke verdeling van gegevens in de vitrine: 50% op de eerste en 25% op de andere twee?
Hoe om te gaan met gegevensonzekerheid?
Hoe zijn de tabellen in de cluster gemaakt en hoe is het probleem opgelost toen er vanwege ZooKeeper een replica ontbrak op een shard?
Hoe hield je de kwaliteit van de gegevens bij?
Uit welke fasen bestaat een transactie?
Waarom heeft u besloten de ranking in een aparte CTE te plaatsen? Waarom kon het niet direct in de eerste CTE worden gebruikt?
Hoe werk je met partitions via coalesce en repartition?
Hoe open en sluit je correct bestanden in Python met behulp van de contextmanager?
Bent u bekend met ReplicatedQueue? Heeft u ervaring met het werken ermee?