Hoe zou je een schaalbare gegevensladen ontwerpen vanuit meerdere REST API's: van gegevensverzameling tot S3, met een interface voor een analist?
Data Engineer
Wat is procedureel SQL?
Vertel ons over jezelf en je ervaring in data engineering.
Er zijn 101 objecten: 100 nullen en 1 één. Na sortering op score komen eerst 50 nullen, dan één, en daarna nog eens 50 nullen. Wat zijn de ROC AUC en de vorm van de ROC-curve?
Wat zijn de nadelen van indexen naast de ruimte die ze innemen?
In gradient boosting is al een samenstelling van N basisalgoritmes gebouwd. Wat zal het doel zijn voor de nieuwe, N+1-de algoritme?
Waarom zijn luie evaluaties nuttig?
Wat is data spill in Spark en hoe te voorkomen als resources niet eenvoudig kunnen worden toegevoegd?
Hoe zou je high-load datatransformaties aanpakken?
Hoe verschillen de Spark-startmodi: cluster, client en local?
Wat zijn de voor- en nadelen van het implementeren van een API-loader als een aangepaste Airflow-operator/hook in vergelijking met een aparte bibliotheek of containerservice?
2. Er is een tabel t die de som van klanttransacties per dag vermeldt: - Schrijf een query die voor elke rij de transacties van de klant voor de huidige en de vorige kalenderdag toont De uiteindelijke tabel staat hieronder:
Wat zijn luie evaluaties en hoe begrijp je ze?
Welke typische taken heb je opgelost in Airflow?
Datum, bestelnummer, bedrag select date, sum(amount) as sum_amount from t group by date having sum(amount) > 1000000 order by sum_amount desc limit 3
Wat zijn stermodellen en Data Vault?
Vertel ons over jezelf: waar heb je laatst gewerkt, wat deed je, wat zoek je en waarom?
Waar bevinden Driver en Executors zich in de cluster-modus en waarom wordt het in productie gebruikt?
Waar precies treedt de gradient op in het gradient boosting algoritme als de basisalgoritme een eenvoudige beslissingsboom is?
Waaruit bestaan Greenplum en Hadoop HDFS componenten?