Data Engineer
Wat gebeurt er fysiek tijdens een INSERT, UPDATE en DELETE in Greenplum; waarom wordt de ruimte op de schijf niet vrijgegeven na een DELETE en waarin verschilt DELETE van TRUNCATE?
Waarom kunnen gegevens verloren gaan? Geef enkele redenen.
Vertel eens over jezelf: ervaring, taken, functies of prestaties waar je trots op bent.
Heb je ervaring met FastAPI?
Met welke Python-bibliotheken hebt u gewerkt?
Wat zijn lazy-operaties in Spark en waar zijn ze voor bedoeld?
In welke situatie kan zoeken in een woordenboek degraderen tot het slechtste geval?
Hoe hebben ze verbinding gemaakt met OpenMetadata en wat hebben ze ermee gedaan?
Wat is het verschil tussen ACID en de CAP-theorie?
Vergelijk de ETL- en ELT-aanpakken: wat is het verschil en wanneer wordt elk van hen toegepast?
Hoe werkten ze met 1C: haalden ze gegevens rechtstreeks uit de database, via een bus of op een andere manier?
Met welke databases hebt u gewerkt? Hoe werkt MongoDB en hoe schaalt het?
Hoe hebben jullie vastgesteld dat de invoer al bestaat en niet opnieuw hoeft te worden opgeslagen?
NULL plus 5 — hoeveel wordt dat?
Kan je in Spark parallel gegevens lezen uit één Parquet-bestand, of alleen met één kern in een taak?
Op welke velden vond de gegevenssamenvoeging plaats en hoe werden duplicaten in de vitrine verwijderd?
Wat weet je over spill in Spark?
Wat is RDD in Apache Spark en hoe verschilt het van andere abstracties van Spark?
Heb je statistische controles gedaan?
Wat zijn de risico's voor de datakwaliteit?