Kui hästi te tunnete Linux/Dockerit?
Data Engineer
Mis on shuffle Sparkis ja milleks see vajalik on?
Kuidas hallata shuffle Sparkis (partitsioneerimine, broadcast join jne.)?
Mida toob Iceberg formaat tavapärase Parquetiga võrreldes?
Kas tead üldtabeli avaldisi (CTE)? To kasutamise näide.
Kuidas Linuxis leida logifaili konkreetse veeru alamtekst (näiteks kuupäev kolmandas veerus)?
Mis on statistika andmebaaside haldusüsteemide ja päringute optimeerimise kontekstis?
[nimi] rääkis oma kogemusest erinevate andmebaasi haldusüsteemidega, kui sügavalt tuli süveneda optimeerimisse ja sisemisse detailidesse.
Kirjeldage üksikasjalikult inkremente püüdmise algoritmi allikast, et laadimissageduse muutmisel midagi ei kaotataks.
Kuidas korraldada ühe ja sama sõnumi lugemine Kafka-st mitme erineva tarbija poolt (fan-out)?
Kuidas lahendada probleemi, kui lugemisprotsess võib näha vahe- (ebakõla) olekut tabelis mitmeastmelise ETL (delete+insert) ajal Icebergis?
Mis on "surnud tükeldaja" (dead tuple)?
Kuidas võrrelda algset („elavat”) ja sihttabelit, kui allikas pidevalt muutub?
Kuidas on seotud Spark'i ja tabelite (näiteks Iceberg) partitsioonid?
Rääkige indeksite kasutamise parimatest praktikatest – millal ja kui sageli neid kasutada.
Mis on Spark JDBC ja kuidas tõhusalt laadida suuret tabel läbi selle?
Mis on tehingute logi (WAL) andmebaasi haldussüsteemis ja milleks see on vajalik?
Kuidas tuvastada andmete kaldu (data skew) Sparkis?
Kas kasutati kirjehashide võrdlusmeetodit, et arvutada välja allika ja sihttabeli vahe?
Milleks on Sparkis kasu ja persist vajalik?