Cik labi pazīstat Linux/Docker?
Data Engineer
Kas ir shuffle Spark un kam tas ir nepieciešams?
Kā pārvaldīt shuffle Spark (particionēšanu, broadcast join utt.)?
Ko sniedz Iceberg formāts salīdzinājumā ar parasto Parquet?
Vai jūs pazīstat kopējo tabulu izteiksmes (CTE)? Sniedziet piemēru izmantošanai.
Kā Linux atrast apakšvirkni konkrētā log faila kolonnā (piemēram, datumu trešajā kolonnā)?
Kas ir statistika datu bāzu pārvaldības sistēmās un vaicājumu optimizācijā?
[vārds] stāstīja par savu pieredzi ar dažādām datu bāzu pārvaldības sistēmām, cik dziļi viņam nācās iesaistīties optimizācijā un iekšējās detaļās.
Detalizēti algoritmu, kā no avota iegūt inkrementu, lai nekas netiktu zaudēts, mainot ielādes frekvenci.
Kā organizēt vienas un tā paša ziņojuma lasīšanu no Kafka vairākām dažādām patērētājiem (fan-out)?
Kā risināt problēmu, kad lasīšanas process var redzēt tabulas starpposmu (nesaskaņotu stāvokli) daudzposmu ETL (delete+insert) laikā Iceberg?
Kas ir "mirusi kopa" (dead tuple)?
Kā salīdzināt sākotnējo („dzīvo”) un mērķa tabulu, ja avots pastāvīgi mainās?
Kas ir Spark JDBC un kā efektīvi ielādēt lielu tabulu caur to?
Kā ir saistītas Spark sadalījumi un sadalījumi tabulās (piemēram, Iceberg)?
Pastāstiet par labākajām praksēm indeksu izmantošanā – kad un cik bieži tos izmantot.
Kas ir transakciju žurnāls (WAL) datu bāzes pārvaldības sistēmā un kam tas ir nepieciešams?
Vai tika izmantota ierakstu hash salīdzināšanas metode, lai aprēķinātu starpību starp avotu un mērķa tabulu?
Kā noteikt datu izliekumu (data skew) Spark?
Kādam mērķim ir cache un persist Spark?