Data Engineer
Vai jums ir pieredze dokumentācijas rakstīšanā?
Kāda ir tava pieredze un izpratne par piltuvveida būvniecību vitrīnu aprēķināšanai (datu apstrāde)?
Ja mēs uzstādām filtrēšanas nosacījumu pēc darījuma datuma WHERE (pēc LEFT JOIN), vai tas ierobežos rezultātu pirmajā tabulā (klientiem)?
Vai jums ir pieredze pipeline konfigurēšanā CI/CD, piemēram, GitLab?
Ar straumēšanu Iceberg darbojās, dzirdēji? Tā ir atkritumu failu glabātuve.
Kā samazināt DataFrame atmiņas patēriņu Pandas?
Kā darbojas Hash Join?
Kā pārvaldīt shuffle Spark (particionēšanu, broadcast join utt.)?
Kuras izseko rīkus izmantojāt? Spring Boot 2 un Spring Boot 3?
Vai tu pazīsti OLAP kubus? Kad mēs strādājam ar daudzdimensionāliem datiem, līdzīgiem Excel pivot tabulai, bet ātrākai mijiedarbībai ar lieliem datu apjomiem.
Vai jūs strādājāt ar inkrementālām un pilnām ielādēm? Kā cīnījāties ar dublikātiem?
Kā Git Flow iesaka oficiāli formalizēt jaunu lietojumprogrammas izlaišanu? - Izveidojot jaunu issue-šakni - Izveidojot hotfix-šakni no master - Izveidojot atsevišķu release-šakni no develop - Tieši veicot commit uz master - Tieši apvienojot master ar develop
Kā Spark nosaka, ka tabula ir pietiekami 'maza' broadcast join (augšējā robeža)?
Kāda ir atšķirība starp virtualizāciju un konteinerizāciju (Docker)?
Mums ir ORDER BY pēc pasūtījumu skaita, un ir divi pasūtījumi ar 5, vēl divi ar 3. Kā rīkosies RANK() un DENSE_RANK()?
Kā atšķir tehnikas un biznesa datu pārbaudes, un kas būtu jānosaka to prasībām?
Kāda ir atšķirība starp WHERE un HAVING SQL?
Jūs veidojat audit_logs tabulu, kurā jāglabā datums un precīzs laiks ar laika joslu. Kurš datu tips ir vispiemērotākais? laika josla ar laika zonu intervals timestamp ar laika joslu diena timestamp bez laika joslas
Pastāstiet par sevi, kur strādājāt, ar ko nodarbojāties, kādas bija interesantas uzdevumi un neveiksmes.
Pastāstiet par labākajām praksēm indeksu izmantošanā – kad un cik bieži tos izmantot.