Cum determină Spark că un tabel este suficient de 'mic' pentru un join de tip broadcast (limita superioară)?
Data Engineer
Ce mecanism fizic de JOIN va fi utilizat la unirea tabelului de tranzacții cu tabelul de calendar după condiția de inegalitate (data <= data)?
Ce format de lucru îți este mai convenabil — birou, hibrid sau de la distanță? Avem două birouri, pe Kutuzovsky și Tula.
Ai lucrat vreodată cu optimizatorul AQE (Executarea Interogării Adaptative) în Spark? Știi cum funcționează?
Și dacă avem nevoie de toți clienții, chiar dacă nu au avut tranzacții în acea dată, cum îi afișăm?
Cum sunt orchestrate lansările în DBT? Folosiți Airflow?
Ce tipuri de JOIN există în SQL (logice) și în ce diferă?
Te rog, povestește-mi despre experiența ta din ultimul an: ce echipă, ce sarcini, ce rol și care a fost cea mai interesantă sarcină.
Ce tipuri de JOIN-uri fizice există în Spark?