Data Engineer
Cum determină Spark că un tabel este suficient de 'mic' pentru un join de tip broadcast (limita superioară)?
Ce este un index? Care este diferența dintre un index clusterizat și unul neclusterizat?
## problemă despre moda # Există o listă de numere. Scrieți o funcție care găsește moda acestei liste. # find_mode([1, 2, 3, 3, 4, 5]) #> 3
Ce va returna funcția find_mode pentru lista [1, 2, 3, 3, 4, 5]? Explică pas cu pas.
Ai lucrat cu vitrine de date (stratul DWH)?
De ce iei în considerare oferte de muncă în acest moment?
Ați lucrat cu parametri și hints care determină utilizarea Broadcast Join?
Cum obișnuiai să proiectezi schema bazei de date — o făceai manual în bază sau stocai scripturile undeva, sau foloseai Liquibase, care era procesul?
A fost poate experiență în domeniul Data Science — lucru cu modele, statistici?
Ce strategii fizice de executare a join-ului cunoașteți?
Cum se asigură unicitatea globală a cheii primare în PostgreSQL în timpul sharding-ului?
Ce mecanism fizic de JOIN va fi utilizat la unirea tabelului de tranzacții cu tabelul de calendar după condiția de inegalitate (data <= data)?
Cum funcționează Join-ul cu buclă imbricată și care este complexitatea sa algoritmică? Care este complexitatea celor trei algoritmi?
Ce altceva ai scris în Python în afară de Airflow DAG?
Ce algoritmi fizici JOIN funcționează în bazele de date?
Vorbește-mi despre nivelul tău de Python: ce ai folosit, cât de profund cunoști programarea orientată pe obiecte
Când poți oferi feedback și ai oferte în mână?
Cum funcționează Hash Join?
Cum au fost optimizate tabelele și interogările: partiții, indecși, logica de selecție?
Ce tip de tipizare este folosit în Python: statică sau dinamică?