Data Engineer
Kaip Spark nustato, kad lentelė yra pakankamai 'maža' broadcast jungčiai (viršutinė riba)?
Kas yra indeksas? Kuo skiriasi klasterizuotas indeksas nuo neklausterizuoto?
## mados užduotis # Yra skaičių sąrašas. Parašykite funkciją, kuri suranda šio sąrašo modą. # find_mode([1, 2, 3, 3, 4, 5]) #> 3
Ką grąžins funkcija find_mode sąrašui [1, 2, 3, 3, 4, 5]? Paaiškink žingsnis po žingsnio.
Ar dirbote su duomenų vitrinomis (DWH sluoksnis)?
Kodėl šiuo metu svarstote darbo pasiūlymus?
Ar dirbote su parametrais ir hints, kurie nustato Broadcast Join naudojimą?
Kaip paprastai kūrei duomenų bazės schemą — ar tai darydavai rankomis tiesiai duomenų bazėje, ar saugodavai skriptus kažkur, ar visai naudoji Liquibase? Koks buvo procesas?
Galbūt turite patirties duomenų mokslo srityje — darbą su modeliais, statistika?
Kokias fizines jungimo vykdymo strategijas žinote?
Kaip užtikrinti pagrindinio rakto pasaulinį unikalumą PostgreSQL naudojant sharding?
Koks fizinis JOIN mechanizmas bus naudojamas jungiant sandorių lentelę su kalendoriaus lentele pagal nelygybės sąlygą (data <= data)?
Kaip veikia Nested Loop Join ir koks yra jo algoritminis sudėtingumas? Kokia yra visų trijų algoritmų sudėtingumas?
Ką dar parašei Python kalba, išskyrus Airflow DAG?
Kokie fiziniai JOIN algoritmai veikia duomenų bazėse?
Papaskink apie savo Python lygį: ką naudojote, kaip giliai žinote objektinio programavimo
Kada gali duoti atsiliepimą ir ar turi pasiūlymų rankoje?
Kaip veikia Hash Join?
Kaip optimizavo lenteles ir užklausas: dalys, indeksai, pasirinkimo logika?
Kokio tipo tipizacija naudojama Python: statinė ar dinaminė?