Hansı fiziki JOIN-ləri bilirsiniz?
Data Engineer
Spark arxitekturasının ümumi quruluşunu izah edin: hansı komponentlər mövcuddur və onlar SQL sorğusunun icrası zamanı necə qarşılıqlı əlaqədədirlər.
Partitionlama nədir? Sharding nədir? Replikasiya nədir?
Əgər WHERE (soldan JOIN-dan sonra) əməliyyat tarixi üçün filtr şərti qoysaq, bu ilk cədvəldə (müştərilər) nəticəni məhdudlaşdırar mı?
Parquet fayl strukturunda Sətir Qrupunun vəzifəsi nədir?
-- t1 -- num --------- -- 1 -- 2 2 null null 4 -- t2 -- num --------- -- [telefon] null null 5 SEÇ a.num Kimi a_num, b.num Kimi b_num t1-dən a SOL JOIN t2 b ON a.num = b.num;
SELECT client_id, ФИО, SUM(suma) AS total_amount FROM clients JOIN transactions ON clients.client_id = transactions.client_id WHERE дата = '2025-05-01' GROUP BY client_id, ФИО;
find_mode funksiyası [1, 2, 3, 3, 4, 5] siyahısı üçün nə qaytaracaq? Addım-addım izah et.
Partitioning və sharding arasındakı fərq nədir?
Parquet saxlama formatı ilə CSV arasındakı fərq nədir?
## moda haqqında sual # Rəqəmlər siyahısı var. Bu siyahının modunu tapan funksiya yazın. # find_mode([1, 2, 3, 3, 4, 5]) #> 3
Mənə sistem analitiki kimi harada işlədiyinizi və hansı vəzifələri yerinə yetirdiyinizi danışın.
Məlumatların tarixinin saxlanma metodlarını (növlərini) bilirsinizmi? Cədvəllərdə tarix necə toplanır?
Spark-də hansı fiziki JOIN növləri mövcuddur?
Hər müştəri üçün yalnız başlanğıc tarixi məlum olduqda, son tam adını necə çıxarmaq olar (son tarix məlum deyil)?
Məlumatların keyfiyyət yoxlamalarını özünüz həyata keçirirdiniz, yoxsa tələblər biznes/tələblərdən gəlirdi?
Əməliyyatlar cədvəli ilə təqvim cədvəlini qeyri-bərabərlik şərti ilə (tarix <= tarix) birləşdirərkən hansı fiziki JOIN mexanizmi istifadə olunacaq?
Pəncərə funksiyasının sərhədlərində UNBOUNDED PRECEDING nə deməkdir?
İş formatı sizin üçün daha rahatdır — ofis, hibrid və ya uzaqdan? İki ofisimiz var, Kutuzovsky və Tula.
Spark-də AQE (Uyğun Sorğu İcrası) optimizatoru ilə işlədinizmi? Onun necə işlədiyini bilirsinizmi?