დამატებითი მონაცემების გამოფენის (DWH ფენა) მუშაობდით?
Data Engineer
რამდენი ანაზღაურებას ელოდები?
T1 (10 სვეტი) და T2 (5 სვეტი) ცხრილებია, ორივეს აქვს ID ველი. რამდენი სვეტი შეიძლება იყოს მაქსიმუმ და მინიმუმ ამ ცხრილების INNER JOIN და LEFT JOIN-ის დროს?
გააზიარეთ თქვენი მონაცემების ხარისხთან დაკავშირებული რამდენიმე მნიშვნელოვანი დავალება.
თუ ტრანზაქციებს მომხმარებლებთან ერთად client_id და date_start (BETWEEN-ის გარეშე) შეერთებთ, რა მიიღება შედეგში?
რატომ ეძებ ახლა ახალი სამუშაო ადგილი, გსურს სამუშაოს შეცვლა?
რა ტიპის JOIN-ები გეცოდინებათ? (ლოგიკური)
CROSS JOIN რა არის? მუშაობდი მასთან?
Spark-ში ერთდროულად შესაძლებელია ერთ Parquet ფაილიდან მონაცემების წაკითხვა, თუ მხოლოდ ერთი ბირთვით ერთ დავალებაში?
რა სარგებელი და ნაკლია ხაზოვანი და სვეტოვანი მონაცემთა ბაზების? რა უფრო ეფექტურია ჯგუფირებისა და აგრეგაციისთვის?
მითხარი შენზე — სამუშაო გამოცდილება, ტექნოლოგიების სტეკი
გთხოვთ, აღწეროთ ფანჯრის ფუნქციები მაქსიმალურად გაფართოებულ ფორმატში: რა საკვანძო სიტყვები გამოიყენება და თითოეული რა პასუხს აგებს.
თუ executor-ზე 10 ბირთვი არსებობს, რამდენი Tasks შესრულდება ერთდროულად ერთ დროს?
-- გაცემული ცხრილი numbers ერთ სვეტს, სახელწოდებით num (მთელ რიცხვები, რომლებიც შეიძლება განმეორდეს). -- დაწერეთ SQL სვეტები, რომლებიც ნაწილდებიან ორ სვეტად: -- even – წყვილი რიცხვები (მიმდევრობით ზრდად) -- odd – სიგრძე რიცხვები (მიმდევრობით ზრდად) -- რიცხვები უნდა განთავსდეს რიგით: პირველ რიგში – პირველი წყვილი და პირველი სიგრძე, -- მეორე რიგში – მეორე წყვილი და მეორე სიგრძე და ა.შ. -- თუ ერთ ჯგუფში მეტი რიცხვია, ვიდრე მეორე, არარსებული ადგილები უნდა იყოს NULL. -- თავდაპირველი ცხრილი -- num -- --------- -- [phone] -- სვეტების შედეგი -- even | odd -- -----|----- -- 2 | 1 -- 4 | 3 -- 6 | 5 -- 8 | 7 -- 10 | 9 -- NULL | 11 -- NULL | 11
გააზიარეთ თქვენი მონაცემების ხარისხის შესახებ გაგება — გაქვთ ამ სფეროში გამოცდილება?
როგორ მუშაობს Nested Loop Join და რა არის მისი ალგორითმული სირთულე? რა არის ყველა სამი ალგორითმის სირთულე?
რა არის ინდექსი? რა განსხვავებაა კლასტერული ინდექსისა და კლასტერული არქივის შორის?
რომელ ფიზიკურ JOIN-ებს იცნობთ?
მოკლედ ახსენით, როგორ არის მოწყობილი Spark-ის არქიტექტურა: რა კომპონენტები არსებობს და როგორ ურთიერთქმედებენ SQL-საკითხის შესრულების დროს.
რომელი მიმართულებით იქნებოდა საინტერესო განვითარდეს: витრინები, განვითარება, ანალიტიკა, იქნებ AI?