Data Engineer
გიტთან მუშაობდი? რა ინახავდი გიტში?
განმარტეთ ინკრემენტის დაჭერის ალგორითმი წყაროდან, რათა არაფერი დაკარგოს დატვირთვის სიხშირის ცვლილებისას.
პროექტის უწყვეტი მუშაობის უზრუნველსაყოფად, მინიმალური რისკით ყველა ფილიალში უსაფრთხოების ხარვეზის აღმოფხვრის რა სტრატეგია იქნება ეფექტური? - პრობლემური კომიტის და ყველა იმ კომიტის სერიის შექმნა, რომლებიც ნაწილობრივ გამოსწორდა, შემდეგ სრული გამოსწორებით ახალი კომიტის შექმნა - hotfix-ფილიალის შექმნა პრობლემურ კომიტამდე წერტილიდან, გამოსწორებების განხორციელება და ამ ფილიალის გაერთიანება ყველა დაზარალებულ ფილიალთან - ერთიანი გამოსწორების კომიტის შექმნა git revert abc123-ის გამოყენებით მთავარი ფილიალში და შემდეგ ამ კომიტის cherry-pick-ი ყველა გამოშვების ფილიალზე - git bisect-ის გამოყენება პრობლემური კოდის ზუსტი განსაზღვრებისთვის, პაჩის შექმნა და მისი გამოყენება ყველა ფილიალში git am-ის საშუალებით - git rebase -i-ის გამოყენება პრობლემური კომიტის რედაქტირებისთვის თითოეულ ფილიალში, შემდეგ force-push-ის (force-push) განხორციელება
გააზიარეთ Greenplum და ClickHouse-ის ინდექსებზე
Data Vault-ში Bridge და PIT ცხრილებს იყენებდით? მიცით მაგალითი და ახსენით მათი დანიშნულება.
რა შემთხვევებში შეიძლება Materialized View-მა ClickHouse-ში მონაცემები გამოტოვოს ან, პირიქით, დუბლიოროდ გახდეს?
რა არის ნორმალიზაცია და დენორმალიზაცია, როდის არის საჭირო?
რა არის Spark-ის UDF-ების უარყოფითი მხარე და რა არის მათი მინუსი?
PostgreSQL-ში რა ინდექსებს იცნობთ?
თუ გსურთ შეცვალოთ ფილიალი, რომელსაც მიუთითებს სუბმოდული, რა უნდა გააკეთოთ? - სუბმოდულები არ უჭერენ მხარს ფილიალების შეცვლას - წაშალეთ სუბმოდული და დაამატეთ იგი ახალი ფილიალით - შეცვალეთ ფილიალი სუბმოდულში და შეასრულეთ კომიტი მთავარ რეპოზიტორიაში - შეასრულეთ git checkout სასურველ ფილიალზე სუბმოდულში და დარეგისტრირეთ ცვლილებები მთავარ რეპოზიტორიაში - შეასრულეთ git submodule update --branch და მიუთითეთ ახალი ფილიალი
რომელ SQL შეკითხვებს წერ: მარტივი შემოწმებები თუ რთული სკრიპტები ვიტრინებისთვის?
როგორ წაშალოთ სუბმოდული და დაკავშირებული ფაილები პროექტიდან? git submodule remove <სუბმოდულის-გზა> git rm --cached <სუბმოდულის-გზა>; წაშალეთ .gitmodules-ის სექცია; git commit git clean --submodules <გზა> git submodule delete <გზა>
რა არის CTE (საერთო მაგიდის გამოთქმა)?
რამდენად რეალისტურია კომპანიის გეგმები მონაცემთა შეგროვებისა, ნორმალიზებისა და ანალიზის სისტემის შექმნის შესახებ?
Hive-ში ნელი ანალიტიკური მოთხოვნა იყო. როგორ გავიგოთ, რა მოხდა მასთან და როგორ გავასწოროთ?
CROSS JOIN რა არის? მუშაობდი მასთან?
Python-ში == და is-ის განსხვავება რა არის?
რა არის ტრასირება? გაქვთ მასთან მუშაობის გამოცდილება?
SQL-ში რა ტიპის JOIN-ები არსებობს (ლოგიკური და ფიზიკური)?
ფიტნეს კლუბების ვიზიტების ანალიზი თქვენ მუშაობთ ფიტნეს კლუბების ქსელში ანალიტიკოსად. გაქვთ ინფორმაცია მომხმარებლების ვიზიტებზე და მათ მიერ შეძენილ აბონემენტებზე. საჭიროა აბონემენტების ეფექტიანობის ანალიზი. გაანგარიშეთ თითოეული აბონემენტის ტიპისთვის: • ამ ტიპის აბონემენტს გამოყენებული მომხმარებლების საერთო რაოდენობა. მოიცილეთ მხოლოდ უნიკალური user_id-ები; • ამ აბონემენტთან დაკავშირებული ვიზიტების საერთო რაოდენობა. მოიცილეთ ყველა ვიზიტი ამ აბონემენტით დაკავშირებული მომხმარებლების; • ამ აბონემენტის მომხმარებლების წილი საერთო მომხმარებელთა რაოდენობაში პროცენტებში (ერთი ათწილადამდე მორგებული). მომხმარებლების წილის გამოთვლისთვის გამოიყენეთ ამ აბონემენტის მომხმარებლების რაოდენობის და საერთო უნიკალური მომხმარებლების რაოდენობის შეფარდება. ყოველ მომხმარებელს შეუძლია ჰქონდეს მხოლოდ ერთი აბონემენტი. შედეგი sort-ით დაალაგეთ აბონემენტის ტიპის მიხედვით ალფაბეტურ წესრიგში. შესავალი ფორმატი ცხრილი memberships: • membership_id (int) — უნიკალური აბონემენტის ID • user_id (int) — მომხმარებლის უნიკალური ID • membership_type (text) — აბონემენტის ტიპი ცხრილი visits: