Data Engineer
სად შეიძლება ნახოთ Airflow-ში დავალებების ლოგები?
CREATE TABLE orders ( driver_id varchar, city varchar, order_id varchar ); -- თითოეულ ქალაქში შეკვეთების რაოდენობით საუკეთესო 10 მძღოლი
მოცემულია ორი ცხრილი t1 და t2. დავალებაა ჩამოთვალოთ ყველა სახის join, რომელსაც იცნობთ, და შედეგი სვეტიდან select * from t1 <join> t2 on t1.t = t2.t თითოეულ მათგანს.
სად მუშაობს მონაცემების შეკუმშვა უკეთ — სვეტიან ან სვეტიან შენახვაში და რატომ?
SELECT * FROM table1 AS t1 LEFT JOIN table2 AS t2 ON t1.date_start > t2.date_start
აირჩიეთ * ცხრილიდან1 როგორც t1 მარცხენა JOIN ცხრილზე2 როგორც t2 ON t1.date_start > t2.date_start d = { True: 42, 1: 2, 1.0: 100500 } print(d)
მონაცემთა ბაზებში ინდექსები რა არის, რა მიზნით გამოიყენება და რა არის მათი შიდა სტრუქტურა?
Python-ში სტრიქონისა და ტუპლის ციკლის შორის რა განსხვავებაა? რა ტიპები არიან ძირითადი და როგორ ეს გავლენას ახდენს შესრულებაზე?
ფიტნეს კლუბების ვიზიტების ანალიზი თქვენ მუშაობთ ფიტნეს კლუბების ქსელში ანალიტიკოსად. გაქვთ ინფორმაცია მომხმარებლების ვიზიტებზე და მათ მიერ შეძენილ აბონემენტებზე. საჭიროა აბონემენტების ეფექტიანობის ანალიზი. გაანგარიშეთ თითოეული აბონემენტის ტიპისთვის: • ამ ტიპის აბონემენტს გამოყენებული უნიკალური user_id-ების საერთო რაოდენობა; • ამ აბონემენტთან დაკავშირებული ვიზიტების საერთო რაოდენობა; • ამ აბონემენტის მომხმარებლების წილი საერთო მომხმარებელთა რაოდენობის პროცენტში (დასკვნითი ერთ ციფრზე). გამოთვლისთვის გამოიყენეთ ამ აბონემენტით გამოყენებული მომხმარებლების რაოდენობა საერთო უნიკალური მომხმარებლების რაოდენობასთან მიმართებაში. ყოველ მომხმარებელს შეიძლება ჰქონდეს მხოლოდ ერთი აბონემენტი. შედეგი sort-ით დაალაგეთ აბონემენტების ტიპის მიხედვით, ალფაბეტურ წესრიგში. შესავალი მონაცემები აბონემენტების სია: • membership_id (int) — უნიკალური აბონემენტის ID • user_id (int) — მომხმარებლის ID • membership_type (text) — აბონემენტის ტიპი ვიზიტების სია: • visit_id (int) — ვიზიტის უნიკალური ID • user_id (int) — მომხმარებლის ID • visit_date (timestamp) — ვიზიტის თარიღი და დრო მონაცემები არ შეიცავს ცარიელ ან არასწორ მნიშვნელობებს. გამოსავალი საკითხი უნდა დააბრუნოს სია, სადაც ფარავენ: • membership_type (text) — აბონემენტის ტიპი • users_count (int) — ამ ტიპის უნიკალური მომხმარებლების რაოდენობა • total_visits (int) — ამ აბონემენტით განხორციელებული ვიზიტების საერთო რაოდენობა • user_share (numeric) — ამ აბონემენტით ვიზიტების პროცენტული წილი საერთო მომხმარებელთა რაოდენობის მიმართ (დასკვნითი ერთ ციფრზე).
Threading, multiprocessing, asyncio: რა განსხვავებაა და როდის უკეთესია რა გამოიყენო?
გთხოვთ, მოგვიყევით თქვენი გამოცდილების შესახებ Greenplum, DBT და Data Vault-თან მუშაობაში. რატომ გადავიდით თოვლისფერი მოდელიდან Data Vault-ზე?
როგორ მივუდგეთ სიტუაციას, როდესაც ბიზნესი ითხოვს ახალი აქციის მონაცემების ვიზუალიზაციით ანგარიშს?
მითხარი, რა იცი სვეტოვანი და სვეტოვანი მონაცემების შენახვის შესახებ. როდის და რომელს უნდა აირჩიო და რატომ?
მოგიყევით თქვენი სამუშაო გამოცდილების შესახებ: დავალებები, ტექნოლოგიების სტეკი
რა განსხვავებაა RANK() და DENSE_RANK() შორის?
Airflow-ში პარალელიზმი სად ჩანს?
რატომ არის Pandas უკეთესი, ვიდრე ჩვეულებრივი სიები და ლექსიკონები Python-ში?
როგორ მართავს Pandas გამოტოვებული მონაცემებს?
როგორ მუშაობდით Impala-სთან?
რამდენი დამატებითი მეხსიერება სჭირდება სიტყვების გარჩევის გადაწყვეტას, დაბრუნებული მონაცემების გარეშე?