Data Engineer
საფასური ბუქინგების სია შექმენით შეკითხვა როგორ შეგიძლიათ შექმნათ სია [ტელეფონი] დღის ბუქინგების, რომლებიც წევრის (ან სტუმრის)თვის 30 დოლარზე მეტია? გახსოვდეთ, რომ სტუმრებს აქვთ განსხვავებული ხარჯები წევრებთან შედარებით (ჩაწერილი ხარჯები არის ნახევარ საათზე 'სლოტი'), და სტუმრის მომხმარებელი ყოველთვის არის ID 0. ჩართეთ თქვენს გამოყვანაში დაწესებულების სახელი, წევრის სახელი ერთ სვეტად ფორმატირებული და ხარჯი. დაალაგეთ კლებადობით ხარჯის მიხედვით და არ გამოიყენოთ ქვესაკვანძო სია.
HDFS როგორ განსხვავდება ჩვეულებრივი განაწილებული ფაილური სისტემებიდან?
რა არის მონაცემთა განაწილება და როგორ ეხმარება ის სავსე სია სკანირებას?
ROWS BETWEEN და RANGE BETWEEN შორის რა განსხვავებაა?
როგორ აღვადგინოთ შორეული ფილიალიდან სამუშაო, თუ ცდილობთ `git checkout hotfix/missing-footer` და მიიღებთ შეცდომის შეტყობინებას, რომ ფილიალი არ მოიძებნა?
-- საწყისი stretch ცხრილი -- აუცილებელია NULL მნიშვნელობების შევსება წინამორბედ (არ NULL) მნიშვნელობით id-ის მიხედვით - ქვემოთ გადაფარვა id | ttime | val ---|-------|----- 1 | 07:30 | NULL 1 | 09:21 | 10 1 | 13:53 | NULL 1 | 16:12 | NULL 2 | 09:42 | 133 2 | 15:20 | NULL 2 | 21:33 | NULL 3 | 08:01 | NULL 3 | 11:41 | 8 3 | 14:23 | NULL 3 | 16:17 | NULL 3 | 19:54 | 2 4 | 13:10 | 312 4 | 14:42 | NULL 4 | 16:31 | 7 4 | 17:44 | NULL id | ttime | val ---|-------|----- 1 | 07:30 | NULL 1 | 09:21 | 10 1 | 13:53 | 10 1 | 16:12 | 10 2 | 09:42 | 133 2 | 15:20 | 133 2 | 21:33 | 133 3 | 08:01 | NULL 3 | 11:41 | 8 3 | 14:23 | 8 3 | 16:17 | 8 3 | 19:54 | 2 4 | 13:10 | 312 4 | 14:42 | 312 4 | 16:31 | 7 4 | 17:44 | 7 -- SQL სვეტით, რათა მიიღოთ სასურველი ცხრილი SELECT id, ttime, COALESCE(val, LAST_VALUE(val) OVER(PARTITION BY id ORDER BY ttime)) as val FROM stretch
რა არის shuffle Spark-ში და რატომ არის მნიშვნელოვანი მისი მინიმალიზაცია?
X5-ში შენი გამოცდილების შესახებ ისაუბრე: რა გითავაზა DWH-ის ნაწილში?
შენ გაქვს გამოცდილება Docker-ის გამოსახულებებთან, ვირტუალურ მანქანაზე გარემოს შექმნასთან?
რა აკეთებს OPTIMIZE-ი ClickHouse-ში და რატომ არ უნდა ირჩევდეს მას უპასუხისმგებლოდ?
ACID-ის უპირატესობებსა და ნაკლოვანებებს გარდა წაკითხვის სიჩქარის რა შეიძლება ითქვას?
Python-ში ლექსიკონის (dict) მეშვეობით ელემენტის მიღების ალგორითმული სირთულე რა არის?
GIL (Global Interpreter Lock) რა არის?
როგორ ავიცილოთ/წაშალოთ მონაცემების გადახრა Spark-ში?
გაუზიარე ჩემთან Greenplum-ის შესახებ — მონაცემების შენახვის ფორმატები, ხაზოვანი და სვეტოვანი შენახვა.
როგორ ვიპოვოთ Linux-ში ლოგ ფაილში კონკრეტულ სვეტში ქვესიტყვა (მაგალითად, მესამე სვეტში თარიღი)?
როდის აწყდებით პრობლემას წარმოების ხაზში, როგორ მოქმედებთ?
მოჩვენებულ ეკრანზე ორი მონაცემთა სტრუქტურაა; რომელში ძიება მნიშვნელობის 2 უფრო სწრაფი იქნება და რატომ؟
რა მოხდა და როგორ აღვადგინოთ სამუშაო?
Python-ში დეკორატორი რა არის და რა მიზნით გამოიყენება (Airflow-ის კონტექსტში)?