Data Engineer
როგორ გავაკეთოთ ზევით გაგრძელება (NULL-ებს ავსება წინამორბედი ნულოვანი მნიშვნელობით საპირისპირო მიმართულებით)?
Python-ში გენერატორებსა და სიაებს შორის რა განსხვავებაა?
რატომ არის საჭირო ინდექსები, რა სარგებელი და ნაკლია მათ?
რა არის HDFS-ში მონაცემების ბლოკებად დაყოფის აზრი?
Greenplum-ში MPP არქიტექტურის ნაკლოვანებები რა არის?
Greenplum არის OLTP თუ ანალიტიკური საცავი?
რა განსხვავებაა WHERE და HAVING-ს შორის?
რა ტიპის JOIN-ები გეცოდინებათ? (ლოგიკური)
რომელ Airflow ოპერატორებს იყენებდით? როგორ ურთიერთქმედებდით dbt-თან Airflow-ის საშუალებით?
ტრასსირების მხოლოდ REST-სადღეგრძელებს თუ სხვა რამესაც აჩვენებს?
როგორ არ მოკლათ Jupyter ან Pandas მეხსიერების გამო?
Greenplum-ში რა ტიპის კითხვა გამოიყენება: ხაზი თუ სვეტი?
Greenplum-ში ACID დაცულია?
-- საწყისი stretch ცხრილი -- აუცილებელია NULL მნიშვნელობების შევსება წინამორბედ (არ NULL) მნიშვნელობით id-ის მიხედვით - ქვემოთ გადაფარვა id | ttime | val ---|-------|----- 1 | 07:30 | NULL 1 | 09:21 | 10 1 | 13:53 | NULL 1 | 16:12 | NULL 2 | 09:42 | 133 2 | 15:20 | NULL 2 | 21:33 | NULL 3 | 08:01 | NULL 3 | 11:41 | 8 3 | 14:23 | NULL 3 | 16:17 | NULL 3 | 19:54 | 2 4 | 13:10 | 312 4 | 14:42 | NULL 4 | 16:31 | 7 4 | 17:44 | NULL id | ttime | val ---|-------|----- 1 | 07:30 | NULL 1 | 09:21 | 10 1 | 13:53 | 10 1 | 16:12 | 10 2 | 09:42 | 133 2 | 15:20 | 133 2 | 21:33 | 133 3 | 08:01 | NULL 3 | 11:41 | 8 3 | 14:23 | 8 3 | 16:17 | 8 3 | 19:54 | 2 4 | 13:10 | 312 4 | 14:42 | 312 4 | 16:31 | 7 4 | 17:44 | 7 -- SQL სვეტით, რათა მიიღოთ სასურველი ცხრილი SELECT id, ttime, COALESCE(val, LAST_VALUE(val) OVER(PARTITION BY id ORDER BY ttime)) as val FROM stretch
GIL (Global Interpreter Lock) რა არის?
ACID-ის უპირატესობებსა და ნაკლოვანებებს გარდა წაკითხვის სიჩქარის რა შეიძლება ითქვას?
რა არის მკვდარი ხაზები მონაცემთა ბაზაში?
რა განსხვავებაა პარტიციონირებასა და შარდინგს შორის?
რომელ ინკრემენტული დატვირთვის სტრატეგიებს იყენებდით dbt-ში?
ინდექსები ყოველთვის აუმჯობესებს შესრულებას, თუ შეიძლება დეგრადაცია მოხდეს?