Data Engineer
რას იწყებს ClickHouse-ში ჩანაწერების წაშლის ან შეცვლის დროს?
რეფაქტორინგსა და ოპტიმიზაციას შორის რა განსხვავებაა?
როდის არ გვჭირდება მონაცემთა შენახვა?
Kafka დავალება: პროდიუსერი აგზავნის პროდუქტის ფასის ცვლილებებს (200 რუბლი, შემდეგ 300 რუბლი), მომხმარებელი რეპლიკირებულია 3 პოდში. იქნებიან თუ არა პრობლემები დეფოლტ კონფიგურაციაში?
დამუშავებულხარ ფანჯრის ფუნქციებთან? რა სახის ფანჯრის ფუნქციებს იცნობ?
ჩვენ ვაწვდით მეტადატებს შესაყვანად, და ის ამ მეტადატებზე დაფუძნებით ქმნის ნაკადს — როგორ დაეხმარება ეს არსებულ ნაკადებს სწრაფად გადატანაში ძველ სისტემებიდან დაგეგმილ სისტემებზე?
Python-ში რა ტიპის ტიპიზაცია გამოიყენება: სტატიკური თუ დინამიკური?
როგორ უნდა მოვიქცეთ, როდესაც user_id-ზე skew (შეცდომა) არსებობს ტრანზაქციებისა და მომხმარებლების ტაბლოების JOIN-ის დროს? როგორ ავირჩიოთ ოპტიმალური განაწილების გასაღები?
გაყიდვების ანალიზი კატეგორიების მიხედვით საცალო მაღაზიაში თქვენ მუშაობთ ანალიტიკოსად საცალო მაღაზიაში. თქვენი დავალებაა შეადგინოთ გაყიდვების ანგარიში კატეგორიების მიხედვით: • კატეგორიაში გაყიდული ერთეულების საერთო რაოდენობა (total_units_sold); • კატეგორიაში საერთო შემოსავალი, განთავსებული ფასდაკლებებით, სადაც ფასდაკლება გამოიყენება როგორც unit_price × units_sold × (1 − discount/100). თუ ფასდაკლება არ არის (NULL), მიიჩნიეთ რომ ის 0%-ია. ორნიშნა დამდგმელი; • საშუალო გაყიდული ერთეულების რაოდენობა ერთ გაყიდვაზე (avg_units_per_sale), ორნიშნა დამდგმელი; • ფასდაკლებით არ გაყიდული გაყიდვების წილი (no_discount_share) — NULL ან 0%-იანი ფასდაკლებით გაყიდვების რაოდენობა, გაყოფილი საერთო გაყიდვების რაოდენობაზე კატეგორიაში, სამნიშნა დამდგმელი: შედეგი პირველ რიგში დაალაგეთ შემცირებად total_revenue-ის მიხედვით, შემდეგ ზრდადობით საშუალო ერთეულების რაოდენობის (avg_units_per_sale), ბოლოს — კატეგორიის სახელის მიხედვით ალფავიტურად: შესავალი ფორმატი გაყიდვების ცხრილი: • sale_id (int) — უნიკალური გაყიდვის იდენტიფიკატორი • product_id (int) — პროდუქტის იდენტიფიკატორი • category (text) — პროდუქტის კატეგორია • sale_date (timestamp) — გაყიდვის თარიღი და დრო • units_sold (int) — გაყიდული ერთეულების რაოდენობა • unit_price (numeric) — ერთეულის ფასი • discount (numeric) — პროდუქტის ფასდაკლება პროცენტებში, შეიძლება იყოს NULL ფართო მონაცემი შეიძლება შეიცავდეს გამოტოვებულ მნიშვნელობებს: გამოსვლის ფორმატი საკითხი უნდა დააბრუნოს ცხრილი შემდეგი ველებით: • category (text) — პროდუქტის კატეგორია • total_units_sold (int) — საერთო გაყიდული ერთეულების რაოდენობა • total_revenue (numeric) — საერთო შემოსავალი კატეგორიის მიხედვით, განთავსებული ფასდაკლებებით, ორნიშნა დამდგმელი; • avg_units_per_sale (numeric) — საშუალო ერთეულების რაოდენობა ერთ შეკვეთაში, ორნიშნა დამდგმელი; • no_discount_share (numeric) — ფასდაკლებით არ გაყიდული გაყიდვების წილი, სამნიშნა დამდგმელი შედეგი პირველ რიგში დაალაგეთ შემცირებად total_revenue-ის მიხედვით, შემდეგ ზრდადობით საშუალო ერთეულების რაოდენობის (avg_units_per_sale), ბოლოს — კატეგორიის სახელის მიხედვით ალფავიტურად.
საწყობი აშენდა Data Vault სქემის მიხედვით — შენც განავითარე, შეინარჩუნე? ხელით დაამატე ჰაბები, ლინკები?
როგორ შევარჩიოთ სწორი შარდინგის გასაღები მონაცემების თანაბარი განაწილებისთვის?
როგორ იმოქმედებდით Materialized View-ის ჯაჭვთან, რომელიც გადის ReplacingMergeTree-ის შუამავლობით, რათა სწორად შეავსოთ მონაცემები, რომლებიც უკვე არსებობდა ახალი MV-ის დაწყებამდე?
როგორ ხვდებით გასაღებების კონცეფციას ცხრილებში — რა მიზნით არის ეს საჭირო?
როგორ დავტვირთოთ მონაცემები Kafka-დან ClickHouse-ში რეალურ დროში ანგარიშებისთვის streaming-ის საშუალებით?
რა არის ClickHouse-ში მთავარი გასაღები და როგორ განსხვავდება ის ჩვეულებრივი მონაცემთა ბაზების მთავარი გასაღებიდან?
რა განსხვავებაა docker run და docker exec ბრძანებებს შორის?
რომელი SQL ოპერატორების ჯგუფებს იცნობ? მათ რა მიეკუთვნება?
Spark-ში Catalyst ოპტიმიზატორი რა არის და რა კონკრეტული ოპტიმიზაციებს ახორციელებს (მაგალითად, predicate pushdown)?
Python-ში ლექსიკონის (dict) მეშვეობით ელემენტის მიღების ალგორითმული სირთულე რა არის?
როგორ შევადაროთ თავდაპირველი („ცოცხალი“) და სამიზნე სია, თუ წყარო მუდმივად იცვლება?