Data Engineer
როგორ შევაფასოთ კონფიგურაცია ერთ ტერაბაიტ მონაცემთა გადატანისთვის PostgreSQL-დან ClickHouse-კენ?
რა ტექნოლოგიებს იყენებდით მონაცემების ჩასატვირთად Parquet-ში და რა მექანიზმები გამოიყენებოდა მონაცემების მიღებისა და ჩატვირთვისთვის?
დამუშავებულხარ ფანჯრის ფუნქციებთან? რა სახის ფანჯრის ფუნქციებს იცნობ?
ნათელი შედეგი: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 | with cte as( select order_id, customer_id, order_dt, lag(order_dt) over(partition by customer_id order by order_dt) as prev_order_ft, datediff(day, prev_order_ft, order_dt) as gap_days from Orders ) select customer_id, max(gap_days) as gap_days from cte where gap_days > 60 group by customer_id
Python-ში რა ტიპის ტიპიზაცია გამოიყენება: სტატიკური თუ დინამიკური?
ჩვენს მომხმარებელთა ცხრილი გვაქვს (id, სახელი, მისამართი და ა.შ.), პროდუქტები (id, სახელი და ა.შ.), პროდუქტის მოძრაობა (აქ გვაქვს მომხმარებლის id, პროდუქტი, თარიღი, რაოდენობა, ჯამი), უნდა ვიპოვოთ რომელი პროდუქტები გაიყიდა 1 იანვარს, მხოლოდ უნიკალები და ასევე გამოვიტანოთ ყიდვის სახელიც და...
რომელი გუნდი და რომელ ხელმძღვანელობით მუშაობა თქვენთვის ყველაზე კომფორტულია?
შეიძლება გქონდეთ გამოცდილება Spark-ის დავალებების ოპტიმიზაციაში? შეგიძლიათ მიაწოდოთ კონკრეტული მაგალითი?
როგორ იყო შენი როლი ოთხკაციან გუნდში და როგორ ხედავ შენი კარიერას 3-4 წლის შემდეგ, რა მიზნები გქონია?
საწყობი აშენდა Data Vault სქემის მიხედვით — შენც განავითარე, შეინარჩუნე? ხელით დაამატე ჰაბები, ლინკები?
მოჩვენებულ ეკრანზე ორი მონაცემთა სტრუქტურაა; რომელში ძიება მნიშვნელობის 2 უფრო სწრაფი იქნება და რატომ؟
როგორ ხვდებით გასაღებების კონცეფციას ცხრილებში — რა მიზნით არის ეს საჭირო?
როგორ დავტვირთოთ მონაცემები Kafka-დან ClickHouse-ში რეალურ დროში ანგარიშებისთვის streaming-ის საშუალებით?
გააზიარეთ Kafka-ს ძირითადი კონცეფციები (მომხმარებელთა ჯგუფი, განყოფილებები, თემები).
როგორ შევქმნათ Airflow-ში ბევრი ერთნაირი დავალება ერთდროულად (მაგალითად, ბევრი ერთნაირი ფაილის ატვირთვა)?
რომელი სამუშაო ფორმატი გსურთ: დისტანციური, ჰიბრიდული ან ოფისში?
Hive-ში შეკვეთის შესრულებამდე მაგიდის სქემას ნახავთ?
როგორ ხედავთ თქვენს განვითარებას ახალ გუნდში და რომელ დავალებებს გსურთ ყველაზე მეტად დაკავება?
Apache Airflow-ში დეკორატორების გამოყენება რა მიზნით ხდება?
ლოგისტიკის კომპანიისთვის ანგარიში თქვენ ხართ ლოგისტიკური კომპანიის ანალიტიკოსი, რომელიც აკრეფს ოპერაციებს საწყობებში. უნდა მოამზადოთ ანგარიში თითოეული საწყობი ეფექტურობის შესახებ. თითოეული საწყობი გამოითვალეთ: • საერთო ოპერაციების რაოდენობა (count_operations); • საწყობში დამუშავებული საერთო საქონლის რაოდენობა (sum_quantity); • ოპერაციის საშუალო დრო (avg_processing_time), მხოლოდ მითითებული დროის ოპერაციებისთვის (არ NULL), მრგვლივ მთელ რიცხვად; • მაქსიმალური და მინიმალური საქონლის რაოდენობა, რომელიც ერთ ოპერაციაში დამუშავდა (max_quantity, min_quantity); • თითოეული ტიპის ოპერაციების რაოდენობა («მიწოდება», «გაგზავნა», «გადატანა») ცალკე სვეტებში: supply_operations, shipment_operations, transfer_operations. ფილტრეთ საწყობები, რომელთა საერთო ოპერაციების რაოდენობა აღემატება 2-ს და საშუალო დრო არ აღემატება 60 წუთს. შედეგი sort-ით დაალაგეთ საწყობი ID-ის მიხედვით ზრდადობით. შესავალი ფორმატი ოპერაციების სია: • operation_id (int) — ოპერაციის უნიკალური ID • warehouse_id (int) — საწყობის ID • operation_type (text) — ოპერაციის ტიპი: «მიწოდება», «გაგზავნა», «გადატანა»