Data Engineer
როგორ გადავცეთ მონაცემები სამუშაოებს შორის Airflow-ში?
რომელი ბრძანება უნდა გამოიყენოს პროექტის ძირითადი საქაღალდიდან, რათა განაახლოს submodule docs/ მოლაპარაკების ბოლო ვერსიამდე და ამ ცვლილების მომზადება კომიტისთვის? git fetch docs/ && git merge docs/FETCH_HEAD git pull --recurse-submodules git submodule update --remote docs/ cd docs/ && git pull && cd .. && git commit -am "განახლება" git submodule update --init docs/
მოყევი მაგალითი, როდესაც შეძლე პროცესების ან ინსტრუმენტების გაუმჯობესება გუნდისთვის.
სურათზე მოცემული ცხრილების სტრუქტურა შექმნილია. საჭიროა სურათზე მოცემული სვეტით სარეკლამო მოთხოვნის შესრულება. [...]-ის ადგილას რა სახის join უნდა გამოიყენოს, რათა შედეგში type = 'table_aw'-ისთვის 'naming' სვეტი შეივსოს, ხოლო type = 'table2'-ისთვის — 'serial_number' სვეტი? create table multirelation( type varchar not null, entity_id integer not null ); create table table_aw( id integer primary key, naming varchar not null ); create table table2( id integer primary key, serial_number varchar not null ); -- ცხრილების სტრუქტურა select m.type,m.entity_id, ta.naming, t2.serial_number from multirelation m [...] join table_aw ta on m.entity_id = ta.id and m.type='table_aw' [...] join table2 t2 on m.entity_id = t2.id and m.type='table2'; -- სარეკლამო მოთხოვნა გაწყვეტილიყავით ცარიელი inner cross right left
ვინ იყვნენ მონაცემების მომხმარებლები და როგორ აშენებდნენ ვიტრინებს?
რა მოხდა და როგორ დავუბრუნოთ სამუშაო?
რა განსხვავებაა Greenplum-სა და PostgreSQL-ს შორის?
რამდენი ანაზღაურებას ელოდები?
ანგარიში ლოჯისტიკური კომპანიისთვის თქვენ ხართ ლოჯისტიკური კომპანიის ანალიტიკოსი, რომელიც აკონტროლებს საწყობებზე ოპერაციების აღრიცხვას. თქვენ გჭირდებათ თითოეული საწყობის ეფექტიანობის შესახებ ანგარიში მოამზადოთ. თითოეული საწყობისთვის გამოთვალეთ: • საერთო ოპერაციების რაოდენობა (count_operations); • საწყობში დამუშავებული საქონლის საერთო რაოდენობა (sum_quantity); • ოპერაციის საშუალო დრო (avg_processing_time), მხოლოდ მითითებული დროის ოპერაციებისთვის (NULL არ უნდა იყოს), მთელი რიცხვამდე მოხაზული; • ერთ ოპერაციაში დამუშავებული საქონლის მაქსიმალური და მინიმალური რაოდენობა (max_quantity, min_quantity); • თითოეული ტიპის ოპერაციების რაოდენობა («მიწოდება», «გადაზიდვა», «გადანაწილება») ცალკეულ სვეტებში: supply_operations, shipment_operations, transfer_operations. ფილტრეთ საწყობები, სადაც საერთო ოპერაციების რაოდენობა მეტია 2-ზე და საშუალო დრო არ აღემატება 60 წუთს. შედეგი sort-ის მიხედვით დაალაგეთ საწყობის ID-ის მიხედვით ზრდადობით. შესავალი ფორმატი ოპერაციების სია: • operation_id (int) — ოპერაციის უნიკალური იდენტიფიკატორი • warehouse_id (int) — საწყობის იდენტიფიკატორი • operation_type (text) — ოპერაციის ტიპი: «მიწოდება», «გადაზიდვა», «გადანაწილება» • quantity (int) — საქონლის რაოდენობა ოპერაციაში • operation_date (timestamp) — ოპერაციის თარიღი და დრო • processing_time (int) — ოპერაციის დამუშავების დრო processing_time სვეტი შეიძლება შეიცავდეს გამოტოვებულ მნიშვნელობებს. გამოტანის ფორმატი საკითხი უნდა დააბრუნოს ცხრილს შემდეგი სვეტებით: • warehouse_id (int) — საწყობის უნიკალური იდენტიფიკატორი • count_operations (int) — საწყობზე შესრულებული ოპერაციების საერთო რაოდენობა • sum_quantity (int) — საწყობში დამუშავებული საქონლის საერთო რაოდენობა • avg_processing_time (numeric) — ოპერაციის საშუალო დრო (წუთებში), მხოლოდ არა NULL დროსთან ოპერაციებისთვის, მთელი რიცხვამდე მოხაზული • max_quantity (int) — ერთ ოპერაციაში დამუშავებული ყველაზე მეტი საქონლის რაოდენობა • min_quantity (int) — ერთ ოპერაციაში დამუშავებული ყველაზე მცირე საქონლის რაოდენობა • supply_operations (int) — «მიწოდების» ოპერაციების რაოდენობა • shipment_operations (int) — «გადაზიდვის» ოპერაციების რაოდენობა • transfer_operations (int) — «გადანაწილების» ოპერაციების რაოდენობა
Python-ში Set და List-ის თვისებები და განსხვავებები რა არის? შესრულების გარდა, რა სხვა თვისებები არსებობს?
მარცხენა შეუერთება: ცხრილი, სადაც 10 ჩანაწერია, მარცხენა შეუერთება: ცხრილი, სადაც 100 ჩანაწერია. რა არის მინიმალური და მაქსიმალური სვეტების რაოდენობა, რომელიც შეიძლება მიიღოს?
Greenplum-ში მონაცემებს რომელ ველებზე განაწილეთ?
რა მონაცემთა ხარისხის შემოწმებები ჩატარდა Data Vault-ში?
მოჩვენებულ ეკრანზე ორი მონაცემთა სტრუქტურაა; რომელში ძიება მნიშვნელობის 2 უფრო სწრაფი იქნება და რატომ؟
SELECT client_id, ФИО, SUM(suma) AS total_amount FROM clients JOIN transactions ON clients.client_id = transactions.client_id WHERE дата = '2025-05-01' GROUP BY client_id, ФИО;
როგორ აწყობთ ჩვეულებრივ თქვენს სამუშაოს დავალებებზე და როგორ აკონტროლებთ პროგრესს?
Greenplum-ში არსებობს თუ არა ფუნქციები და შესაძლებლობები, რომლებიც ჩვეულებრივ MySQL-ში და სხვა დიალექტებში არ არის?
[სახელი] იკითხა: როგორ განვახორციელოთ მონაცემების შენახვა მხოლოდ 2 წლის განმავლობაში ClickHouse-ში?
მითხარით, რა გიყვართ თავისუფალ დროს კოდირებასთან ერთად? რა არის თქვენი ჰობიები?
git submodule update --init