მოსალოდნელი #2 დაწერეთ სვეტების TOP-3 თანამშრომლების შესახებ თითოეულ განყოფილებაში. აჩვენეთ განყოფილების სახელი, თანამშრომლის სახელი და მისი ხელფასი. employee ცხრილი: | id | name | salary | dept_id | |----|-------|--------|---------| | 10 | John | 1000 | 2 | | 20 | Tom | 5000 | 3 | | 30 | Bill | 3000 | 2 | department ცხრილი: | id | name | |----|-----------| | 1 | Marketing | | 2 | IT | | 3 | ფინანსები | შედეგი: department_name, num, employee_name, salary cte-ის საშუალებით: select d.name as department_name, e.name as employee_name, e.salary, dense_rank from employee e join department d on e.id = d.id
Data Engineer
რა არის ადაპტური სარეკლამო შესრულება (AQE)?
რა განსხვავებაა ACID და CAP თეორემას შორის?
ნათელი შედეგი: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 | with cte as( select order_id, customer_id, order_dt, lag(order_dt) over(partition by customer_id order by order_dt) as prev_order_ft, datediff(day, prev_order_ft, order_dt) as gap_days from Orders ) select customer_id, max(gap_days) as gap_days from cte where gap_days > 60 group by customer_id
რა არის shuffle-ის საფრთხე Spark-ში?
ტრანზაქცია რომელ ეტაპებს მოიცავს?
რის დროს ლექსიკონის ძიება შეიძლება გაუარესდეს ყველაზე უარეს შემთხვევამდე?
თქვენ ოდესმე მუშაობდით Python-ის დეკორატორებთან? რა არის ისინი და სად გამოიყენება?
გთხოვთ, აღწეროთ Python-ის მუტაბელი და იმუტაბელი მონაცემთა ტიპები და მიაწოდოთ მაგალითები.
თქვენ მუშაობდით პარამეტრებთან და hints-ებთან, რომლებიც განსაზღვრავენ Broadcast Join-ის გამოყენებას?
გთხოვთ, უფრო დეტალურად ისაუბროთ ქსელზე: რა არის ეს და რატომ არის ეს მნიშვნელოვანი?
როგორ უმეტესად მართავდით შეცდომებს და გაფრთხილებებს პაიპლაინებში?
გთხოვთ, ახსენით სელენ და მყისიერ გამოთვლებს Spark-ში.
საყურადღებოა #1 რა რაოდენობის ჩანაწერი დაბრუნდება, თუ ორი ცხრილი იდ ატრიბუტის მიხედვით შეერთება inner, left, right, full join-ით? t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:
რა რისკები არსებობს მონაცემების ხარისხთან დაკავშირებით?
როგორ ავიცილოთ თავიდან დაახლოებით 700 DAG-ის ერთდროულ გაშვება catchup/backfill-ის დროს Airflow-ში?
რატომ bool([""]) აბრუნებს True-ს?
რა იცით სერილიზაციისა და დესერილიზაციის შესახებ Spark/UDF კონტექსტში?
Spark-ში repartition და coalesce-ს შორის რა განსხვავებაა?
რომელი ფიზიკური სტრატეგიები გაქვთ join-ის შესრულებისთვის?