Data Engineer
Kaip tiksliai pavyko optimizuoti užklausas Data Vault, jei jis paprastai padidina jungčių skaičių?
Papaskinkite, kur dirbote kaip sistemų analitikas ir kokius uždavinius atlikote?
Ar naudojote XCom Airflow?
Užduotis #2 Parašykite užklausą, kuri rodo TOP-3 darbuotojus pagal atlyginimą kiekviename skyriuje. Rodyti skyriaus pavadinimą, darbuotojo vardą ir jo atlyginimą. employee lentelė: | id | name | salary | dept_id | |----|-------|--------|---------| | 10 | John | 1000 | 2 | | 20 | Tom | 5000 | 3 | | 30 | Bill | 3000 | 2 | department lentelė: | id | name | |----|-----------| | 1 | Marketing | | 2 | IT | | 3 | Finansai | Išvestis: department_name, num, employee_name, salary su cte kaip( select d.name as department_name, e.name as employee_name, e.salary, dense_rank iš employee e jungtis su department d on e.id = d.id
Kaip paleidote DAG-ius: pagal cron, duomenų rinkinius, trigerius ar priklausomybes?
Kokie Spark JDBC parametrai buvo naudojami skaitymo paralelizavimui?
Kokius techninius laukus naudojo satellites, links ir hubs Data Vault?
Kokie fiziniai JOIN tipai egzistuoja Spark?
Ar parašėte OpenMetadata įkėlimo procesus, kurie skenuoja šaltinius?
Kaip valdyti Spark programos išteklius, kad neperkrautume atminties keičiant įvesties duomenų kiekį?
Ką žinote apie serializaciją ir deserializaciją Spark/UDF kontekste?
Papaskinkite apie įdomią užduotį įmonėje per pastaruosius 2,5 metų, pavyzdžiui, susijusią su ClickHouse.
Kodėl Data Quality pasirinkti naudoti individualius Python/Airflow skriptus, o ne paruoštą variklį, pvz., Great Expectations?
Ką daro parametras depends_on_past Airflow?
Ar įmanoma pagalvoti ką nors kita vietoj įprasto CTE, atsižvelgiant į tai, kad filtravimas vis dar vyksta atmintyje visoje lentelėje?
Kokius pagrindinius Linux komandas naudojate terminale?
Ar kada nors susidūrėte su klaida ClickHouse `Too many parts` įterpiant? Kaip ją sprendėte?
Sual #1 İki cədvəli id atributu üzrə birləşdirərkən inner, left, right, full join ilə neçə qeyd qaytarılacaq? t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:
Kokius Docker vaizdus reikėjo sukurti ir kodėl?
Kiekvienai eilutei salaries lentelėje parodykite darbuotojo vardą, datą, atlyginimą ir naudodami lango funkciją pridėkite stulpelį "vidutinis atlyginimas pagal skyrių šią datą".