Data Engineer
Cum s-a reușit exact să se optimizeze interogările pe Data Vault, dacă de obicei crește numărul de joins?
Spune-mi unde ai lucrat ca analist de sistem și ce sarcini ai îndeplinit?
Ai folosit XCom în Airflow?
Problema #2 Scrieți o interogare care afișează TOP-3 angajați după salariu în fiecare departament. Afișați numele departamentului, numele angajatului și salariul său. tabelul employee: | id | name | salary | dept_id | |----|-------|--------|---------| | 10 | John | 1000 | 2 | | 20 | Tom | 5000 | 3 | | 30 | Bill | 3000 | 2 | tabelul department: | id | name | |----|-----------| | 1 | Marketing | | 2 | IT | | 3 | Finance | Ieșire: department_name, num, employee_name, salary cu cte ca( select d.name as department_name, e.name as employee_name, e.salary, dense_rank from employee e join department d on e.id = d.id
Cum au fost lansate DAG-urile: prin cron, seturi de date, trigger-e sau dependențe?
Ce parametri Spark JDBC au fost utilizați pentru paralelizarea citirii?
Ce câmpuri tehnice au fost utilizate în satellites, links și hubs Data Vault?
Ce tipuri de JOIN-uri fizice există în Spark?
Ai scris procese de ingestie în OpenMetadata care scanează sursele?
Cum să gestionezi resursele unei aplicații Spark pentru a nu depăși memoria atunci când modifici volumul datelor de intrare?
Ce știi despre serializare și deserializare în contextul Spark/UDF?
Povestește despre o sarcină interesantă din companie în ultimele 2,5 ani, de exemplu legată de ClickHouse.
De ce s-au ales scripturi personalizate în Python/Airflow pentru Data Quality în loc de un motor gata făcut, cum ar fi Great Expectations?
Ce face parametrul depends_on_past în Airflow?
Se poate gândi la ceva în plus în loc de un CTE obișnuit, având în vedere că filtrarea încă are loc în memorie pe întreaga tabelă?
Ce comenzi principale Linux folosești în terminal?
V-ați confruntat vreodată cu eroarea ClickHouse `Too many parts` la inserare? Cum ați rezolvat-o?
Întrebarea #1 Câte înregistrări va returna interogarea cu inner, left, right, full join a două tabele la unirea pe atributul id t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:
Ce imagini Docker a fost nevoie să construiți și de ce?
Pentru fiecare rând din tabelul salaries, afișați numele angajatului, data, salariul și, folosind o funcție de fereastră, adăugați o coloană "salariul mediu pe departament la această dată".