Data Engineer
Oferă un exemplu când ai reușit să îmbunătățești procesele sau instrumentele pentru echipă.
Vorbiți despre cele mai bune practici de utilizare a indexurilor - când și cât de des să le folosiți.
Cum lucrezi de obicei cu Git în echipă? Și ce este o Merge Request?
Cu streaming, Iceberg funcționa, ai auzit? Este un depozit de fișiere gunoi.
Ce format de lucru îți este mai convenabil — birou, hibrid sau de la distanță? Avem două birouri, pe Kutuzovsky și Tula.
Cum să reduci consumul de memorie al DataFrame-ului în Pandas?
Cum asigurăm clientului mobil acces la aceleași comenzi, dar cu un set mai mic de câmpuri? Ce este BFF?
Povestiți-ne mai multe despre dezechilibrul datelor între sharding-uri: cum a fost determinat și cum a fost utilizată funcția/mecanismul corespunzător?
importă clickhouse_driver from airflow.hooks.base import * def get_clickhouse_client(): conn = BaseHook.get_connection("clickhouse_default") return clickhouse_driver.Client( host=conn.host, port=conn.port, user=conn.login, password=conn.password, database=conn.schema )
Ce ordine sau tip de compresie este utilizat în Parquet?
Ce se întâmplă în PostgreSQL după ce executați o interogare SELECT * FROM [tabel]?
Descrieți procesul de arhivare a datelor din Oracle în Parquet (HDFS) pe partiții și pipeline-ul invers de recuperare a datelor. Cum rezolvați problema arhivării repetate a datelor restaurate?
Cum îți organizezi de obicei munca asupra sarcinilor și cum urmărești progresul?
Câte descărcări au fost în total — joburi de nivel înalt, fire?
Cum se transferă date între sarcini în Airflow?
Ce declanșează crearea unui nou Job în Spark și cum este împărțit Job-ul în Stages și Tasks?
Ai lucrat cu feature store-uri?
Aveți întrebări despre echipă și rol?
Aveți experiență în configurarea pipeline-urilor în CI/CD, de exemplu, GitLab?
Care este diferența dintre WHERE și HAVING în SQL?