Data Engineer
Pateikite pavyzdį, kada pavyko pagerinti procesus ar įrankius komandai.
Pasakokite apie geriausias praktikas naudojant indeksus – kada ir kaip dažnai juos naudoti.
Kaip paprastai dirbate su Git komandoje? Ir kas yra Merge Request?
Su srautu Iceberg veikė, girdėjai? Tai šiukšlių failų saugykla.
Koks darbo formatas jums patogiausias — biuras, hibridas ar nuotolinis darbas? Turime du biurus, Kutuzovsky ir Tula.
Kaip sumažinti DataFrame atminties suvartojimą Pandas?
Kaip užtikrinti, kad mobilus klientas turėtų prieigą prie tų pačių užsakymų, bet su mažesne laukų rinkiniu? Kas yra BFF?
Pasakykite daugiau apie duomenų iškraipymą tarp shardų: kaip jis buvo nustatytas ir kaip buvo naudojama atitinkama funkcija/mekanizmas?
importuok clickhouse_driver from airflow.hooks.base import * def get_clickhouse_client(): conn = BaseHook.get_connection("clickhouse_default") return clickhouse_driver.Client( host=conn.host, port=conn.port, user=conn.login, password=conn.password, database=conn.schema )
Koks tvarkos ar tipo suspaudimo naudojamas Parquet?
Kas vyksta PostgreSQL po užklausos SELECT * FROM [lentelė] vykdymo?
Aprašykite duomenų archyvavimo iš Oracle į Parquet (HDFS) procesą pagal skaidinius ir atvirkštinį duomenų atkūrimo pipeline'ą. Kaip išspręsti atkurtų duomenų pakartotinį archyvavimą?
Kaip paprastai organizuojate savo darbą užduotyse ir kaip stebite pažangą?
Kiek iš viso buvo atsisiuntimų — aukšto lygio darbai, siūlai?
Kaip perduoti duomenis tarp užduočių Airflow?
Kas sukelia naujo darbo Spark'e sukūrimą ir kaip darbas yra padalintas į Stages ir Tasks?
Ar dirbote su feature store'ais?
Ar turite klausimų apie komandą ir vaidmenį?
Ar turite patirties konfigūruojant pipeline'us CI/CD, pavyzdžiui, GitLab?
Kuo skiriasi WHERE nuo HAVING SQL?