Data Engineer
Koks Parquet saugojimo tipas: eilutė ar stulpelis?
Kodėl bool([""]) grąžina True?
Kas yra duomenų vitrina?
Kuriuose laukuose įvyko duomenų sujungimas ir kaip buvo pašalinti dubliuojami elementai iš vitrinų?
Ką žinote apie spill Spark?
Kokiose technologijose pastatytas jūsų lakehouse ir kokios problemos kyla dirbant su Apache Iceberg?
Ar S3 buvo vienintelė pagrindinė saugykla, ar naudojote kelias?
Kaip paleisti antrąjį Airflow DAG iškart po pirmojo sėkmingo užbaigimo?
Papaskinkite apie svarbiausią Python projektą ar užduotį per pastaruosius metus.
Kuris komandas keičia prieigos teises prie failų Linux'e?
Papaskinkite, kur dirbote kaip sistemų analitikas ir kokius uždavinius atlikote?
Kas yra normalizacija ir ER modelis, kam jie reikalingi?
Be API, kokiais kitais būdais ir protokolais dirbote su duomenų šaltiniais?
Ar dirbote su kontekstų valdytojais Python? Kas jie yra ir kam skirti?
Kokius agentus ir modelius naudojate savo įmonės AI sprendime? Ar jis rašo kodą už jus?
Kam skirta cache ir persist Spark'e?
Kaip paleidote DAG-ius: pagal cron, duomenų rinkinius, trigerius ar priklausomybes?
importuok clickhouse_driver from airflow.hooks.base import * def get_clickhouse_client(): conn = BaseHook.get_connection("clickhouse_default") return clickhouse_driver.Client( host=conn.host, port=conn.port, user=conn.login, password=conn.password, database=conn.schema )
Kokie Spark JDBC parametrai buvo naudojami skaitymo paralelizavimui?
Kas yra CROSS JOIN ir koks yra jo taikymo rezultatas?