Data Engineer
Ce tip de stocare are Parquet: pe rând sau pe coloană?
De ce bool([""]) returnează True?
Ce este o vitrină de date?
Pe ce câmpuri a avut loc unirea datelor și cum au fost eliminate duplicatele din vitrină?
Ce știi despre spill în Spark?
Pe ce tehnologii este construit lakehouse-ul tău și ce probleme apar în lucrul cu Apache Iceberg?
S3 a fost singura stocare principală sau s-au folosit mai multe?
Cum porni al doilea DAG Airflow imediat după finalizarea cu succes a primului?
Spuneți-ne despre cel mai semnificativ proiect sau sarcină în Python din ultimul an.
Ce comandă schimbă drepturile de acces la fișiere în Linux?
Spune-mi unde ai lucrat ca analist de sistem și ce sarcini ai îndeplinit?
Ce este normalizarea și modelul ER, la ce sunt utile?
Pe lângă API, cu ce alte metode și protocoale ați lucrat cu sursele de date?
Ai lucrat cu gestionarii de context în Python? Ce sunt și pentru ce sunt folosiți?
Ce agenți și modele sunt utilizate în cadrul soluției dvs. de IA corporativă? Scrie cod pentru dvs.?
La ce servesc cache și persist în Spark?
Cum au fost lansate DAG-urile: prin cron, seturi de date, trigger-e sau dependențe?
importă clickhouse_driver from airflow.hooks.base import * def get_clickhouse_client(): conn = BaseHook.get_connection("clickhouse_default") return clickhouse_driver.Client( host=conn.host, port=conn.port, user=conn.login, password=conn.password, database=conn.schema )
Ce parametri Spark JDBC au fost utilizați pentru paralelizarea citirii?
Ce este un CROSS JOIN și care este rezultatul aplicării sale?