Ce poți să-mi spui despre API-ul SOAP?
Data Engineer
Cum au fost lansate DAG-urile: prin cron, seturi de date, trigger-e sau dependențe?
Ce verificări de calitate a datelor au fost efectuate în Data Vault?
Cum s-au conectat la OpenMetadata și ce au făcut cu ea?
Cum să urmăriți în ce rulare a DAG a apărut o linie specifică în Data Vault?
Dă un exemplu de sarcină tipică pentru scrierea unui DAG în Airflow.
Ai administrat Airflow sau ai lucrat doar ca dezvoltator?
Cum au fost optimizate tabelele și interogările: partiții, indecși, logica de selecție?
Se poate folosi distribuția aleatorie în Greenplum și când este potrivit?
Spuneți-ne despre voi: cu ce v-ați ocupat, ce tehnologie ați folosit și ce fel de proiect a fost?
Ce interogări SQL scrii: verificări simple sau scripturi complexe pentru depozite de date?
Ați efectuat un logging suplimentar în afară de jurnalele Airflow?
Când poți oferi feedback și ai oferte în mână?
Ați folosit Bridge și tabele PIT în Data Vault? Oferiți un exemplu și explicați scopul.
Ce entități suplimentare ale Data Vault, în afară de hub, link și satellite, au fost utilizate: de exemplu, same-as links sau transactional links?
S3 a fost singura stocare principală sau s-au folosit mai multe?
Enumerați funcțiile de fereastră SQL pe care le cunoașteți.
Ați folosit un singur bucket S3 sau mai multe? În ce principiu?
Ați construit linia de la sursă până la consumator?
Ce tip de stocare are Parquet: pe rând sau pe coloană?