Čo môžeš povedať o SOAP API?
Data Engineer
Ako ste spustili DAG-y: pomocou cron, datasetov, triggerov alebo závislostí?
Aké kontroly kvality údajov boli vykonané v Data Vault?
Ako ste sa pripojili k OpenMetadata a čo ste s ňou robili?
Ako sledovať, v ktorom spustení DAG sa objavila konkrétna riadka v Data Vault?
Uveďte príklad typickej úlohy na písanie DAG v Airflow.
Spravoval ste Airflow alebo ste pracovali iba ako vývojár?
Ako optimalizovali tabuľky a dotazy: partície, indexy, logika výberu?
Povedz niečo o sebe: čím si sa zaoberal, aký stack si používal a aký bol to projekt?
Je možné v Greenplum použiť náhodné rozdelenie a kedy je to vhodné?
Aké SQL dotazy píšeš: jednoduché kontroly alebo zložité skripty pre dátové sklady?
Vykonali ste dodatočné zaznamenávanie okrem logov Airflow?
Kedy môžeš dať spätnú väzbu a máš ponuky na rukách?
Použili ste v Data Vault Bridge a PIT tabuľky? Uveďte príklad a vysvetlite ich účel.
Aké ďalšie entity Data Vault, okrem hub, link a satellite, boli použité: napríklad same-as links alebo transactional links?
Bol S3 jediným hlavným úložiskom alebo ste používali niekoľko?
Uveďte známe funkcie okien SQL.
Použili ste jeden S3 bucket alebo viac? Podľa akého princípu?
Vytvorili ste líniu od zdroja po spotrebiteľa?
Aký typ ukladania má Parquet: riadkový alebo stĺpcový?