Co můžeš říct o SOAP API?
Data Engineer
Jak jste spouštěli DAGy: podle cron, datasetů, spouštěčů nebo závislostí?
Jaké kontroly kvality dat byly provedeny v Data Vault?
Jak se připojili k OpenMetadata a co s ní dělali?
Jak sledovat, v jakém spuštění DAG se objevila konkrétní řádka v Data Vault?
Uveďte příklad typického úkolu při psaní DAG v Airflow.
Spravoval jste Airflow nebo jste pracoval pouze jako vývojář?
Jak optimalizovali tabulky a dotazy: partice, indexy, logika výběru?
Jaké SQL dotazy píšeš: jednoduché kontroly nebo složité skripty pro vitríny?
Prováděli jste dodatečné zaznamenávání kromě logů Airflow?
Pověz mi o sobě: čím ses zabýval, jaký stack jsi používal a o jaký projekt šlo?
Kdy můžeš dát zpětnou vazbu a máš nabídky v ruce?
Použili jste v Data Vault Bridge a PIT tabulky? Uveďte příklad a vysvětlete jejich účel.
Lze v Greenplum použít náhodné rozdělení a kdy je to vhodné?
Jaké další entity Data Vault, kromě hub, link a satellite, byly použity: například same-as links nebo transactional links?
Byl S3 jediným hlavním úložištěm nebo jste používali několik?
Uveďte známé vám SQL okno funkce.
Použili jste jeden S3 bucket nebo více? Podle jakého principu?
Vytvořili jste linii od zdroje ke spotřebiteli?
Jaký typ ukládání má Parquet: řádkový nebo sloupcový?