Wat kun je me vertellen over SOAP API?
Data Engineer
Hoe hebben jullie de DAGs gestart: via cron, datasets, triggers of afhankelijkheden?
Welke datakwaliteitscontroles werden uitgevoerd in Data Vault?
Hoe hebben ze verbinding gemaakt met OpenMetadata en wat hebben ze ermee gedaan?
Geef een voorbeeld van een typische taak voor het schrijven van een DAG in Airflow.
Hoe te traceren in welke DAG-uitvoering een specifieke regel in Data Vault verscheen?
Heeft u Airflow beheerd of alleen als ontwikkelaar gewerkt?
Kan in Greenplum een willekeurige verdeling worden gebruikt en wanneer is dit geschikt?
Hoe hebben ze de tabellen en queries geoptimaliseerd: partities, indexen, selectielogica?
Vertel iets over jezelf: waarmee heb je gewerkt, welke stack heb je gebruikt en wat voor project was het?
Welke SQL-query's schrijf je: eenvoudige controles of complexe scripts voor datawarehouses?
Heeft u aanvullende logging gedaan naast de logs van Airflow?
Heeft u Bridge en PIT-tabellen gebruikt in Data Vault? Geef een voorbeeld en leg het doel uit.
Wanneer kun je feedback geven en heb je aanbiedingen in handen?
Welke aanvullende entiteiten van Data Vault, naast hub, link en satellite, werden gebruikt: bijvoorbeeld same-as links of transactional links?
Noem de SQL-vensterfuncties die je kent.
Was S3 de enige hoofdopslag of werden er meerdere gebruikt?
Heeft u één S3-bucket of meerdere gebruikt? Op basis waarvan?
Wat voor soort opslag heeft Parquet: rij of kolom?
Hebben jullie de lijn van de bron tot de consument opgebouwd?