Welke processen worden gestart wanneer we records verwijderen of wijzigen in ClickHouse?
Data Engineer
Data Vault is een handig hulpmiddel, maar er zijn veel objecten. Kun je het verschil uitleggen tussen hubs, links en satellieten?
Kun je uitleggen wat we hier uiteindelijk zullen krijgen? Elk stappen moet worden toegelicht, hoe dit werkt.
Ken je een multithreaded, zeer snelle bibliotheek in Rust die Pandas kan vervangen voor Data Science en Big Data?
Wat is het verschil tussen een CTE en een subquery?
Hoe verdeel je een verzoek in fasen? Wat doen we daarvoor?
Welke technologieën heb je gebruikt om gegevens in Parquet te laden, en welke mechanismen werden gebruikt om gegevens te verkrijgen en te laden?
Heeft u gegevens van Spark naar S3 in Parquet-formaat geladen, en vervolgens van Parquet naar Greenplum — hoe verloopt het laadproces?
Hoe heb je de Airflow DAG en jobs geschreven: handmatig of met sjablonen?
Hoe werden de gegevens uit de externe tabel geladen in de doel tabellen?
Met streaming werkte Iceberg, hoorde je? Het is een rommelige bestandsopslag.
Heb je met Git gewerkt? Wat bewaarde je in Git?
Met afhankelijkheden tussen jobs, tussen DAGs — gebruikte u sensoren zodat ze achter elkaar meerdere jobs konden starten?
Hoe maakte je meestal het schema van de database — deed je dat handmatig in de database, bewaarde je de scripts ergens, of gebruikte je Liquibase? Wat was het proces?
Dit is in realtime, hoe implementeer je dit tussen Kafka en ClickHouse Spark?
Heeft het zin om een CTE te gebruiken als deze maar één keer in de query wordt gebruikt?
We gaan JSON parseren — wie gaat JSON parseren? Voor zover ik weet, zijn er geen functies in ClickHouse.
Heeft u direct met Spark gewerkt? Wat is het nadeel ervan?
We hebben een pipeline-engine nodig — een mechanisme dat het mogelijk maakt om zeer snel stroom te creëren door contracten en parameters aan te leveren. Hoe zou je dit op een hoger niveau implementeren?
Welke type lezen wordt gebruikt in Greenplum — rij- of kolomgebaseerd?