Waar kunnen de taaklogs in Airflow worden bekeken?
Data Engineer
Hoe werkt ClickHouse en waarmee verschilt het van PostgreSQL?
Hoe behandelt Pandas ontbrekende gegevens?
Threading, multiprocessing, asyncio: wat is het verschil en wanneer is het beter om wat te gebruiken?
Waar verschijnt parallelisme in Airflow?
Hoe grote XML-bestanden in ZIP parseren en in ClickHouse laden met Python?
Hoe beïnvloedt ORDER BY de ClickHouse-tabel en welke sleutels zijn het beste om te kiezen?
Welke soorten indexen zijn er in PostgreSQL?
Waarom is Pandas beter dan gewone lijsten en woordenboeken in Python?
Wat is het verschil tussen generators en lijsten in Python?
Hoe een tabel in ClickHouse bij te werken zodat gebruikers niets merken (atomair vervangen)?
Wat is GIL (Global Interpreter Lock)?
Waaruit bestaan de logs van Airflow-taken gewoonlijk?
Hoe je Jupyter of Pandas niet door geheugen ombrengt?
Waarvoor zijn vensterfuncties bedoeld?
Hoe maak je in Airflow meerdere identieke taken parallel (bijvoorbeeld het uploaden van veel identieke bestanden)?
Hoe werkt JOIN in ClickHouse?
Wat is het verschil tussen WHERE en HAVING?
Hoe werkt compressie in ClickHouse?
Welke tabelmotoren in ClickHouse ken je en heb je gebruikt?