Où peut-on voir les journaux des tâches dans Airflow?
Data Engineer
Comment fonctionne ClickHouse et en quoi diffère-t-il de PostgreSQL?
Comment Pandas gère-t-il les données manquantes?
Threading, multiprocessing, asyncio : quelle est la différence et quand est-il préférable d'utiliser quoi ?
Où apparaît le parallélisme dans Airflow?
Comment analyser de grands fichiers XML dans ZIP et les charger dans ClickHouse avec Python?
Quelle est la différence entre les générateurs et les listes en Python?
Comment ORDER BY influence-t-il la table ClickHouse et quels clés sont préférables à choisir?
Quels types d'index existent dans PostgreSQL?
Comment mettre à jour une table dans ClickHouse de manière à ce que les utilisateurs ne remarquent rien (remplacement atomique) ?
Pourquoi Pandas est-il meilleur que les listes et dictionnaires ordinaires en Python?
Qu'est-ce que le GIL (Global Interpreter Lock) ?
Comment ne pas tuer Jupyter ou Pandas par mémoire?
De quoi se composent généralement les journaux des tâches Airflow?
À quoi servent les fonctions de fenêtrage?
Qu'est-ce que l'idempotence dans un DAG/tâche dans Airflow?
Comment créer plusieurs tâches identiques en parallèle dans Airflow (par exemple, télécharger plusieurs fichiers identiques) ?
Comment la taille des granulés influence-t-elle la table ClickHouse?
Comment fonctionne JOIN dans ClickHouse?
Quelle est la différence entre WHERE et HAVING?