Comment utilisez-vous Python dans votre travail et où vous sentez-vous plus confiant : en Python ou en SQL?
Data Engineer
Il y a 101 objets : 100 objets de classe 0 et 1 objet de classe 1. Le premier modèle donne le même score à tous les objets. Quel est son ROC AUC et la forme de la courbe ROC?
Comment tester si une série temporelle est stationnaire ?
Étant donné une requête SQL écrite par un analyste. Identifiez les inefficacités dans la requête et suggérez comment les éviter. La requête joint deux tables: - table de faits 'events' avec la clé 'event_id' - table de référence de la source de trafic avec la clé 'referer_str' Les deux tables contiennent des milliards d'enregistrements. select * from (select distinct e.event_id, e.user_id, e.category_id, e.location_id, s.source_name, s.medium_name, s.campaign_name, row_number() over(partition by e.event_id, e.user_id, e.category_id, e.location_id, s.source_name, s.medium_name, s.campaign_name) as rnk from events e left join traffic_source s on e.referer_str = s.referer_str where e.event_date = current_date() - 1 group by 1,2,3,4,5,6,7) t where rnk = 1
Il y a une cible continue non négative et quatre algorithmes : régression linéaire, arbre de décision, forêt aléatoire et boosting sur arbres. Leursquels peuvent produire des prévisions négatives?
Des données ont été chargées dans une table ReplacingMergeTree; que se passera-t-il lors de la lecture si la fusion n'a pas encore eu lieu, et comment obtenir la version la plus récente des enregistrements?
Qu'est-ce que la dénormalisation?
Est-il possible de combiner la déduplication et le spill de données ultérieur sans utiliser de tables séparées; et si oui, comment?
Qu'est-ce que le test d'hypothèse ? Quels sont les erreurs de Type I et de Type II et la valeur p ?
Quelles sont les structures d'index et comment fonctionnent-elles?
Quelles méthodes connaissez-vous pour accélérer l'exécution des tâches dans PostgreSQL?
Qu'est-ce qu'une série temporelle stationnaire et pourquoi la stationnarité est-elle importante pour les modèles classiques?
Qu'est-ce que le bagging et le boosting, et en quoi diffèrent-ils?
Quelles sont les caractéristiques de l'utilisation de JOIN lors de la construction de vitrines dans PostgreSQL/Greenplum par rapport à ClickHouse?
Connaissez-vous la modélisation uplift ? Que savez-vous à ce sujet ?
Comment éviter la croissance de la table si le stockage des données est limité dans le temps, par exemple deux ans?
Qu'est-ce que ROC AUC?
Il faut vérifier s'il y a des clients avec plusieurs emails dans la table. Si oui, les supprimer (ne laisser que la dernière entrée par create_date).
Qu'est-ce qu'un watermark dans Spark Structured Streaming ?
Qu'est-ce que la normalisation et quand est-elle appliquée?