Wie verwenden Sie Python in Ihrer Arbeit und wo fühlen Sie sich sicherer: in Python oder in SQL?
Data Engineer
Es gibt 101 Objekte: 100 Objekte der Klasse 0 und 1 Objekt der Klasse 1. Das erste Modell gibt allen Objekten den gleichen Score. Was sind sein ROC AUC und die Form der ROC-Kurve?
Wie testet man eine Zeitreihe auf Stationarität?
Angenommen, ein Analyst hat eine SQL-Abfrage geschrieben. Identifizieren Sie Ineffizienzen in der Abfrage und schlagen Sie vor, wie man sie vermeiden kann. Die Abfrage verbindet zwei Tabellen: - Faktentabelle 'events' mit Schlüssel 'event_id' - Referenztabelle der Traffic-Quelle mit Schlüssel 'referer_str' Beide Tabellen enthalten Milliarden von Datensätzen. select * from (select distinct e.event_id, e.user_id, e.category_id, e.location_id, s.source_name, s.medium_name, s.campaign_name, row_number() over(partition by e.event_id, e.user_id, e.category_id, e.location_id, s.source_name, s.medium_name, s.campaign_name) as rnk from events e left join traffic_source s on e.referer_str = s.referer_str where e.event_date = current_date() - 1 group by 1,2,3,4,5,6,7) t where rnk = 1
Es gibt ein nicht-negatives kontinuierliches Ziel und vier Algorithmen: lineare Regression, Entscheidungsbaum, Random Forest und Gradient Boosting auf Bäumen. Welche von ihnen können negative Vorhersagen liefern?
Daten wurden in eine ReplacingMergeTree-Tabelle geladen; was passiert beim Lesen, wenn die Zusammenführung noch nicht stattgefunden hat, und wie erhält man die neueste Version der Datensätze?
Was ist Denormalisierung?
Ist es möglich, Duplikation und anschließenden Datenspill ohne separate Tabellen zu kombinieren; und wenn ja, wie?
Was ist Hypothesentests? Was sind Fehler vom Typ I und Typ II und p-Wert?
Welche Indexstrukturen gibt es und wie funktionieren sie?
Welche Möglichkeiten kennen Sie, um die Ausführung von Aufgaben in PostgreSQL zu beschleunigen?
Was ist eine stationäre Zeitreihe und warum ist Stationarität wichtig für klassische Modelle?
Was ist Bagging und Boosting, und worin unterscheiden sie sich?
Welche Eigenschaften hat die Verwendung von JOIN beim Aufbau von Data Marts in PostgreSQL/Greenplum im Vergleich zu ClickHouse?
Kennst du dich mit Uplift-Modellierung aus? Was weißt du darüber?
Wie kann man das Wachstum der Tabelle verhindern, wenn die Datenspeicherung zeitlich begrenzt ist, zum Beispiel auf zwei Jahre?
Was ist ROC AUC?
Es muss überprüft werden, ob in der Tabelle Kunden mit mehreren E-Mails vorhanden sind. Falls ja, diese entfernen (nur den letzten Eintrag nach create_date belassen).
Was ist eine Watermark in Spark Structured Streaming?
Was ist Normalisierung und wann wird sie angewendet?