Data Engineer
Wo kann man die Aufgabenprotokolle in Airflow ansehen?
Es sind zwei Tabellen t1 und t2 gegeben. Die Aufgabe ist, alle Arten von Joins aufzulisten, die du kennst, und das Ergebnis der Abfrage select * from t1 <join> t2 on t1.t = t2.t für jeden von ihnen. |t1.t| ------ 1 2 4 null ------ |t2.t| ------ 1 3 null null
CREATE TABLE orders ( driver_id varchar, city varchar, order_id varchar ); -- Holen Sie sich die Top 10 Fahrer nach Anzahl der Bestellungen in jeder Stadt
Was ist der Unterschied zwischen RANK() und DENSE_RANK()?
SELECT * FROM table1 AS t1 LEFT JOIN table2 AS t2 ON t1.date_start > t2.date_start
Erzähle mir von deiner Berufserfahrung: Aufgaben, Technologiestack
Wo funktioniert die Datenkompression besser – bei spaltenorientierter oder zeilenorientierter Speicherung, und warum?
Wie verarbeitet Pandas fehlende Daten?
Analyse der Besucherzahlen in Fitnessstudios Sie arbeiten als Analyst in einer Fitnessstudio-Kette. Sie haben Informationen über die Besuche der Nutzer und die von ihnen gekauften Mitgliedschaften. Es ist notwendig, die Effektivität der Nutzung der Mitgliedschaften zu analysieren. Berechnen Sie für jeden Mitgliedschaftstyp: • die Gesamtzahl der Nutzer, die diesen Mitgliedschaftstyp verwendet haben. Berücksichtigen Sie nur eindeutige user_id; • die Gesamtzahl der Besuche mit dieser Mitgliedschaft. Berücksichtigen Sie alle Besuche der Nutzer mit dieser Mitgliedschaft; • den Anteil der Nutzer dieser Mitgliedschaft in Prozent am Gesamtzahl der Nutzer (auf eine Dezimalstelle gerundet). Zur Berechnung des Anteils verwenden Sie das Verhältnis der Nutzer mit dieser Mitgliedschaft zur Gesamtzahl der eindeutigen Nutzer. Jeder Nutzer kann nur eine Mitgliedschaft haben. Sortieren Sie das Ergebnis nach Mitgliedschaftstyp in alphabetischer Reihenfolge. Eingabeformat Tabelle memberships: • membership_id (int) — eindeutige Kennung der Mitgliedschaft • user_id (int) — eindeutige Kennung des Nutzers • membership_type (text) — Typ der Mitgliedschaft Tabelle visits: • visit_id (int) — eindeutige Kennung des Besuchs • user_id (int) — Nutzerkennung • visit_date (timestamp) — Datum und Uhrzeit des Besuchs Die Daten enthalten keine fehlenden oder fehlerhaften Werte. Ausgabeformat Die Abfrage sollte eine Tabelle mit den Feldern in folgender Reihenfolge zurückgeben: • membership_type (text) — Typ der Mitgliedschaft • users_count (int) — Anzahl der eindeutigen Nutzer mit diesem Mitgliedschaftstyp • total_visits (int) — Gesamtzahl der Besuche der Nutzer mit dieser Mitgliedschaft • user_share (numeric) — Anteil der Nutzer in Prozent an der Gesamtzahl (auf eine Dezimalstelle gerundet) Das Ergebnis wird nach Mitgliedschaftstyp in alphabetischer Reihenfolge sortiert.
WÄHLE * VON tabelle1 ALS t1 LINKER JOIN tabelle2 ALS t2 ON t1.date_start > t2.date_start d = { True: 42, 1: 2, 1.0: 100500 } print(d)
Wie kann eine SQL-Injection über das Eingabefeld für das Datum auftreten?
Wo erscheint Parallelismus in Airflow?
Berichten Sie uns von Ihrer Erfahrung mit Greenplum, DBT und Data Vault. Warum sind Sie vom Schneeflockenmodell zum Data Vault gewechselt?
Was sind Indizes in Datenbanken, wozu dienen sie und wie ist ihre interne Struktur?
Wie funktioniert ClickHouse und worin unterscheidet es sich von PostgreSQL?
Wie funktioniert der Abfrageoptimierer in Oracle, worauf achtet er und zu welcher Klasse gehört er?
Was ist der Zweck der Aufteilung von Daten in Blöcke im HDFS?
Worin besteht der Unterschied zwischen einer Schleife über eine Zeichenkette und einer Schleife über ein Tuple in Python? Welche Typen sind grundlegend und wie beeinflusst dies die Leistung?
Threading, Multiprocessing, asyncio: Was ist der Unterschied und wann ist es besser, was zu verwenden?
Erzähl mir, was du über spaltenbasierten und zeilenbasierten Datenspeicherung weißt. Wann und welche solltest du wählen und warum?