Data Engineer
Wie unterscheiden sich die Anforderungen an die Rechenleistung des Speichers bei ETL und ELT?
Anzeigen der Anzahl der Bestellungen und "Produkte der benötigten Kategorie in der Bestellung" für das Jahr 2021 in den Kategorien "Kleidung" und für 2022 in der Kategorie "Schuhe" (Endansicht: 2 Zeilen. Felder: Jahr, Anzahl der Produkte, Anzahl der Bestellungen) with cte as( select year(o.order_date) as year_orders, g.cat_1, count(distinct o.order_id) as count_orders, sum(g.quantity) as count_quan from Orders o join Goods g on o.order_id = g.order_id where (g.cat_1 = 'Kleidung' and Year(o.order_date) = 2021) or (g.cat_1 = 'Schuhe' and Year(o.order_date) = 2022) group by year_orders, g.cat_1 ) select year_orders, count_quan, count_orders from cte für 2025, Top-3 in jeder Kategorie nach Verkaufsmenge model with cte as( select cat_1, price, quantity, model, rank() over(partition by cat_1) as rk from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 ) für 2025, Top-3 in jeder Kategorie nach Verkaufssumme model with cte as( select g.cat_1, g.model, (price * quantity), rank() over(partition by g.cat_1) as rk from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 ) with cte as( select g.cat_1, g.model, sum(price * quantity) as sum_, rank() over(partition by g.cat_1 order by sum() desc) as rk from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 ) with cte1 as( select g.cat_1, g.model, sum(price * quantity) as sum_total, from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 ), cte2 as(select g.cat_1, g.model, sum_total, rank() over(partition by g.cat_1 order sum_total desc) as rk from cte1 ) select g.cat_1, g.model, sum_total from cte2 where rk <=3 with cte1 as( select g.cat_1 as cat_name, g.model as model, sum(price * quantity) as sum_total, from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 group by Year(o.order_date), g.model ), cte2 as(select cat_name, model, sum_total, rank() over(partition by cat_name order sum_total desc) as rk from cte1 ) select cat_name, model, sum_total from cte2 where rk <=3
Welcher Diagnostik-Algorithmus und was tun, wenn die Abfrage nach dem Hinzufügen mehrerer Indizes immer noch langsam ist?
Wie organisiert man das Laden von Daten in ClickHouse bei einer großen PostgreSQL-Tabelle, in die ständig neue Einträge mit einem monoton wachsendem Primärschlüssel kommen?
Wodurch genau konnte man die Abfragen im Data Vault optimieren, wenn es normalerweise die Anzahl der Joins erhöht?
Hast du XCom in Airflow verwendet?
Hast du Ingestion-Prozesse für OpenMetadata geschrieben, die Quellen scannen?
Mit welchen Visualisierungstools haben Sie gearbeitet und wie eng haben Sie mit Power BI zusammengearbeitet?
Was wissen Sie über Serialisierung und Deserialisierung im Kontext von Spark/UDF?
Aufgabe #2 Schreiben Sie eine Abfrage, die die TOP-3-Mitarbeiter nach Gehalt in jeder Abteilung anzeigt. Geben Sie den Namen der Abteilung, den Namen des Mitarbeiters und sein Gehalt aus. Mitarbeitertabelle: | id | name | salary | dept_id | |----|-------|--------|---------| | 10 | John | 1000 | 2 | | 20 | Tom | 5000 | 3 | | 30 | Bill | 3000 | 2 | Abteilungstabelle: | id | name | |----|-----------| | 1 | Marketing | | 2 | IT | | 3 | Finanzen | Ausgabe: department_name, num, employee_name, salary mit cte als( select d.name als department_name, e.name als employee_name, e.salary, dense_rank von employee e join department d auf e.id = d.id
Was passiert, wenn man ein DAG mit start_date = 1. Januar 2024 erstellt?
Wie funktioniert der Hash-Join für Tabellen mit 1.000 und 1.000.000 Zeilen?
Gibt es etwas anderes, das man anstelle eines normalen CTEs in Betracht ziehen kann, da die Filterung immer noch im Speicher auf der gesamten Tabelle erfolgt?
Welche Linux-Befehle verwendest du im Terminal?
Was ist das Transaktionsprotokoll (WAL) in einem DBMS und wozu dient es?
Wurde die Methode des Vergleichs von Hashes von Datensätzen verwendet, um die Differenz zwischen Quelle und Ziel Tabelle zu berechnen?
Warum suchst du eine neue Stelle und was möchtest du in Zukunft machen?
Warum suchst du jetzt eine neue Stelle, möchtest du den Job wechseln?
Welche Methoden der Datenübertragung zwischen Airflow-Aufgaben kennen Sie?
LeetCode #? — In PostgreSQL gibt es eine Tabelle [Tabelle] mit einer einzigen Spalte id und den Werten 1, 1, 2. Schreiben Sie eine DELETE-Anweisung, die einen Duplikat physisch löscht.