Data Engineer
Wie organisieren Sie Ihre Projekte? Schreiben Sie eine README oder etwas anderes?
Haben Sie mit Datenqualitätsvorfällen gearbeitet?
Warum sollte man nicht viele kleine Inserts in ClickHouse machen?
Du hast eine Aufgabe mit der Nummer ABC erhalten. Was ist deine Vorgehensweise in Git, wenn du mit der Arbeit beginnst?
Wie haben sie sich mit OpenMetadata verbunden und was haben sie damit gemacht?
Mussten Sie direkt mit Data Scientists interagieren und deren Anforderungen sammeln?
Warum haben Sie entschieden, das Ranking in eine separate CTE auszulagern? Warum konnte es nicht direkt in der ersten CTE verwendet werden?
Haben Sie mit den Data-Vitrinen (DWH-Schicht) gearbeitet?
Welche Operation hat der Befehl ausgeführt? - Hat git revert auf den Commit mit config.yaml ausgeführt - Hat git filter-branch --index-filter "git rm --cached config.yaml" -- --all ausgeführt - Hat git rebase -i mit Löschung der Commits, die Änderungen an der Datei enthalten, durchgeführt - Hat git commit --amend und git push --force ausgeführt - Hat git cherry-pick verwendet, um einen neuen Branch ohne config.yaml zu erstellen
Haben Sie vielleicht Erfahrung im Bereich Data Science — Arbeit mit Modellen, Statistik?
[Name] fragte: Was muss in die Tabellengine hinzugefügt werden, damit die Daten auf allen Knoten des Clusters aktuell gehalten werden?
Wer waren die Datenverbraucher und wie wurden die Vitrinen aufgebaut?
Was hast du außer Airflow DAG in Python geschrieben?
Anzeigen der Anzahl der Bestellungen und "Produkte der benötigten Kategorie in der Bestellung" für das Jahr 2021 in den Kategorien "Kleidung" und für 2022 in der Kategorie "Schuhe" (Endansicht: 2 Zeilen. Felder: Jahr, Anzahl der Produkte, Anzahl der Bestellungen) with cte as( select year(o.order_date) as year_orders, g.cat_1, count(distinct o.order_id) as count_orders, sum(g.quantity) as count_quan from Orders o join Goods g on o.order_id = g.order_id where (g.cat_1 = 'Kleidung' and Year(o.order_date) = 2021) or (g.cat_1 = 'Schuhe' and Year(o.order_date) = 2022) group by year_orders, g.cat_1 ) select year_orders, count_quan, count_orders from cte für 2025, Top-3 in jeder Kategorie nach Verkaufsmenge model with cte as( select cat_1, price, quantity, model, rank() over(partition by cat_1) as rk from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 ) für 2025, Top-3 in jeder Kategorie nach Verkaufssumme model with cte as( select g.cat_1, g.model, (price * quantity), rank() over(partition by g.cat_1) as rk from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 ) with cte as( select g.cat_1, g.model, sum(price * quantity) as sum_, rank() over(partition by g.cat_1 order by sum() desc) as rk from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 ) with cte1 as( select g.cat_1, g.model, sum(price * quantity) as sum_total, from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 ), cte2 as(select g.cat_1, g.model, sum_total, rank() over(partition by g.cat_1 order sum_total desc) as rk from cte1 ) select g.cat_1, g.model, sum_total from cte2 where rk <=3 with cte1 as( select g.cat_1 as cat_name, g.model as model, sum(price * quantity) as sum_total, from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 group by Year(o.order_date), g.model ), cte2 as(select cat_name, model, sum_total, rank() over(partition by cat_name order sum_total desc) as rk from cte1 ) select cat_name, model, sum_total from cte2 where rk <=3
Was ist CDC und haben Sie Erfahrung damit?
[Name] fragte: Das Feld 'Haben Sie Flüge gefunden' hat nur zwei Werte (ja/nein). Wie sollte man es am besten in ClickHouse darstellen? Welcher Datentyp wird intern für Bool verwendet?
Wozu dienen "Ordner"/Präfixe in S3 neben der Bequemlichkeit?
Wann kannst du Feedback geben und hast du Angebote in der Hand?
Was motiviert Sie bei der Arbeit? Nennen Sie Ihre Stärken im Bereich Hard Skills.
Hast du Dashboards gebaut und mit Data-Visualization-Tools (BI-Tools) gearbeitet?