Data Engineer
Neben der API, mit welchen anderen Methoden und Protokollen haben Sie mit Datenquellen gearbeitet?
Erzähle mir von deinem Verständnis der Datenqualität — hast du Erfahrung in diesem Bereich?
Welche Agenten und Modelle werden in Ihrer unternehmensweiten KI-Lösung verwendet? Schreibt es Code für Sie?
Wozu dienen cache und persist in Spark?
Wie haben Sie die DAGs gestartet: per Cron, Datensätze, Trigger oder Abhängigkeiten?
importiere clickhouse_driver from airflow.hooks.base import * def get_clickhouse_client(): conn = BaseHook.get_connection("clickhouse_default") return clickhouse_driver.Client( host=conn.host, port=conn.port, user=conn.login, password=conn.password, database=conn.schema )
Welche Spark JDBC-Parameter wurden zur Parallelisierung des Lesens verwendet?
Was ist ein CROSS JOIN und was ist das Ergebnis seiner Anwendung?
In welche Richtung wäre eine Entwicklung interessant – Schaufenster, Entwicklung, Analyse, vielleicht KI?
-- t1 -- num --------- -- 1 -- 2 2 null null 4 -- t2 -- num --------- -- [Telefon] null null 5 AUSWÄHLEN a.num ALS a_num, b.num ALS b_num VON t1 a LINKS JOIN t2 b ON a.num = b.num;
Welche nicht offensichtlichen Probleme können beim Laden großer Tabellen auftreten (außer Leistung)?
Die Fensterfunktion SUM() OVER (PARTITION BY user_id) — in einem Fall fügen wir ORDER BY Kaufdatum hinzu, im anderen nicht. Was ist der Unterschied?
Wozu brauchten Sie überhaupt Data Vault?
Welchen Speichertyp hat Parquet: Zeile oder Spalte?
Erzählen Sie mir von der Replikationskonfigurationsaufgabe, die Sie gelöst haben.
CREATE TABLE datamarts.daily_revenue_per_country ON CLUSTER cluster_4x2 ( event_date Date, country String, total_revenue Float64 ) ENGINE = MergeTree() PARTITION BY toYYYYMM(event_date) ORDER BY (event_date);
Erzähle mir von CI/CD-Prozessen, Änderungen in der Datenbank, Versionskontrolle und Schema-Migrationen (Schema-Entwicklung).
Was reizt dich an dem Bereich Travel? Vielleicht reist du selbst gerne, oder hat dich die Travel-Tech Branche auf irgendeine Weise interessiert?
Erzählen Sie mir von Ihrer Erfahrung mit verteilten Datenbanken (Greenplum, ClickHouse)?
Schlagen Sie eine Lösung für das regelmäßige inkrementelle Laden einer großen Tabelle mit flexibler (änderbarer) Aktualisierungsfrequenz von Postgres in Data Lake vor.