Data Engineer
Haben Sie mit Kontextmanagern in Python gearbeitet? Was sind sie und wofür sind sie nützlich?
Wozu dienen cache und persist in Spark?
Wie haben Sie die DAGs gestartet: per Cron, Datensätze, Trigger oder Abhängigkeiten?
importiere clickhouse_driver from airflow.hooks.base import * def get_clickhouse_client(): conn = BaseHook.get_connection("clickhouse_default") return clickhouse_driver.Client( host=conn.host, port=conn.port, user=conn.login, password=conn.password, database=conn.schema )
Welche Spark JDBC-Parameter wurden zur Parallelisierung des Lesens verwendet?
In welche Richtung wäre eine Entwicklung interessant – Schaufenster, Entwicklung, Analyse, vielleicht KI?
Welche nicht offensichtlichen Probleme können beim Laden großer Tabellen auftreten (außer Leistung)?
In welcher Umgebung wurde Spark gestartet?
Haben Sie Erfahrung mit Engines wie Trino oder mit tabellarischen Formaten (Iceberg, Parquet) in Spark?
Vergleichen Sie die Ansätze ETL und ELT: Was ist der Unterschied und wann wird jeder von ihnen angewendet?
Erzählen Sie die Grundkonzepte von Kafka (Consumer Group, Partitionen, Topics).
CREATE TABLE datamarts.daily_revenue_per_country ON CLUSTER cluster_4x2 ( event_date Date, country String, total_revenue Float64 ) ENGINE = MergeTree() PARTITION BY toYYYYMM(event_date) ORDER BY (event_date);
Erzähle mir von CI/CD-Prozessen, Änderungen in der Datenbank, Versionskontrolle und Schema-Migrationen (Schema-Entwicklung).
Erzählen Sie mir von Ihrer Erfahrung mit verteilten Datenbanken (Greenplum, ClickHouse)?
Schlagen Sie eine Lösung für das regelmäßige inkrementelle Laden einer großen Tabelle mit flexibler (änderbarer) Aktualisierungsfrequenz von Postgres in Data Lake vor.
Und wenn wir alle Kunden benötigen, auch wenn sie an diesem Datum keine Transaktionen hatten – wie zeigt man diese an?
Was ist der Auslöser für die Erstellung eines neuen Jobs in Spark, und wie wird ein Job in Stages und Tasks unterteilt?
Haben Sie mit Feature Stores gearbeitet?
Verwenden Sie KI in Ihrer aktuellen Arbeit? Welche Werkzeuge und wie genau?
Haben Sie Erfahrung im vollständigen Zyklus: von einer unstrukturierten Benutzeranfrage bis zum fertigen Visualisierungs-Dashboard? Mögen Sie diese Art von Arbeit?