Data Engineer
Welche Tabellentypen haben Sie in Greenplum verwendet? In welchen Fällen wurde Heap verwendet und in welchen Append-Optimized?
Was möchten Sie in unserem Team machen?
Wie kann man Daten von Greenplum und Trino nach ClickHouse übertragen?
Iceberg ist eine Engine, die es ermöglicht, S3 in eine Datenbank umzuwandeln, sie erfüllt sogar ACID. Was ist sein Nachteil?
Worin besteht der Unterschied zwischen HDFS und herkömmlichen verteilten Dateisystemen?
Erzähle mir mehr über Spark: Was genau wurde umgesetzt, welche Methoden wurden verwendet
Verbessern Indizes immer die Leistung oder können sie eine Verschlechterung verursachen?
Was sind tote Zeilen in der Datenbank?
Wir brauchen eine Pipeline-Engine — einen Mechanismus, der es ermöglicht, sehr schnell Flüsse zu erstellen, indem Verträge und Parameter eingegeben werden. Wie würdest du das auf einer höheren Ebene umsetzen?
Wird ACID in Greenplum eingehalten?
Welche Vor- und Nachteile von ACID können genannt werden, abgesehen von der Lesegeschwindigkeit?
Worin unterscheiden sich Generatoren von Listen in Python?
Das ist in Echtzeit, wie kann man das zwischen Kafka und ClickHouse Spark umsetzen?
Wie man Jupyter oder Pandas nicht durch Speicher tötet?
Was ist GIL (Global Interpreter Lock)?
Wie sieht man den Ausführungsplan einer Abfrage in Oracle? Worin unterscheidet sich EXPLAIN PLAN von EXPLAIN ANALYZE?
Was ist der Zweck der Aufteilung von Daten in Blöcke im HDFS?
Im CTE wird viel Speicher verwendet – wenn wir einen hohen Speicherverbrauch haben, was passiert mit den Daten?
Wie gut kennen Sie sich mit Python aus?
Welche Airflow-Operatoren haben Sie verwendet? Wie haben Sie mit dbt über Airflow interagiert?