Data Engineer
Erzähle mir von deinem Verständnis der Datenqualität — hast du Erfahrung in diesem Bereich?
Kannst du dich an deine Erfahrung bei der Optimierung von Abfragen erinnern? Wie hast du gehandelt, analysiert?
Bist du aus Moskau? Lebst du schon lange hier? Warum bist du nach Moskau gezogen?
Wie unterscheiden sich die Anforderungen an die Rechenleistung des Speichers bei ETL und ELT?
Für welche Aufgaben ist ClickHouse ungeeignet und was würden Sie stattdessen wählen?
git submodule update --init
Entspricht der Ausführungsplan von EXPLAIN immer dem, was tatsächlich ausgeführt wird?
Was ist für Sie in Ihrer zukünftigen Arbeit wichtig?
Haben Sie eine Abfrage, die schlecht funktioniert, langsam ist oder abstürzt — wie optimieren Sie sie?
Mit welchen Problemen sind Sie bei der Arbeit mit Greenplum konfrontiert worden?
Kennst du eine in Rust geschriebene, Multithread-fähige Bibliothek, die sehr schnell ist und Pandas für Data Science und Big Data ersetzen kann?
Wie bringen Sie den DAG-Code in die Produktion?
Die Fensterfunktion SUM() OVER (PARTITION BY user_id) — in einem Fall fügen wir ORDER BY Kaufdatum hinzu, im anderen nicht. Was ist der Unterschied?
Wie ist Ihr QA (Datenqualitätsprüfung) organisiert?
Was reizt dich an dem Bereich Travel? Vielleicht reist du selbst gerne, oder hat dich die Travel-Tech Branche auf irgendeine Weise interessiert?
Sie haben zwei verknüpfte Tabellen: first_table und second_table. Sie möchten den Befehl TRUNCATE TABLE second_table CASCADE; ausführen, um alle Zeilen aus second_table und alle von ihr abhängigen Daten zu löschen. Welche Folgen kann die Ausführung dieses Befehls haben? create table first_table ( id integer primary key ); create table second_table ( id serial primary key, first_table_fk integer references first_table(id) ); - Die Sequenz second_table_id_seq wird auf den Anfangswert zurückgesetzt. - Alle Datensätze in first_table, die über einen Fremdschlüssel mit second_table verbunden sind, werden gelöscht. - Bestehende Indizes für second_table werden gelöscht und automatisch neu erstellt. - Bei späteren Einfügungen in second_table kann der Standardwert für id mit einem inkorrekten Wert beginnen. - Es tritt ein Fehler auf, da der Befehl CASCADE für Tabellen mit Fremdschlüsseln verboten ist.
Angenommen, Data Vault ist nicht verfügbar und es gibt zwei große Tabellen, die verbunden werden müssen. Wie würdest du das in Greenplum optimieren? Und wenn es in ClickHouse wäre?
Wie funktioniert physisch der Broadcast-Mechanismus — wie gelangen die Partitionen einer kleinen Tabelle auf die Executor mit einer großen Tabelle?
Was ist CDC und haben Sie Erfahrung damit?
Warum wurde Parquet anstelle von ORC verwendet?