Erzähle mir allgemein über relationale Datenbanken — was sind sie?
Data Engineer
Was ist ACID? Was bedeutet jeder Buchstabe? Wie hängt das mit Transaktionen zusammen?
Kennst du das Avro-Format?
Wann brauchen wir keinen Datenspeicher?
Welche Einschränkungen gibt es bei der Verwendung von Hashtabellen?
Hattest du Erfahrung mit Docker-Images, bei der Einrichtung einer Umgebung auf einer virtuellen Maschine?
Was ist Duck Typing?
Du hast die Docker-Prozesse erwähnt, kannst du genauer erklären, wie das bei euch organisiert ist?
Wie ist Ihr QA (Datenqualitätsprüfung) organisiert?
Was ist der Unterschied zwischen Refactoring und Optimierung?
Was ist ein Abfrageplan? Wozu sind sie nützlich?
Haben Sie Erfahrung mit Table Engine Join in ClickHouse?
Was gefällt dir momentan nicht an deinem Job?
Welche Arten von physischen Verbindungen (Join-Methoden) gibt es?
Erzählen Sie mir von Ihrer Erfahrung mit verteilten Datenbanken (Greenplum, ClickHouse)?
Angenommen, Data Vault ist nicht verfügbar und es gibt zwei große Tabellen, die verbunden werden müssen. Wie würdest du das in Greenplum optimieren? Und wenn es in ClickHouse wäre?
Gibt es etwas anderes, das man anstelle eines normalen CTEs in Betracht ziehen kann, da die Filterung immer noch im Speicher auf der gesamten Tabelle erfolgt?
Haben Sie Erfahrung mit Engines wie Trino oder mit tabellarischen Formaten (Iceberg, Parquet) in Spark?
In welcher Umgebung wurde Spark gestartet?
Was ist dynamische Typisierung?