Ismered az Avro formátumot?
Data Engineer
Beszélj az összefüggő adatbázisokról általánosságban — mik is ezek?
Mi az az ACID? Mit jelent minden betű? Hogyan kapcsolódik ez a tranzakciókhoz?
Mikor nincs szükség adat tárolására?
Említetted a Docker folyamatokat, tudnál részletesebben mesélni arról, hogyan van ez nálatok szervezve?
Mi az a kacsázás (duck typing)?
Volt tapasztalatod Docker-képek, virtuális gépen környezet beállításával kapcsolatban?
Milyen korlátozások vannak a hash tábla használatában?
Hogyan van szervezve a QA (adatminőség-ellenőrzés)?
Milyen fizikai kapcsolatok (összekapcsolási módszerek) léteznek?
Mi a különbség a refaktorálás és az optimalizálás között?
Mi az a lekérdezési terv? Mire jó?
Van tapasztalatod a Table Engine Join használatában a ClickHouse-ban?
Meséljen a terjesztett adatbázisokkal (Greenplum, ClickHouse) szerzett tapasztalatairól.
Tegyük fel, hogy a Data Vault nem elérhető, és két széles táblát kell összekapcsolni. Hogyan optimalizálnád ezt Greenplumban? És ha ez ClickHouse-ban lenne?
Mi nem tetszik jelenleg a munkádban?
Van tapasztalata Trino típusú motorokkal vagy táblázatos formátumokkal (Iceberg, Parquet) a Spark-ban?
Lehet-e valami mást kitalálni a szokásos CTE helyett, figyelembe véve, hogy a szűrés továbbra is a memória egész területén történik a teljes táblán?
Miért volt szükséged általában a Data Vault-ra?
Milyen környezetben indult a Spark?