Mennyire ismeri a Linux/Docker-t?
Data Engineer
Mi az a shuffle a Spark-ben, és miért szükséges?
Hogyan lehet kezelni a shuffle-t Sparkben (particionálás, broadcast join stb.)?
Mit hoz az Iceberg formátum a szokásos Parquethez képest?
Ismeri a közös táblák kifejezéseit (CTE)? Adjon példát a használatra.
Mi a statisztika az adatbázis-kezelő rendszerek és lekérdezés-optimalizáció kontextusában?
Hogyan találhatunk meg egy al-szöveget egy adott oszlopban lévő log fájlban Linux alatt (például a dátum a harmadik oszlopban)?
[név] beszélt arról, hogy különböző adatbázis-kezelő rendszerekkel dolgozott, mennyire mélyen kellett foglalkoznia az optimalizálással és a belső részletekkel.
Hogyan hasonlítsuk össze az eredeti („élő”) és a cél táblázatot, ha a forrás folyamatosan változik?
Hogyan szervezzük meg ugyanannak az üzenetnek a Kafka-ból való olvasását több különböző fogyasztóval (fan-out)?
Részletesen írja le a növekmény rögzítésének algoritmusát a forrásból, hogy semmi ne vesszen el a betöltési frekvencia változtatásakor.
Hogyan oldja meg a problémát, amikor az olvasási folyamat láthatja a táblázat közbenső (inkonzisztens) állapotát több lépéses ETL (delete+insert) során az Iceberg-ben?
Mi az a "halott tuple" (dead tuple)?
Meséljen az indexek alkalmazásának legjobb gyakorlatairól - mikor és milyen gyakran használja őket.
Mi az a Spark JDBC és hogyan töltsünk hatékonyan be egy nagy táblát rajta keresztül?
Hogyan kapcsolódnak a Spark partíciók és a táblák (például Iceberg) partíciói?
Hogyan észleljük az adatok torzulását (data skew) Spark-ben?
Mi az a tranzakciós napló (WAL) egy adatbázis-kezelő rendszerben, és miért szükséges?
Használta-e a rekordok hash összehasonlítási módszerét a forrás és a cél tábla közötti különbség kiszámítására?
Miért szükséges a cache és a persist a Sparkban?