Mi az index a adatbázisokban, mire szolgál és mi a belső szerkezete?
Data Engineer
Mesélj a legutóbbi munkahelyeiden szerzett tapasztalataidról, milyen projektekről, milyen technológiai stackről?
Mi a különbség a UNION és UNION ALL között? Milyen feltételeknek kell teljesülniük?
Milyen SQL-operator csoportokat ismersz? Milyen tartoznak hozzájuk?
Hogyan működik a Hash Join?
Mi az a Catalyst optimalizáló Sparkben, és milyen konkrét optimalizációkat végez (pl. predicate pushdown)?
Hogyan ellenőrzi az adatok helyességét SAS-ból DBT-be történő pipeline fordításakor?
Miért fordulnak elő deadlockok, és melyik mechanizmus felel az adatok konzisztenciájáért az adatbázisokban párhuzamos lekérdezések esetén?
Mi a normalizálás? Melyik formán dolgozunk főként?
Doláminyag problémákkal foglalkoztál?
Miért éppen a DBT-t választottátok? Milyen előnyöket és hátrányokat látsz ebben a keretrendszerben?
Adatminőség-ellenőrzések — melyik szakaszban, milyen ellenőrzések, mi történik a nem érvényes adatokkal?
Mik a Set és List Pythonban? A teljesítményen kívül milyen más jellemzők vannak?
Mesélj egy érdekes feladatról a cégnél az elmúlt 2,5 évben, például a ClickHouse-szal kapcsolatban.
Milyen elosztási formátumok vannak a Greenplum-ben a BY column és a RANDOMLY mellett?
Hogyan működik a Merge Join (összekapcsolás rendezéssel)?
Sorolja fel az SQL lekérdezés műveleteinek végrehajtási sorrendjét a SELECT, FROM, WHERE, GROUP BY, HAVING, ORDER BY, LIMIT parancsokkal, az elsőtől az utolsóig.
Szeretsz inkább egyedül, szakértőként dolgozni, vagy fejlesztői csapatban?
Van egy ügyfél táblánk (azonosító, név, cím stb.), termékek (azonosító, név stb.), termékmozgás (itt van ügyfél azonosító, termék, dátum, mennyiség, összeg), meg kell találni, mely termékeket adták el január 1-jén, csak az egyedi, és meg kell mutatni a vásárló nevét és...
Milyen fizikai összekapcsolási típusok léteznek (Hash Join, Merge Join, Nested Loop)?