Data Engineer
Hogyan hasonlítsuk össze az eredeti („élő”) és a cél táblázatot, ha a forrás folyamatosan változik?
Mi a különbség a ROWS BETWEEN és a RANGE BETWEEN között?
Beállítottál címkéket az S3-ban a vödrökön vagy az objektumokon?
Hogyan szervezed általában a feladatokon végzett munkádat, és hogyan követed nyomon a haladást?
Mi a különbség a virtualizáció és a konténerizáció (Docker) között?
Milyen sorrendben hajtódnak végre az SQL fő műveletei: SELECT, FROM stb.?
Kik voltak az adatok fogyasztói, és hogyan épültek a vitrinek?
Mi a különbség a WHERE és a HAVING között SQL-ben?
Meséljen magáról, hol dolgozott, mivel foglalkozott, milyen érdekes feladatok és kudarcok voltak.
Meséljen az indexek alkalmazásának legjobb gyakorlatairól - mikor és milyen gyakran használja őket.
Mi történt és hogyan lehet visszaszerezni a munkát?
Hogyan dolgozik általában Git-tel csapatban? És mi az a Merge Request?
Meséljen többet az adatok eloszlási torzulásáról a shardok között: hogyan határozták meg és hogyan használták a megfelelő funkciót/mekaniszmust?
Végső eredmény: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 | with cte as( select order_id, customer_id, order_dt, lag(order_dt) over(partition by customer_id order by order_dt) as prev_order_ft, datediff(day, prev_order_ft, order_dt) as gap_days from Orders ) select customer_id, max(gap_days) as gap_days from cte where gap_days > 60 group by customer_id
Van egy ügyfél táblánk (azonosító, név, cím stb.), termékek (azonosító, név stb.), termékmozgás (itt van ügyfél azonosító, termék, dátum, mennyiség, összeg), meg kell találni, mely termékeket adták el január 1-jén, csak az egyedi, és meg kell mutatni a vásárló nevét és...
Hogyan töltötte be az adatokat az S3-ból a Greenplum-ba?
Mi az adatok partícionálása, és hogyan segít elkerülni a teljes tábla szkennelését?
Hogyan követhető nyomon, hogy melyik DAG futásában jelent meg egy adott sor a Data Vault-ban?
[név] beszélt arról, hogy különböző adatbázis-kezelő rendszerekkel dolgozott, mennyire mélyen kellett foglalkoznia az optimalizálással és a belső részletekkel.
A megjelenített képernyőn két adatszerkezet van; melyikben lesz gyorsabb a 2 érték keresése és miért?