Data Engineer
Jakie są wady architektury MPP w Greenplum?
Jak zrobić przedłużenie w górę (wypełnić NULL poprzednią niezerową wartością w kierunku odwrotnym)?
Jakie są rodzaje połączeń fizycznych (metody łączenia)?
Jak znaleźć podłańcuch w konkretnej kolumnie pliku logu w Linuxie (np. data w trzeciej kolumnie)?
Jakie metody usuwania danych istnieją w ClickHouse?
Jaki jest cel dzielenia danych na bloki w HDFS?
Jakie zalety i wady ACID można wymienić, oprócz szybkości odczytu?
Czy śledzenie pokazuje tylko żądania REST czy coś jeszcze?
Jak nie zabić Jupyter lub Pandas przez pamięć?
Czy Greenplum to OLTP czy analityczne magazynowanie?
Jakimi typami tabel w Greenplum się posługiwałeś? W jakich przypadkach używałeś heap, a w jakich Append-Optimized?
Czym różnią się generatory od list w Pythonie?
Jakie strategie ładowania przyrostowego w dbt stosowałeś?
Do czego służą indeksy, jakie są ich zalety i wady?
-- Oryginalna tabela stretch -- Należy wypełnić NULL wartości poprzednią (nie NULL) w zależności od id - wykonać wypełnianie w dół id | ttime | val ---|-------|----- 1 | 07:30 | NULL 1 | 09:21 | 10 1 | 13:53 | NULL 1 | 16:12 | NULL 2 | 09:42 | 133 2 | 15:20 | NULL 2 | 21:33 | NULL 3 | 08:01 | NULL 3 | 11:41 | 8 3 | 14:23 | NULL 3 | 16:17 | NULL 3 | 19:54 | 2 4 | 13:10 | 312 4 | 14:42 | NULL 4 | 16:31 | 7 4 | 17:44 | NULL id | ttime | val ---|-------|----- 1 | 07:30 | NULL 1 | 09:21 | 10 1 | 13:53 | 10 1 | 16:12 | 10 2 | 09:42 | 133 2 | 15:20 | 133 2 | 21:33 | 133 3 | 08:01 | NULL 3 | 11:41 | 8 3 | 14:23 | 8 3 | 16:17 | 8 3 | 19:54 | 2 4 | 13:10 | 312 4 | 14:42 | 312 4 | 16:31 | 7 4 | 17:44 | 7 -- Zapytanie SQL do uzyskania pożądanej tabeli SELECT id, ttime, COALESCE(val, LAST_VALUE(val) OVER(PARTITION BY id ORDER BY ttime)) as val FROM stretch
Jak pracowali z CI/CD?
Jaki typ odczytu jest używany w Greenplum: wierszowy czy kolumnowy?
Czym są martwe wiersze w bazie danych?
Czym różni się partycjonowanie od sharding?
Czym jest GIL (Global Interpreter Lock)?