Data Engineer
Koji su nedostaci MPP arhitekture u Greenplum?
Kako napraviti produžetak na gore (popuniti NULL prethodnom nenultom vrednošću u suprotnom pravcu)?
Koje vrste fizičkih veza (metode spajanja) postoje?
Kako pronaći podniz u određenoj koloni log fajla u Linuxu (npr. datum u trećoj koloni)?
Koje načine postoje za brisanje podataka u ClickHouse?
Koji je smisao deljenja podataka na blokove u HDFS?
Koje se prednosti i mane ACID-a mogu navesti, osim brzine čitanja?
Da li prikazivanje praćenja prikazuje samo REST zahteve ili nešto drugo?
Kako ne ubiti Jupyter ili Pandas zbog memorije?
Da li je Greenplum OLTP ili analitičko skladište?
Koje tipove tabela ste koristili u Greenplum? U kojim slučajevima je korišćen heap, a u kojim Append-Optimized?
Čime se generatori razlikuju od listi u Pythonu?
Koje strategije inkrementalnog učitavanja si koristio u dbt?
Zašto su potrebni indeksi, koje su njihove prednosti i mane?
-- Originalna tabela stretch -- Potrebno je popuniti NULL vrednosti prethodnom (ne NULL) vrednošću po id - izvršiti popunjavanje nadole id | ttime | val ---|-------|----- 1 | 07:30 | NULL 1 | 09:21 | 10 1 | 13:53 | NULL 1 | 16:12 | NULL 2 | 09:42 | 133 2 | 15:20 | NULL 2 | 21:33 | NULL 3 | 08:01 | NULL 3 | 11:41 | 8 3 | 14:23 | NULL 3 | 16:17 | NULL 3 | 19:54 | 2 4 | 13:10 | 312 4 | 14:42 | NULL 4 | 16:31 | 7 4 | 17:44 | NULL id | ttime | val ---|-------|----- 1 | 07:30 | NULL 1 | 09:21 | 10 1 | 13:53 | 10 1 | 16:12 | 10 2 | 09:42 | 133 2 | 15:20 | 133 2 | 21:33 | 133 3 | 08:01 | NULL 3 | 11:41 | 8 3 | 14:23 | 8 3 | 16:17 | 8 3 | 19:54 | 2 4 | 13:10 | 312 4 | 14:42 | 312 4 | 16:31 | 7 4 | 17:44 | 7 -- SQL upit za dobijanje željene tabele SELECT id, ttime, COALESCE(val, LAST_VALUE(val) OVER(PARTITION BY id ORDER BY ttime)) as val FROM stretch
Kako ste radili sa CI/CD?
Koji tip čitanja se koristi u Greenplum: red ili kolona?
Šta su mrtve linije u bazi podataka?
Čime se razlikuje particionisanje od shardinga?
Šta je GIL (Global Interpreter Lock)?