Data Engineer
Да ли сте упознати са ReplicatedQueue? Да ли имате искуства са њом?
Да ли си радио статистичке провере?
Kako je tehnički realizovana paralelna učitavanja velike tabele iz PostgreSQL u Spark u slučaju [kontekst]?
Kako neravnomerno rasporediti podatke ove vitrine na tri shard-a: 50% na prvom i po 25% na preostala dva?
Kako pravilno otvarati i zatvarati fajlove u Python-u koristeći kontekst menadžer?
Kako se razlikuju zahtevi za računarskom snagom skladišta pri ETL i ELT?
Čime se list comprehension razlikuje od običajne petlje u Pythonu?
Koje vrste JOIN-a postoje u SQL (logički) i kako se razlikuju?
# šta prikazuje s = 'abracadabra' print(s[5][0][0][0]) print(s[::-2]) s = [1, 2, 3] print(s * 2)
Kako su kreirane tabele u klasteru i kako ste rešili problem kada je zbog ZooKeeper-a nedostajala replika na shard-u?
Od kojih faza se sastoji transakcija?
Vrste JOIN i njihove razlike
Kako sprečiti da netačni podaci učitani u vitrin ili međuspremnu tabelu dođu do viših pipeline-ova?
Kako ste obično obrađivali greške i upozorenja u pipeline-ovima?
Šta radi u slobodno vreme? Imaš li lične projekte?