Data Engineer
Co je to dekorátor v Pythonu?
Jak nerovnoměrně rozdělit data této vitríny na tři shardy: 50 % na prvním a po 25 % na ostatních dvou?
V jaké situaci může hledání ve slovníku degradovat na nejhorší případ?
Jak bojovat s nekonzistencí dat?
Jak jste sledoval kvalitu dat?
S jakými databázemi jste pracoval? Jak funguje MongoDB a jak se škáluje?
Jak správně otevírat a zavírat soubory v Pythonu pomocí kontextového manažera?
Pokud je rozvrh DAG @daily, v kolik hodin se skutečně spouští?
Jak byla technicky realizována paralelní načítání velké tabulky z PostgreSQL do Spark v případě [kontext]?
V čem se liší list comprehension od běžného cyklu v Pythonu?
Jak jste obvykle řešili chyby a upozornění v pipelinech?
Jaké typy JOIN existují v SQL (logické) a v čem se liší?
Jak byly tabulky vytvořeny v clusteru a jak byl řešen problém, když kvůli ZooKeeper chyběla replika na shard?
Z jakých etapů se skládá transakce?
Co děláš ve volném čase? Máš nějaké osobní projekty?