Data Engineer
Máte skúsenosti s optimalizáciou úloh Spark? Môžete uviesť konkrétny príklad?
Je slovník v Pythone zmeniteľný alebo nezmeniteľný typ? Aké sú požiadavky na jeho kľúče a hodnoty?
Aké sú nevýhody UDF v Spark a aký je ich najväčší mínus?
Ako obvykle organizujete svoju prácu na úlohách a ako sledujete pokrok?
V akom poradí sa vykonávajú hlavné operácie v SQL: SELECT, FROM atď.?
Ako boli údaje z vonkajšej tabuľky načítané do cieľových tabuliek?
Máte otázky ohľadom tímu a úlohy?
Aké máš plány na nasledujúcich 5 rokov? V ktorých oblastiach by si sa chcel rozvíjať?
Aké sú výhody a nevýhody distribuovaných systémov databáz?
Uveďte príklad, kedy sa vám podarilo zlepšiť procesy alebo nástroje pre tím.
Kto boli spotrebitelia dát a ako boli stavané vitríny?
Porozprávajte o sebe, kde ste pracovali, čím ste sa zaoberali, aké boli zaujímavé úlohy a neúspechy.
Čo sa stalo a ako chcete vrátiť prácu?
Ako obično pracujete s Git-om v tímu? In kaj je Merge Request?
Aký formát práce je pre vás najpohodlnejší — kancelária, hybrid alebo vzdialená práca? Máme dve kancelárie, na Kutuzovskom a v Tule.
Povedajte nám viac o skreslení dát medzi shardami: ako bolo určené a ako bola použitá príslušná funkcia/mechanizmus?
Uveďte známe funkcie okien SQL.
Na čem slúži omejitev cene zunanega ključa in kakšen je smisel omejitve pri brisanju/posodabljanju ob prisotnosti odvisnih zapisov (logično)?
Použili ste jeden S3 bucket alebo viac? Podľa akého princípu?
Ako dobre poznáte Linux/Docker?