Data Engineer
Čo je to plán dotazov? Na čo sú potrebné?
Čo je Catalyst optimalizátor v Spark a aké konkrétne optimalizácie vykonáva (napríklad predicate pushdown)?
Spomínal si Docker procesy, môžeš podrobnejšie vysvetliť, ako je to u vás zariadené?
Ako postúpiť pri skew (šikmosti) na user_id pri JOIN tabelách transakcií a používateľov? Ako vybrať optimálny kľúč rozdelenia?
Aké sú vlastnosti používania XCom v Airflow?
V PostgreSQL je potrebné optimalizovať výkon transakcií pomocou minimálnej úrovne izolácie, pri ktorej: • paralelné transakcie môžu vidieť nedokončené zmeny iných; • sú možné "špinavé čítania" (dirty read). Akú úroveň izolácie je potrebné určiť pre transakciu, aby sa dosiahol tento cieľ? špinavé čítanie nie je v PostgreSQL možné repeatable read read uncommitted read committed serializable
Aké indexy poznáte v PostgreSQL?
Pracovali ste s dátovými vitrínami (vrstva DWH)?
Pracoval ste priamo so Spark? Aké je jeho mínus?
Ako sa v súčasnosti spracovávajú údaje? Ak sú v rôznych formátoch, ako sa normalizujú a zjednocujú?
Veta feature obsahuje niekoľko commitov s nesprávne commitnutým súborom config.yaml, ktorý bol neskôr opravený. V dôsledku toho sa tím rozhodol úplne odstrániť všetky zmeny súboru z histórie, aby zabránil zverejneniu dôverných nastavení. Pôvodný stav vetvy (výstup príkazu git log --oneline): 1 a4b5c67 (HEAD -> feature) Refaktoroval logiku služby 2 d9f0a11 Opravil preklep v config.yaml 3 7c1d3f2 Pridal dočasný config.yaml 4 e3a98cd Počiatočný commit 5 Po prepísaní histórie na odstránenie súboru config.yaml sa výstup git log --oneline zmenil na: 6 b9e7d42 (HEAD -> feature) Refaktoroval logiku služby 7 41f3b60 Počiatočný commit Akú operáciu tím vykonal? - Spustil git revert na commite s config.yaml - Spustil git filter-branch --index-filter "git rm --cached config.yaml" -- --all - Spustil git rebase -i odstránením commitov obsahujúcich zmeny v súbore - Spustil git commit --amend a git push --force - Použil git cherry-pick na vytvorenie novej vetvy bez config.yaml
Čo je to CTE (Spoločný Výraz Tabuľky)?
Ako často sa počítali vitríny? Bol to inkrementálny alebo úplný výpočet?
Bol skúsenosti v oblasti Data Science — práca s modelmi, štatistikou?
Správa pre logistickú spoločnosť Ste analytik v logistickej spoločnosti, ktorá zaznamenáva operácie na skladoch. Musíte vypracovať správu o efektívnosti každého skladu. Pre každý sklad vypočítajte: • celkový počet operácií (count_operations); • celkový počet spracovaných tovarov na sklade (sum_quantity); • priemerný čas spracovania operácie (avg_processing_time), pričom zohľadňujte iba operácie s určeným časom (nie NULL), zaokrúhlený na celé číslo; • maximálny a minimálny počet tovarov spracovaných v jednej operácii (max_quantity, min_quantity); • počet operácií každého typu («dodávka», «odoslanie», «presun») v samostatných stĺpcoch: supply_operations, shipment_operations, transfer_operations. Filtrovať sklady, ktorých celkový počet operácií je viac ako 2 a priemerný čas spracovania nepresahuje 60 minút. Usporiadať výsledok podľa ID skladu vzostupne. Formát vstupu Tabuľka operations: • operation_id (int) — jedinečný identifikátor operácie • warehouse_id (int) — ID skladu • operation_type (text) — typ operácie: «dodávka», «odoslanie», «presun»
Daný je reťazec order, ktorý určuje požadovaný poradok znakov. Je potrebné preusporiadať znaky v reťazci unsorted_str tak, aby poradie bolo v súlade s reťazcom order. Oba reťazce pozostávajú z malých písmen anglickej abecedy, všetky znaky v order sú odlišné. Poradie znakov v unsorted_str sa nazýva v súlade s reťazcom order, ak je z toho, že znak x stojí pred znakom y v order, vyplýva, že akékoľvek výskyt x v unsorted_str musí byť pred akýmkoľvek výskytom y. Situácie, keď v order nie sú znaky z unsorted_str a naopak, sú povolené. Vráťte akúkoľvek povolenú permutáciu. unsorted_str = "abcd" order = "cba" odpoveď = "dcba" ("cdba", "cbda", "cbad") def CustomSort(unsorted_str: str, order: str) -> str: # kód tu
Ako rozdeliť dopyt na etapy? Čo pre to robíme?
Kedy môžeš dať spätnú väzbu a máš ponuky na rukách?
Pracovali ste s incidentmi kvality údajov?
Čo vás motivuje v práci? Uveďte svoje silné stránky v oblasti hard skills.