Data Engineer
Aký formát práce je pre vás najpohodlnejší — kancelária, hybrid alebo vzdialená práca? Máme dve kancelárie, na Kutuzovskom a v Tule.
Zodpovedá plán vykonávania z EXPLAIN tomu, čo sa skutočne vykonáva?
Ako zabezpečiť, aby mobilný klient mal prístup k rovnakým objednávkam, ale s menším počtom polí? Čo je BFF?
Máte dopyt, ktorý zle funguje, je pomalý alebo padá — ako ho optimalizovať?
Poznáte spoločné výrazy tabuliek (CTE)? Uveďte príklad použitia.
Povedajte nám viac o skreslení dát medzi shardami: ako bolo určené a ako bola použitá príslušná funkcia/mechanizmus?
Povedzte nám o používaní PL/SQL procedúr vo vašej práci.
Na čem slúži omejitev cene zunanega ključa in kakšen je smisel omejitve pri brisanju/posodabljanju ob prisotnosti odvisnih zapisov (logično)?
Čo je shuffle v Spark a prečo je dôležité ho minimalizovať?
Aký je rozdiel medzi ROWS BETWEEN a RANGE BETWEEN?
Čo je premenná var, akého je typu?
Poznáte UDF (Používateľom definované funkcie) v ClickHouse, pracovali ste s nimi?
Je slovník v Pythone zmeniteľný alebo nezmeniteľný typ? Aké sú požiadavky na jeho kľúče a hodnoty?
Koľko bolo celkovo stiahnutí — vysoké úrovne práce, vlákna?
Ako boli údaje z vonkajšej tabuľky načítané do cieľových tabuliek?
Aký je rozdiel medzi operátormi is a == v Pythone?
Máte otázky ohľadom tímu a úlohy?
Na čo sa používajú dekorátory v Apache Airflow?
VYTVORTE TABUĽKU raw.local_transactions NA KLASTRE cluster_4x2 ( transaction_id String, user_id String, amount Float64, created_at DateTime ) MOTOR = ReplicatedMergeTree() PARTÍCIONOVAŤ PODĽA amount ZORADIŤ PODĽA (transaction_id); VYTVORTE TABUĽKU raw.transactions NA KLASTRE cluster_4x2 ( transaction_id String, user_id String, amount Float64, created_at DateTime ) MOTOR = Distributed('cluster_4x2', 'raw', 'local_transactions', cityHash64(user_id));
Uveďte známe funkcie okien SQL.