Data Engineer
Kde môžete vidieť denníky úloh v Airflow?
CREATE TABLE orders ( driver_id varchar, city varchar, order_id varchar ); -- Získajte top 10 vodičov podľa počtu objednávok v každom meste
Dve tabuľky t1 a t2 sú dané. Úlohou je vypísať všetky druhy joinov, ktoré poznáte, a výsledok dotazu select * from t1 <join> t2 on t1.t = t2.t pre každý z nich. |t1.t| ------ 1 2 4 null ------ |t2.t| ------ 1 3 null null
Kde funguje najlepšie kompresia údajov — v stĺpcovom alebo riadkovom uložení a prečo?
SELECT * FROM table1 AS t1 LEFT JOIN table2 AS t2 ON t1.date_start > t2.date_start
VYBERTE * Z tabuľky1 ako t1 ĽAVÝ JOIN tabuľky2 ako t2 ON t1.date_start > t2.date_start d = { True: 42, 1: 2, 1.0: 100500 } print(d)
Čo sú indexy v databázach, na čo slúžia a aká je ich vnútorná štruktúra?
V čem spočívá rozdíl mezi cyklom přes řetězec a cyklom přes tuple v Pythonu? Jaké typy jsou základní a jak to ovlivňuje výkon?
Analýza návštevnosti fitness klubov Pracujete ako analytik v sieti fitness klubov. Máte informácie o návštevách používateľov a o predplatných, ktoré kupujú. Je potrebné analyzovať efektívnosť využívania predplatných. Vypočítajte pre každý typ predplatného: • celkový počet používateľov, ktorí tento typ predplatného použili. Zvážte iba jedinečné user_id; • celkový počet návštev pre toto predplatné. Zvážte všetky návštevy používateľov s týmto predplatným; • podiel používateľov tohto predplatného v percentách z celkového počtu používateľov (zaokrúhlené na jedno desatinné miesto). Na výpočet použite pomer medzi počtom používateľov s týmto predplatným a celkovým počtom jedinečných používateľov. Každý používateľ môže mať iba jedno predplatné. Výsledok zoradte podľa typu predplatného abecedne.
Threading, multiprocessing, asyncio: aký je rozdiel a kedy je lepšie čo použiť?
Povedajte nám o vašich skúsenostiach s Greenplum, DBT a Data Vault. Prečo ste prešli od modelu snehovej vločky k Data Vault?
Ako pristúpiť k situácii, keď podnik žiada správu s vizualizáciou údajov o novej akcii?
Povedz mi, čo vieš o stĺpcovom a riadkovom ukladaní dát. Kedy a ktoré by si mal vybrať a prečo?
Povej mi o svoji delovni izkušnji: naloge, tehnološki sklad
Aký je rozdiel medzi RANK() a DENSE_RANK()?
Kde sa v Airflow objavuje paralelizmus?
Prečo je Pandas lepší ako bežné zoznamy a slovníky v Pythone?
Ako spracováva Pandas chýbajúce údaje?
Ako ste pracovali s Impala?
Koľko dodatočnej pamäte vyžaduje riešenie so slovníkom, okrem vracaných údajov?