Data Engineer
Kde lze v Airflow zobrazit logy úloh?
Dvě tabulky t1 a t2 jsou dány. Úkolem je vypsat všechny druhy spojení (join), které znáte, a výsledek dotazu select * from t1 <join> t2 on t1.t = t2.t pro každý z nich. |t1.t| ------ 1 2 4 null ------ |t2.t| ------ 1 3 null null
CREATE TABLE orders ( driver_id varchar, city varchar, order_id varchar ); -- Získejte 10 nejlepších řidičů podle počtu objednávek v každém městě
Jaký je rozdíl mezi RANK() a DENSE_RANK()?
SELECT * FROM table1 AS t1 LEFT JOIN table2 AS t2 ON t1.date_start > t2.date_start
Pověz mi o své pracovní zkušenosti: úkoly, technologický stack
Kde funguje lepší komprese dat — v sloupcovém nebo řádkovém uložení a proč?
Jak Pandas zpracovává chybějící data?
Analýza návštěvnosti fitness klubů Pracujete jako analytik v síti fitness klubů. Máte informace o návštěvách uživatelů a o zakoupených členstvích. Je třeba analyzovat efektivitu využívání členství. Vypočítejte pro každý typ členství: • celkový počet uživatelů, kteří tento typ členství využili. Zohledněte pouze unikátní user_id; • celkový počet návštěv s tímto členstvím. Zohledněte všechny návštěvy uživatelů s tímto členstvím; • podíl uživatelů tohoto členství v procentech z celkového počtu uživatelů (zaokrouhleno na jedno desetinné místo). Pro výpočet podílu použijte poměr počtu uživatelů s tímto členstvím k celkovému počtu unikátních uživatelů. Každý uživatel může mít pouze jedno členství. Seřaďte výsledek podle typu členství v abecedním pořadí. Formát vstupu Tabulka memberships: • membership_id (int) — unikátní identifikátor členství • user_id (int) — unikátní identifikátor uživatele • membership_type (text) — typ členství Tabulka visits: • visit_id (int) — unikátní identifikátor návštěvy • user_id (int) — identifikátor uživatele • visit_date (timestamp) — datum a čas návštěvy Data neobsahují chybějící nebo nesprávné hodnoty. Formát výstupu Dotaz by měl vrátit tabulku s poli v tomto pořadí: • membership_type (text) — typ členství • users_count (int) — počet unikátních uživatelů s tímto typem členství • total_visits (int) — celkový počet návštěv uživatelů s tímto členstvím • user_share (numeric) — podíl uživatelů v procentech s tímto členstvím od celkového počtu (zaokrouhleno na 1 desetinné místo) Výsledek je seřazen podle typu členství v abecedním pořadí.
VYBERTE * Z tabulky1 jako t1 LEVA JOIN tabulka2 jako t2 ON t1.date_start > t2.date_start d = { True: 42, 1: 2, 1.0: 100500 } print(d)
Jak může dojít k SQL injection přes pole pro zadání data?
Kde se v Airflow objevuje paralelismus?
Povězte nám o své zkušenosti s Greenplum, DBT a Data Vault. Proč jste přešel od modelu sněhové vločky k Data Vault?
Co jsou indexy v databázích, k čemu slouží a jaká je jejich vnitřní struktura?
Jak funguje ClickHouse a v čem se liší od PostgreSQL?
Jak funguje optimalizátor dotazů v Oracle, na co se dívá a do jaké třídy patří?
Jaký je smysl rozdělování dat na bloky v HDFS?
V čem spočívá rozdíl mezi cyklem přes řetězec a cyklem přes tuple v Pythonu? Jaké typy jsou základní a jak to ovlivňuje výkon?
Threading, multiprocessing, asyncio: jaký je rozdíl a kdy je lepší co použít?
Pověz mi, co víš o sloupcovém a řádkovém ukládání dat. Kdy a které bys měl vybrat a proč?