Data Engineer
Kādi procesi tiek uzsākti, kad dzēšam vai mainām ierakstus ClickHouse?
Kāda ir atšķirība starp refaktoringu un optimizāciju?
Kad kad mums nav nepieciešama datu glabāšana?
Kafka uzdevums: producents nosūta preces cenas izmaiņas (200 rubļu, pēc tam 300 rubļu), patērētājs ir replikēts 3 podos. Vai būs problēmas noklusējuma konfigurācijā?
Vai esi strādājis ar logu funkcijām? Kādas logu funkciju veidus pazīsti?
Mēs ievadām metadatus kā ievadi, un tas balstās uz šiem metadatiem — kā tas ļaus ātri pārvietot esošos plūsmas no vecajām sistēmām uz plānotajām?
Kāda veida tipizācija tiek izmantota Python: statiska vai dinamiska?
Kā rīkoties, ja user_id ir skew (nepareiza sadalīšana) pievienojoties transakciju un lietotāju tabulām? Kā izvēlēties optimālo sadalījuma atslēgu?
Pārdojumu analīze pēc preču kategorijām mazumtirdzniecības veikalā Jūs strādājat analītiķa amatā mazumtirdzniecības veikalā. Jūsu uzdevums ir sastādīt pārdojumu pārskatu pēc preču kategorijām ar aprēķiniem: • kopējais pārdoto vienību skaits kategorijā (total_units_sold); • kopējais ieņēmums pēc kategorijas, ņemot vērā atlaides, kur atlaide tiek piemērota kā unit_price × units_sold × (1 − discount/100). Ja atlaide nav (NULL), uzskatīt to par 0%. Noapaļot līdz diviem decimāldaļas zīmēm; • vidējais pārdoto vienību skaits uz vienu pārdošanu (avg_units_per_sale), noapaļots līdz diviem decimāldaļas zīmēm; • atlaides neietverto pārdojumu daļa (no_discount_share) — pārdojumu skaits ar NULL vai 0% atlaidi, dalīts ar kopējo pārdojumu skaitu kategorijā, noapaļots līdz trim decimāldaļas zīmēm: Vispirms rezultātu sakārtojiet pēc samazināšanas pēc total_revenue, pēc tam pa augošo pēc vidējā vienību skaita (avg_units_per_sale), un beigās pēc kategorijas nosaukuma alfabētiskā secībā: Ievades formāts Pārdojumu tabula: • sale_id (int) — unikāls pārdošanas identifikators • product_id (int) — produkta identifikators • category (text) — produkta kategorija • sale_date (timestamp) — pārdošanas datums un laiks • units_sold (int) — pārdoto vienību skaits • unit_price (numeric) — vienības cena • discount (numeric) — produkta atlaide procentos, var būt NULL Atlaides kolonna var saturēt izlaidumus: Izvades formāts Vaicājumam jāatgriež tabula ar šādiem laukiem šādā secībā: • category (text) — produkta kategorija • total_units_sold (int) — kopējais pārdoto vienību skaits šajā kategorijā • total_revenue (numeric) — kopējie ieņēmumi pēc kategorijas, ņemot vērā atlaides, noapaļoti līdz diviem decimāldaļas zīmēm • avg_units_per_sale (numeric) — vidējais vienību skaits vienā pasūtījumā, noapaļots līdz diviem decimāldaļas zīmēm • no_discount_share (numeric) — atlaides neietverto pārdojumu daļa, no 0 līdz 1, noapaļota līdz trim decimāldaļām Rezultātā vispirms sakārtojiet pēc samazināšanas pēc total_revenue, pēc tam pa augošo pēc avg_units_per_sale, un beigās pēc kategorijas nosaukuma alfabētiskā secībā.
Krātuve tika būvēta pēc Data Vault shēmas — vai tu taip pat to plėtojai, palaikei? Rūpīgi pievienoji hubus, saites?
Kā izvēlēties pareizo sharding atslēgu datu vienmērīgai sadalei?
Kā jūs rīkotos ar Materialized View ķēdi caur starpposma ReplacingMergeTree tabulu, lai pareizi aizpildītu jau esošos datus pirms jaunas MV palaišanas?
Kā jūs saprotat atslēgu jēdzienu tabulās — kam tas ir nepieciešams?
Kā ielādēt datus no Kafka uz ClickHouse, izmantojot streaming, reāllaika atskaitēm?
Kas ir primārā atslēga ClickHouse un kā tā atšķiras no parastajās datu bāzēs izmantotās primārās atslēgas?
Kāda ir atšķirība starp komandām docker run un docker exec?
Kuras SQL operatoru grupas pazīsti? Pie kā tās pieder?
Kas ir Catalyst optimizators Spark un kādus konkrētus optimizācijas piemērus tas veic (piemēram, predicate pushdown)?
Kāda ir algoritmiskā sarežģītība, lai iegūtu elementu pēc atslēgas no vārdnīcas (dict) Python?
Kā salīdzināt sākotnējo („dzīvo”) un mērķa tabulu, ja avots pastāvīgi mainās?