Data Engineer
Kur var apskatīt uzdevumu žurnālus Airflow?
CREATE TABLE orders ( driver_id varchar, city varchar, order_id varchar ); -- Saņemiet 10 labākos vadītājus pēc pasūtījumu skaita katrā pilsētā
Dotas divas tabulas t1 un t2. Uzdevums ir uzskaitīt visas join veidus, kurus jūs zināt, un vaicājuma rezultātu select * from t1 <join> t2 on t1.t = t2.t katram no tiem. |t1.t| ------ 1 2 4 null ------ |t2.t| ------ 1 3 null null
Kur datu saspiešana darbojas labāk — kolonnas vai rindas glabāšanā un kāpēc?
SELECT * FROM table1 AS t1 LEFT JOIN table2 AS t2 ON t1.date_start > t2.date_start
IZVĒLIES * No tabulas1 kā t1 Kreisais JOIN tabula2 kā t2 ON t1.date_start > t2.date_start d = { True: 42, 1: 2, 1.0: 100500 } print(d)
Kas ir indeksi datu bāzēs, kam tie ir nepieciešami un kāda ir to iekšējā struktūra?
Kā atšķiras cikls pa virkni no cikla pa tuple Python? Kādi ir pamata tipi un kā tas ietekmē veiktspēju?
Fitnesa klubu apmeklējumu analīze Jūs strādājat kā analītiķis fitnesa klubu tīklā. Jums ir informācija par lietotāju apmeklējumiem un viņu iegādātajām abonementiem. Ir jāanalizē abonementu efektivitāte. Aprēķiniet katra abonementa veida: • kopējo lietotāju skaitu, kuri ir izmantojuši šo abonementa veidu. Ņemiet vērā tikai unikālos user_id; • kopējo apmeklējumu skaitu ar šo abonementu. Ņemiet vērā visus lietotāju apmeklējumus ar šo abonementu; • šo abonementa lietotāju daļu procentos no kopējā lietotāju skaita (noapaļotu līdz vienam ciparam aiz komata). Lai aprēķinātu daļu, izmantojiet šo abonementa lietotāju skaitu attiecībā pret kopējo unikālo lietotāju skaitu. Katram lietotājam var būt tikai viens abonements. Rezultātu kārtojiet pēc abonementa veida alfabētiskā secībā. Ievades formāts Abonementu tabula: • membership_id (int) — unikāls abonementa identifikators • user_id (int) — lietotāja identifikators • membership_type (text) — abonementa veids Apmeklējumu tabula: • visit_id (int) — apmeklējuma unikāls identifikators • user_id (int) — lietotāja identifikators • visit_date (timestamp) — apmeklējuma datums un laiks Dati nesatur tukšas vai nepareizas vērtības. Izvades formāts Vaicājumam jāatgriež tabula ar laukiem šādā secībā: • membership_type (text) — abonementa veids • users_count (int) — unikālo lietotāju skaits ar šo abonementa veidu • total_visits (int) — kopējais apmeklējumu skaits ar šo abonementu • user_share (numeric) — šo abonementa lietotāju daļa procentos no kopējā lietotāju skaita (noapaļota līdz 1 ciparam aiz komata) Rezultāts ir sakārtots pēc abonementa veida alfabētiskā secībā.
Threading, multiprocessing, asyncio: kāda ir atšķirība un kad ir labāk ko izmantot?
Pastāstiet par savu pieredzi ar Greenplum, DBT un Data Vault. Kāpēc pārgājāt no sniegpārsla modeļa uz Data Vault?
Kā pieiet situācijai, kad biznesa nodaļa pieprasa ziņojumu ar datu vizualizāciju par jauno akciju?
Pastāsti, ko tu zini par kolonnas un rindas datu glabāšanu. Kad un kuru izvēlēties un kāpēc?
Pastāsti par savu darba pieredzi: uzdevumi, tehnoloģiju steks
Kāda ir atšķirība starp RANK() un DENSE_RANK()?
Kur parādās paralēlisms Airflow?
Kāpēc Pandas ir labāks par parastajām sarakstiem un vārdnīcām Python?
Kā Pandas apstrādā trūkstošos datus?
Kā jūs strādājāt ar Impala?
Cik daudz papildu atmiņas prasa vārdu krājuma risinājums, neskaitot atgrieztos datus?