Data Engineer
Kā atšķiras partīcijām no sharding?
Vai indeksi vienmēr uzlabo veiktspēju vai var radīt degradāciju?
Kā Linux atrast apakšvirkni konkrētā log faila kolonnā (piemēram, datumu trešajā kolonnā)?
Attiecībā uz vaicājumu mēs varam redzēt, kas notiek ar datiem, tostarp kādiem savienojumu veidiem — kādus savienojumu veidus mēs varam redzēt tur?
Kā jūs strādājāt ar CI/CD?
Kura no zemāk minētajiem apgalvojumiem atspoguļo šādu darbību sekas no paplašinātā Git Flow un izmaiņu vēstures pārvaldības skatpunkta?
Kā lasīt 100 gigabaitu lielu failu Python?
Kādi ir rindas un kolonnas datu bāzu priekšrocības un trūkumi? Kas ir efektīvāk grupēšanai un agregācijai?
Kas ir Hive un kā tas atšķiras no tradicionālajām relāciju datu bāzēm?
Mikroservisu arhitektūras projektēšanas uzdevums: kā nodrošināt datus pasūtījumu tabulai (preces, cenas, pasūtījumi), ja ir trīs atsevišķi mikroservisi?
Kādus fiziskos JOIN-us pazīstat?
Pastāstiet man par savu darba pieredzi
Vai tev ir pieredze ar Docker attēliem, vidi veidošanā virtuālajā mašīnā?
Kāda bija jūsu arhitektūra projektā? DWH vai kaut kas cits?
Ziņojums loģistikas uzņēmumam Jūs esat loģistikas uzņēmuma analītiķis, kurš uzrauga noliktavu operāciju uzskaiti. Jums jāizstrādā ziņojums par katra noliktavas efektivitāti. Katrā noliktavā aprēķiniet: • kopējo operāciju skaitu (count_operations); • noliktavā apstrādāto preču kopējo daudzumu (sum_quantity); • vidējo operācijas apstrādes laiku (avg_processing_time), ņemot vērā tikai operācijas ar norādīto laiku (ne NULL), noapaļotu līdz veselam skaitlim; • maksimālo un minimālo preču daudzumu, apstrādātu vienā operācijā (max_quantity, min_quantity); • katra veida operāciju skaitu («piegāde», «sūtīšana», «pārvietošana») atsevišķās kolonnās: supply_operations, shipment_operations, transfer_operations. Filtrējiet noliktavas, kuru kopējais operāciju skaits ir lielāks par 2 un vidējais apstrādes laiks nepārsniedz 60 minūtes. Rezultātu kārtojiet pēc noliktavas ID augošā secībā. Ievades formāts Operāciju tabula: • operation_id (int) — operācijas unikālais identifikators • warehouse_id (int) — noliktavas identifikators • operation_type (text) — operācijas veids: «piegāde», «sūtīšana», «pārvietošana» • quantity (int) — preču daudzums operācijā • operation_date (timestamp) — operācijas datums un laiks • processing_time (int) — operācijas apstrādes laiks Kolonna processing_time var saturēt izlaistus datus. Izvades formāts Vaicājumam jāatgriež tabula ar šādiem laukiem kārtībā: • warehouse_id (int) — noliktavas unikālais identifikators • count_operations (int) — kopējais veiktu operāciju skaits noliktavā • sum_quantity (int) — kopējais apstrādāto preču daudzums noliktavā • avg_processing_time (numeric) — operācijas vidējais apstrādes laiks (minūtēs), ņemot vērā tikai ne NULL laiku, noapaļots līdz veselam skaitlim • max_quantity (int) — lielākais apstrādāto preču daudzums vienā operācijā • min_quantity (int) — mazākais apstrādāto preču daudzums vienā operācijā • supply_operations (int) — «piegādes» operāciju skaits • shipment_operations (int) — «sūtīšanas» operāciju skaits • transfer_operations (int) — «pārvietošanas» operāciju skaits
Kādus JOIN veidus pazīsti? Izskaidro 2-3 galvenos.
Pastāsti par Airflow izmantošanu: kādus nestandarta elementus tu izmantoji
Vai jūs pazīstat Domain Driven Design (DDD) metodoloģiju? Ja jā, dalieties piemēros tās piemērošanā jūsu projektos.
Kādas datu kvalitātes pārbaudes tika veiktas Data Vault?
Kas ir dinamiskā tipizācija?