Data Engineer
Kā pārsūtīt datus starp uzdevumiem Airflow?
Kurš komandas no projekta galvenās mapes būtu jāizmanto, lai atjauninātu submoduli docs/ uz jaunāko versiju no attālā repozitorija un sagatavotu šo izmaiņu komitēšanai? git fetch docs/ && git merge docs/FETCH_HEAD git pull --recurse-submodules git submodule update --remote docs/ cd docs/ && git pull && cd .. && git commit -am "Atjauninājums" git submodule update --init docs/
Sniedziet piemēru, kad izdevās uzlabot procesus vai rīkus komandai.
Tika izveidota tabulu struktūra, norādīta attēlā. Ir nepieciešams izpildīt attēlā norādīto vaicājumu. Kura join veida vietā jālieto [...], lai rezultātā type = 'table_aw' ierakstiem būtu aizpildīts kolonna 'naming', bet type = 'table2' ierakstiem — kolonna 'serial_number'? create table multirelation( type varchar not null, entity_id integer not null ); create table table_aw( id integer primary key, naming varchar not null ); create table table2( id integer primary key, serial_number varchar not null ); -- tabulu struktūra select m.type,m.entity_id, ta.naming, t2.serial_number from multirelation m [...] join table_aw ta on m.entity_id = ta.id and m.type='table_aw' [...] join table2 t2 on m.entity_id = t2.id and m.type='table2'; -- vaicājums Atstājiet tukšu inner cross right left
Kādi bija datu patērētāji un kā tika būvētas vitrīnas?
Kas notika un kā atgūt darbu?
Kāda ir atšķirība starp Greenplum un PostgreSQL?
Kādā algā ceries?
Ziņojums loģistikas uzņēmumam Jūs esat loģistikas uzņēmuma analītiķis, kurš uzrauga noliktavu operāciju uzskaiti. Jums jāizstrādā ziņojums par katra noliktavas efektivitāti. Katrā noliktavā aprēķiniet: • kopējo operāciju skaitu (count_operations); • noliktavā apstrādāto preču kopējo daudzumu (sum_quantity); • vidējo operācijas apstrādes laiku (avg_processing_time), ņemot vērā tikai operācijas ar norādīto laiku (ne NULL), noapaļotu līdz veselam skaitlim; • maksimālo un minimālo preču daudzumu, apstrādātu vienā operācijā (max_quantity, min_quantity); • katra veida operāciju skaitu («piegāde», «sūtīšana», «pārvietošana») atsevišķās kolonnās: supply_operations, shipment_operations, transfer_operations. Filtrējiet noliktavas, kuru kopējais operāciju skaits ir lielāks par 2 un vidējais apstrādes laiks nepārsniedz 60 minūtes. Rezultātu kārtojiet pēc noliktavas ID augošā secībā. Ievades formāts Operāciju tabula: • operation_id (int) — operācijas unikālais identifikators • warehouse_id (int) — noliktavas identifikators • operation_type (text) — operācijas veids: «piegāde», «sūtīšana», «pārvietošana» • quantity (int) — preču daudzums operācijā • operation_date (timestamp) — operācijas datums un laiks • processing_time (int) — operācijas apstrādes laiks Kolonna processing_time var saturēt izlaistus datus. Izvades formāts Vaicājumam jāatgriež tabula ar šādiem laukiem kārtībā: • warehouse_id (int) — noliktavas unikālais identifikators • count_operations (int) — kopējais veiktu operāciju skaits noliktavā • sum_quantity (int) — kopējais apstrādāto preču daudzums noliktavā • avg_processing_time (numeric) — operācijas vidējais apstrādes laiks (minūtēs), ņemot vērā tikai ne NULL laiku, noapaļots līdz veselam skaitlim • max_quantity (int) — lielākais apstrādāto preču daudzums vienā operācijā • min_quantity (int) — mazākais apstrādāto preču daudzums vienā operācijā • supply_operations (int) — «piegādes» operāciju skaits • shipment_operations (int) — «sūtīšanas» operāciju skaits • transfer_operations (int) — «pārvietošanas» operāciju skaits
Kādas ir iezīmes un atšķirības starp Set un List Python? Papildus veiktspējai, kādas citas iezīmes ir?
Kreisais apvienojums: tabula ar 10 ierakstiem Kreisais apvienojums: tabula ar 100 ierakstiem. Kāds ir minimālais un maksimālais rindu skaits, ko var iegūt?
Kurios laukos jūs sadalījāt datus Greenplum?
Kādas datu kvalitātes pārbaudes tika veiktas Data Vault?
Attēlotajā ekrānā ir divas datu struktūras; kurā no tām meklēšana vērtībai 2 būs ātrāka un kāpēc?
SELECT client_id, ФИО, SUM(suma) AS total_amount FROM clients JOIN transactions ON clients.client_id = transactions.client_id WHERE дата = '2025-05-01' GROUP BY client_id, ФИО;
Kā parasti organizējat savu darbu uzdevumos un kā sekojat līdzi progresam?
Vai Greenplum ir funkcijas un iespējas, kas nav parastajā MySQL un citos dialektos?
[vārds] jautāja: Kā īstenot datu glabāšanu tikai 2 gadus ClickHouse?
Pastāsti, ko tev patīk darīt brīvajā laikā, papildus kodēšanai? Kādi ir tavi hobiji?
git submodule update --init