Data Engineer
Kuidas edastada andmeid ülesannete vahel Airflow's?
Räägi endast: millega sa tegelesid, millist tehnoloogiat kasutad ja mis see projekt oli?
[nimi] küsis: Kuidas rakendada andmete säilitamist ainult 2 aasta jooksul ClickHouse'is?
Palun räägi mulle oma viimase aasta kogemusest: milline meeskond, millised ülesanded, milline roll ja mis oli kõige huvitavam ülesanne.
Struktuur tabelite, mis on näidatud pildil, on loodud. On vaja täita pildil näidatud päring. Millist join tüüpi tuleb kasutada [...]-i asemel, et tulemusena type = 'table_aw' kirjetel oleks täidetud veerg 'naming', ja type = 'table2' kirjetel — veerg 'serial_number'? create table multirelation( type varchar not null, entity_id integer not null ); create table table_aw( id integer primary key, naming varchar not null ); create table table2( id integer primary key, serial_number varchar not null ); -- tabelite struktuur select m.type,m.entity_id, ta.naming, t2.serial_number from multirelation m [...] join table_aw ta on m.entity_id = ta.id and m.type='table_aw' [...] join table2 t2 on m.entity_id = t2.id and m.type='table2'; -- päring Jäta tühjaks inner cross right left
Kuidas kirjeldaksid koodis kontrolli, et väärtus oluliselt erineb normaaljaotusest (oodatavast)?
Kas sa oled Moskvast? Kas sa oled siin juba pikka aega elanud? Miks sa kolisid Moskvasse?
Kuidas erinevad salvestamise arvutusvõimsuse nõuded ETL ja ELT puhul?
Mis on teie jaoks oluline tulevases töös?
Sul on päring, mis töötab halvasti, on aeglane või kukub kokku — kuidas seda optimeerida?
Milliste probleemidega te kokku puutusite Greenplumiga töötades?
Mis on Spark JDBC ja kuidas tõhusalt laadida suuret tabel läbi selle?
Mis on CROSS JOIN ja milline on selle rakendamise tulemus?
Kas saame meelde tuletada oma kogemust päringute optimeerimisel? Kuidas sa tegutsesid, analüüsisid?
Oletame, että Data Vault ei ole käytettävissä ja on kaksi laajaa taulukkoa, jotka on yhdistettävä. Kuinka optimoisit tämän Greenplumissa? Entä jos se olisi ClickHouse?
Milliste ülesannete jaoks ei sobi ClickHouse ja mida te selle asemel valiksite?
git submodule update --init
Kas EXPLAINi täitmise plaan alati vastab sellele, mis tegelikult toimub?
Kuidas toimub füüsiliselt broadcast-mehhanism — kuidas väikese tabeli jaotused jõuavad suure tabeliga töötavate täitjate juurde?
Milliste visualiseerimisvahenditega töötasite ja kui tihedalt töötasite Power BI-ga?