Data Engineer
Airflow-da tapşırıqlar arasında məlumatların necə ötürülməsi?
Özünüz haqqında danışın: nə ilə məşğul oldunuz, hansı texnologiyadan istifadə etdiniz və bu nə cür layihə idi?
[ad] soruşdu: ClickHouse-də yalnız 2 il üçün məlumatların saxlanmasını necə həyata keçirmək olar?
Zəhmət olmasa, son bir ildəki təcrübəniz haqqında danışın: hansı komanda, hansı vəzifələr, hansı rol və ən maraqlı vəzifə nə idi.
Şəkildə göstərilən cədvəl quruluşu yaradılıb. Şəkildə göstərilən sorğunu icra etmək lazımdır. [...]-in yerinə hansı join növü istifadə edilməlidir ki, nəticədə type = 'table_aw' üçün 'naming' sütunu doldurulsun və type = 'table2' üçün 'serial_number' sütunu doldurulsun? create table multirelation( type varchar not null, entity_id integer not null ); create table table_aw( id integer primary key, naming varchar not null ); create table table2( id integer primary key, serial_number varchar not null ); -- cədvəl strukturu select m.type,m.entity_id, ta.naming, t2.serial_number from multirelation m [...] join table_aw ta on m.entity_id = ta.id and m.type='table_aw' [...] join table2 t2 on m.entity_id = t2.id and m.type='table2'; -- sorğu Boş buraxın inner cross right left
Kodda normal (gözlənilən) paylanmadan əhəmiyyətli dərəcədə fərqlənən dəyəri necə təsvir edərdin?
Moskvadansan? Burada nə vaxtdır yaşayırsan? Niyə Moskva şəhərinə köçdün?
ETL və ELT zamanı saxlama üçün hesablama gücü tələbləri necə fərqlənir?
Gələcək işinizdə sizin üçün nə vacibdir?
Sizdə pis işləyən, yavaş və ya çöken sorğu var — onu necə optimallaşdırmaq olar?
Greenplum ilə işləyərkən hansı problemlərlə üzləşdiniz?
Spark JDBC nədir və onun vasitəsilə böyük cədvəli necə səmərəli yükləmək olar?
CROSS JOIN nədir və onun tətbiqinin nəticəsi nədir?
Sorğuların optimallaşdırılması təcrübənizi xatırlaya bilərsinizmi? Necə hərəkət etdiniz, analiz etdiniz?
Data Vault mövcud deyil və iki geniş cədvəl birləşdirilməlidir. Bunu Greenplumda necə optimallaşdırardın? Və ya ClickHouse-da olsaydı?
Hansı tapşırıqlar üçün ClickHouse uyğun deyil və onun yerinə nə seçərdiniz?
git submodule update --init
EXPLAIN-in icra planı həmişə gerçəkdə icra olunanla uyğun gəlirmi?
Broadcast mexanizmi necə fiziki şəkildə baş verir — kiçik cədvəlin bölmələri böyük cədvəl ilə işləyən executor'lara necə çatır?
Hansı vizuallaşdırma alətləri ilə işlədiniz və Power BI ilə nə qədər sıx işlədiniz?