Həll etdiyiniz replikasiya qurğusunun tapşırığı haqqında danışın.
Data Engineer
Normalizasiya və ER modeli nədir, onlar nə üçün lazımdır?
Spark-də məlumatların tərəfkeşliyini necə qarşısını almaq və ya aradan qaldırmaq olar?
Hansı hallarda normalizasiya tətbiq olunur və hansı hallarda denormalizasiya?
Bir neçə indeks əlavə etdikdən sonra sorğu hələ də yavaşdırsa, hansı diaqnostika alqoritmi və nə etmək lazımdır?
Kafka-nın əsas anlayışları haqqında danışın (istehlakçı qrupu, bölmələr, mövzular).
Əlaqəli verilənlər bazasında sorğunun yavaş işləməsinin tipik səbəbləri hansılardır?
Böyük cədvəllərin yüklənməsi zamanı (performans xaricində) hansı qeyri-aydın problemlər ortaya çıxa bilər?
Postgres-dən Data Lake-ə böyük cədvəlin çevik (dəyişən) yeniləmə tezliyi ilə müntəzəm inkremental yüklənməsi üçün həll təklif edin.
Pəncərə funksiyası daxilindəki sıralama və sorğudakı yekun ORDER BY sıralaması necə əlaqəlidir?
Giriş məlumatlarının həcmi dəyişdikdə Spark tətbiqinin resurslarını necə idarə etmək olar ki, yaddaş aşılmasın?
Coalesce və repartition vasitəsilə bölmələrlə necə işləmək olar?
Hansı Docker görüntülərini yaratmalı oldunuz və niyə?
Coalesce/repartition-dən başqa shuffle idarəetmə mexanizmləri varmı?
Oxumağı paralelləşdirmək üçün Spark JDBC üçün hansı parametrlər istifadə olunub?