Linux/Docker ilə nə qədər tanışsınız?
Data Engineer
Spark-də shuffle nədir və niyə lazımdır?
Spark-də shuffle necə idarə olunur (bölmə, broadcast join və s.)?
Iceberg formatı adi Parquet ilə müqayisədə nə gətirir?
Ümumi cədvəl ifadələri (CTE) ilə tanışsınız? İstifadə nümunəsi verin.
Verilənlər bazası idarəetmə sistemləri və sorğu optimizasiyası kontekstində statistika nədir?
Linux-da log faylında müəyyən bir sütundakı alt sətiri necə tapmaq olar (məsələn, üçüncü sütundakı tarix)?
[ad] müxtəlif verilənlər bazası idarəetmə sistemləri ilə işləmə təcrübəsindən, optimallaşdırma və daxili detallara nə qədər dərindən baş vurduğundan danışdı.
Mənbədən artımın ələ keçirilməsi alqoritmini ətraflı izah edin ki, yükləmə tezliyi dəyişdirildikdə heç nə itirilməsin.
Mənbə daim dəyişirsə, orijinal ("canlı") və hədəf cədvəllərini necə müqayisə etmək olar?
Iceberg-də çox mərhələli ETL (sil+əlavə et) zamanı oxuma prosesi cədvəlin müvəqqəti (uyğunsuz) vəziyyətini görə bilərsə, bu problemi necə həll etmək olar?
Kafka-dan eyni mesajın müxtəlif istehlakçılar tərəfindən oxunmasını necə təşkil etmək olar (fan-out)?
"Ölü cütlük" (dead tuple) nədir?
Spark JDBC nədir və onun vasitəsilə böyük cədvəli necə səmərəli yükləmək olar?
İndekslərin tətbiqi üçün ən yaxşı təcrübələr haqqında danışın - nə zaman və nə qədər tez-tez istifadə edilməlidir.
Spark bölmələri və cədvəllərdəki bölmələr (məsələn, Iceberg-də) necə əlaqəlidir?
Spark-da məlumatların qeyri-bərabərliyi (data skew) necə aşkarlanır?
DBMS-də əməliyyat qeydiyyatı (WAL) nədir və niyə lazımdır?
Qeydiyyatların hash müqayisə metodu mənbə və hədəf cədvəli arasındakı fərqi hesablamaq üçün istifadə edildimi?
Spark-də cache və persist nə üçün lazımdır?