Data Engineer
NULL plus 5 — nə qədər olacaq?
Spark-da bir Parquet faylından məlumatları paralel oxumaq mümkündürmü, yoxsa yalnız bir nüvədə bir tapşırıqda?
Hansı Python kitabxanaları ilə işlədiniz?
Spark-də tənbəl əməliyyatlar nədir və onlar nə üçün lazımdır?
CROSS JOIN nədir və onun tətbiqinin nəticəsi nədir?
ACID və CAP nəzəriyyəsi arasındakı fərq nədir?
Məlumatların birləşdirilməsi hansı sahələrdə baş verdi və vitrinada təkrarlamalar necə aradan qaldırıldı?
Partition növləri hansılardır?
Spark-də spill haqqında nə bilirsiniz?
Greenplum-da INSERT, UPDATE və DELETE zamanı fiziki olaraq nə baş verir; niyə DELETE-dən sonra diskdə yer boşaldılmır və DELETE ilə TRUNCATE arasındakı fərq nədir?
[Kontext] vəziyyətində PostgreSQL-dən Spark-ə böyük cədvəlin paralel şəkildə yüklənməsi texniki olaraq necə həyata keçirildi?
DAG uğursuzluqdan sonra yenidən başlatdıqda, S3-dəki məlumatların tamamlanmamış məlumatlarla üst-üstə düşməməsi üçün fayllarla necə işlədiniz?
Məlumatların vitrinə qeyri-bərabər paylanmasını necə həyata keçirmək olar: ilkində 50% və digər ikisində 25%?
İstifadəçi və tarix üzrə sifariş məbləğinin yığılmış toplamını əlavə etmək üçün SQL yazın.
Greenplum-da hansı açar növləri/paylanma strategiyaları mövcuddur?
OpenMetadata-ə necə qoşuldular və onunla nə etdilər?
@ sintaksisi olmadan dekorator yarada və tətbiq edə bilərikmi?
Coalesce və repartition vasitəsilə bölmələrlə necə işləmək olar?
Əgər DAG-in cədvəli @daily-disə, o həqiqətən nə vaxt başlayır?
ReplicatedQueue ilə tanışsınız? Onunla işləmə təcrübəniz varmı?