Greenplum-da ACID riayət olunurmu?
Data Engineer
ClickHouse-də qeydiyyatları silərkən və ya dəyişdirərkən hansı proseslər başlayır?
Data Vault rahat bir vasitədir, amma çox obyekt olur. Hublar, linklər və satelitlər arasındakı fərqi izah edə bilərsənmi?
Rust dilində yazılmış, çox ipli və çox sürətli olan, Pandas-ı əvəz edə biləcək bir kitabxana tanıyırsan?
CTE ilə alt sorğu arasındakı fərq nədir?
Sorğunu mərhələlərə necə bölürük? Bunun üçün nə edirik?
Parquet-ə məlumatların yüklənməsi üçün hansı texnologiyalardan istifadə etdiniz və məlumatları alma və yükləmək üçün hansı mexanizmlər istifadə olundu?
Spark-dan S3-ə Parquet formatında məlumat yüklədinizmi və sonra Parquet-dən Greenplum-a — yükləmə prosesi necə baş verir?
Xarici cədvəldən məlumatlar necə hədəf cədvəllərə yükləndi?
Airflow DAG və işləri necə yazdın — əl ilə və ya şablonlar iləmi?
Axınla işləyirdi, eşitmisən? Bu fayl saxlama zibildir.
Git ilə işlədinizmi? Git-də nə saxlayırdınız?
İşlər arasında asılılıqlar, DAG-lər arasında — sensorlardan istifadə etdinizmi ki, onlar ardıcıl olaraq bir neçə işi başlasın?
Verilənlər bazasının sxeməsini necə tərtib edirdiniz — birbaşa bazada əl iləmi edirdiniz, yoxsa skriptləri harasa saxlayırdınız, yoxsa ümumiyyətlə Liquibase istifadə edirdiniz, proses necə idi?
Bu real vaxtdır, Kafka və ClickHouse Spark arasında necə həyata keçirmək olar?
Sorğuda yalnız bir dəfə istifadə olunursa, CTE istifadə etməyin mənası varmı?
JSON-u parse edəcəyik — JSON-u kim parse edəcək? Bildiyim qədər, ClickHouse-də funksiyalar yoxdur.
Spark ilə birbaşa işlədinizmi? Onun mənfi tərəfi nədir?
Bizə çox sürətli axınlar yaratmağa imkan verən pipeline mühərriki lazımdır — bu mexanizm müqavilələr və parametrlər daxil edilərək çox sürətli axınlar yaratmağa imkan verir. Bunu yuxarı səviyyədə necə həyata keçirərdin?
Iceberg, S3-dən verilənlər bazası yaratmağa imkan verən bir mühərrikdir, hətta ACID-ə də riayət edir. Onun mənfi tərəfi nədir?