Data Engineer
Hər müştəri üçün yalnız başlanğıc tarixi məlum olduqda, son tam adını necə çıxarmaq olar (son tarix məlum deyil)?
[ad] soruşdu: Klasterin bütün düyünlərində məlumatların aktual qalması üçün cədvəl motoruna nə əlavə edilməlidir?
Əlaqəli verilənlər bazaları ilə qarşılıqlı əlaqə halları olubmu?
Oracle-də bölmələmə haqqında danışın: nə üçün istifadə olunur və hansı növləri var?
[ad] soruşdu: 'Uçuşlar tapıldı mı' sahəsi yalnız iki dəyərə malikdir (bəli/xeyr). Bunu ClickHouse-da necə daha yaxşı təmsil etmək olar? Bool üçün daxili olaraq hansı məlumat tipi istifadə olunur?
Layihələrinizi necə təşkil edirsiniz? README yazırsınız yoxsa başqa bir şey?
Kafka ilə heç bir çətinlik yoxdur, əsas odur ki, məlumatları işləyin — hansı nüanslara diqqət yetirmək lazımdır?
PostgreSQL-də B-ağac və hash indekslərini hansı hallarda istifadə etmək lazımdır?
Sorğu planı nədir? Nəyə görə lazımdır?
CREATE TABLE core.localUserMetadata ON CLUSTER cluster_4x2 ( UserId String, Country String, LastLoginDate DateTime ) ENGINE = ReplikasiyaliReplacingMergeTree() ORDER BY (UserId); CREATE TABLE core.userMetadata ON CLUSTER cluster_4x2 ( UserId String, Country String, LastLoginDate DateTime ) ENGINE = Dağıtılmış('cluster_4x2', 'core', 'localUserMetadata', cityHash64(LastLoginDate));
Airflow-da XCom istifadə xüsusiyyətləri hansılardır?
Yaddaş Data Vault sxeməsinə uyğun inşa edilib — sən də onu inkişaf etdirdin, dəstəklədin? Əl ilə hub və linklər əlavə etdinizmi?
PostgreSQL-də tranzaksiyaların performansını minimum izolasiya səviyyəsi ilə optimallaşdırmaq lazımdır ki: • paralel tranzaksiyalar bir-birinin tamamlanmamış dəyişikliklərini görə bilsin; • "kirlənmiş oxuma" (dirty read) mümkün olsun. Bu məqsədə çatmaq üçün tranzaksiya üçün hansı izolasiya səviyyəsini göstərmək lazımdır? PostgreSQL-də dirty read mümkün deyil repeatable read read uncommitted read committed serializable
Portal vasitəsilə fayllar və ya məlumatlar əldə etmək üçün FTP ilə işlədinizmi?
PostgreSQL-də hansı indeksləri bilirsiniz?
Partitionlama nədir? Sharding nədir? Replikasiya nədir?
Spark ilə birbaşa işlədinizmi? Onun mənfi tərəfi nədir?
Bildirişlər cədvəlində status sahəsi var və onun dəyərləri: 'sent', 'delivered', 'read'. Hansı sorğu düzgündür? select * from notifications where status like '%sent%' order by created_at desc limit 5 select * from notifications where status = 'read' order by created_at desc limit 5 select * from notifications order by status desc limit 5 select * from notifications where status not in ('sent', 'delivered') order by created_at asc limit 5 select * from notifications where status in ('sent', 'delivered') order by created_at desc limit 5
Hazırda məlumatlar necə işlənir? Əgər müxtəlif formatlarda olsalar, necə normalizə edilir və vahid formaya gətirilir?
Xüsusiyyət filialı bir neçə uğursuz şəkildə qeyd olunmuş config.yaml faylı olan commitlər ehtiva edir və daha sonra düzəldilmişdir. Nəticədə, komanda gizli konfiqurasiya ayarlarının açıqlanmasının qarşısını almaq üçün fayldakı bütün dəyişiklikləri tarixdən tamamilə silməyə qərar verdi. Filialın ilkin vəziyyəti (git log --oneline çıxışı): 1 a4b5c67 (HEAD -> feature) Xidmət məntiqini yenidən qurdu 2 d9f0a11 config.yaml yazım səhvini düzəltdi 3 7c1d3f2 Müvəqqəti config.yaml əlavə etdi 4 e3a98cd İlkin commit 5 Tarixi yenidən yazaraq config.yaml faylını siləndən sonra, git log --oneline çıxışı belə oldu: 6 b9e7d42 (HEAD -> feature) Xidmət məntiqini yenidən qurdu 7 41f3b60 İlkin commit Komanda hansı əməliyyatı həyata keçirdi? - git revert əməliyyatını config.yaml olan commit üzərində həyata keçirdi - git filter-branch --index-filter "git rm --cached config.yaml" -- --all əməliyyatını yerinə yetirdi - git rebase -i əməliyyatını, fayl dəyişiklikləri olan commitləri silərək həyata keçirdi - git commit --amend və git push --force əməliyyatlarını istifadə etdi - git cherry-pick əməliyyatını, config.yaml olmadan yeni bir filial yaratmaq üçün istifadə etdi