Bir neçə REST API-dən miqyaslana bilən məlumat yükləməsini necə dizayn edərdiniz: məlumatların əldə edilməsindən S3-ə, analitik üçün interfeys ilə?
Data Engineer
Prosedural SQL nədir?
Özünüz və məlumat mühəndisliyi sahəsində təcrübəniz haqqında danışın.
101 obyekt var: 100 sıfır və 1 bir. Ballara görə sıralandıqdan sonra, əvvəlcə 50 sıfır, sonra bir, sonra başqa 50 sıfır gəlir. ROC AUC və ROC əyrisinin forması nədir?
İndekslərin tutduğu yerdən başqa hansı mənfi cəhətləri var?
Gradient boosting-də, artıq N əsas alqoritmdən ibarət tərkib yaradılıb. Yeni, N+1-ci alqoritm üçün məqsəd nə olacaq?
Tənbəl qiymətləndirmələr niyə faydalıdır?
Spark-də məlumat sızıntısı nədir və resursları sadə şəkildə əlavə edə bilmirsinizsə, necə qarşısını almaq olar?
Yüksək yüklü məlumatların çevrilməsini necə idarə edərdiniz?
Spark-ın işə salma modları necə fərqlənir: cluster, client və local?
API yükləyicisini xüsusi Airflow operatoru/hook-u kimi həyata keçirməyin üstünlükləri və mənfi cəhətləri nədir, ayrıca kitabxana və ya konteyner xidməti ilə müqayisədə?
2. Müştəri əməliyyatlarının gündəlik cəmini göstərən t adlı cədvəl var: - Hər sətir üçün müştərinin cari və əvvəlki təqvim günlərindəki əməliyyatlarını göstərən sorğu yazın Nəticə cədvəli aşağıda:
Tənbəl qiymətləndirmələr nədir və onları necə başa düşmək olar?
Airflow-də hansı tipik tapşırıqları həll etdiniz?
Tarix, sifariş nömrəsi, məbləğ select date, sum(amount) as sum_amount from t group by date having sum(amount) > 1000000 order by sum_amount desc limit 3
Ulduz modelləri və Data Vault nədir?
Özünüz haqqında danışın: son işlədiyiniz yer harada idi, nə ilə məşğul oldunuz, nə axtarırsınız və niyə?
Cluster rejimində Driver və Executors harada yerləşir və niyə istehsalda istifadə olunur?
Gradient boosting alqoritmində, əsas alqoritm sadə qərar ağacı isə, gradient dəqiq harada baş verir?
Greenplum və Hadoop HDFS hansı komponentlərdən ibarətdir?