Ինչպե՞ս կդիզայնեք մասշտաբային տվյալների բեռնման մի քանի REST API-ներից՝ տվյալների ձեռքբերումից մինչև S3, վերլուծաբանի համար ինտերֆեյսով։
Data Engineer
Ի՞նչ է պրոցեդուրական SQL-ը։
Իմացեք մեզ ձեր մասին և ձեր փորձը տվյալների ինժեներության ոլորտում։
Կան 101 օբյեկտ՝ 100-ը զրո և 1-ը մեկ։ Դրանից հետո, ըստ գնահատականների, առաջինը 50 զրո, ապա մեկ, և հետո ևս 50 զրո։ Ինչպիսի՞ն է նրա ROC AUC-ն և ROC գծի ձևը։
Ինդեքսների բացասական կողմերը բացի զբաղեցրած տարածքից ինչպիսի՞ն են:
Գրադիենտ բուստինգում արդեն կառուցվել է N հիմնական ալգորիթմներից կազմված կոմպոզիցիա։ Ինչ կլինի նոր, N+1-րդ ալգորիթմի նպատակը։
Ինչու՞ են դանդաղ գնահատումները օգտակար:
Ի՞նչ է data spill-ը Spark-ում և ինչպես խուսափել դրանից, եթե ռեսուրսներ պարզապես ավելացնել հնարավոր չէ:
Ինչպե՞ս կվարվեիք բարձրաբեռնված տվյալների փոխակերպումների հետ։
Ինչպես են տարբեր Spark-ի գործարկման ռեժիմները՝ cluster, client և local?
Ինչ են API բեռնարկի իրականացման առավելությունները և թերությունները որպես հատուկ Airflow օպերատոր/hook համեմատած առանձին գրադարանի կամ կոնտեյներային ծառայության հետ?
2. Կա t աղյուսակը, որը ցուցադրում է հաճախորդների գործարքների գումարը օրական: - Գրեք հարցում, որը յուրաքանչյուր տողի համար ցույց է տալիս հաճախորդի գործարքները ընթացիկ և նախորդ օրացույցի համար Վերջնական աղյուսակը ստորև է:
Ի՞նչ են դանդաղ գնահատումները և ինչպես հասկանալ դրանք։
Ի՞նչ սովորական առաջադրանքներ եք լուծել Airflow-ում։
Ամսաթիվ, պատվերի համար, գումար select date, sum(amount) as sum_amount from t group by date having sum(amount) > 1000000 order by sum_amount desc limit 3
Ի՞նչ են աստղային մոդելները և Data Vault-ը։
Իմացեք ձեր մասին: որտեղ եք վերջին անգամ աշխատել, ինչ եք արել, ինչ եք փնտրում և ինչու։
Որտե՞ղ են գտնվում Driver և Executors-ը cluster ռեժիմում և ինչու է դա օգտագործվում արտադրությունում:
Որտե՞զ է հենց գրադիենտը առաջանում է գրադիենտ բուստինգի ալգորիթմում, եթե հիմնական ալգորիթմը պարզ որոշումային ծառ է։
Ինչ բաղադրիչներից է բաղկացած Greenplum և Hadoop HDFS-ը?