Kā jūs plānotu mērogojamu datu ielādi no vairākiem REST API: no datu iegūšanas līdz S3, ar saskarni analītiķim?
Data Engineer
Kas ir procedurālais SQL?
Pastāstiet mums par sevi un savu pieredzi datu inženierijā.
Ir 101 objekts: 100 nulles un 1 viens. Pēc kārtošanas pēc rezultāta, vispirms ir 50 nulles, tad viens, un vēl 50 nulles. Kāds ir tā ROC AUC un ROC līknes forma?
Kādi ir indeksu trūkumi, izņemot to, ka tie aizņem vietu?
Gradienta pastiprinājumā jau ir izveidota N pamatālo algoritmu sastāvs. Kāds būs mērķis jaunajam, N+1. algoritmam?
Kāpēc slinki novērtējumi ir noderīgi?
Kas ir datu noplūde Spark un kā to izvairīties, ja resursus nevar vienkārši pievienot?
Kā jūs rīkotos ar augstas slodzes datu pārveidojumiem?
Kā atšķiras Spark palaišanas režīmi: cluster, client un local?
Kādi ir API ielādētāja īstenošanas plusi un mīnusi kā pielāgotam Airflow operatoram/hook, salīdzinot ar atsevišķu bibliotēku vai konteineru pakalpojumu?
2. Ir tabula t, kas norāda klientu darījumu summu dienā: - Uzrakstiet vaicājumu, kas katrā rindā parāda klienta darījumus pašreizējā un iepriekšējā kalendārajā dienā Galīgā tabula ir zemāk:
Kas ir slinki novērtējumi un kā tos saprast?
Kādas tipiskas uzdevumus esat atrisinājis Airflow?
Datums, pasūtījuma numurs, summa select date, sum(amount) as sum_amount from t group by date having sum(amount) > 1000000 order by sum_amount desc limit 3
Kas ir zvaigžņu modeļi un Data Vault?
Pastāstiet par sevi: kur jūs pēdējo reizi strādājāt, ko darījāt, ko meklējat un kāpēc?
Kur atrodas Driver un Executors klastera režīmā un kāpēc tas tiek izmantots ražošanā?
Kur tieši notiek gradients gradienta pastiprināšanas algoritmā, ja pamata algoritms ir vienkāršs lēmumu koks?
No kādiem komponentiem sastāv Greenplum un Hadoop HDFS?