Cum ai proiecta o încărcare scalabilă de date din mai multe API-uri REST: de la achiziția datelor până la S3, cu o interfață pentru un analist?
Data Engineer
Ce este SQL procedural?
Spune-ne despre tine și experiența ta în ingineria datelor.
Există 101 obiect: 100 zero și 1 unu. După sortare după scor, urmează 50 de zero, apoi unu, apoi încă 50 de zero. Care sunt ROC AUC și forma curbei ROC?
Care sunt dezavantajele indexurilor în afară de spațiul pe care îl ocupă?
În boosting-ul pe gradient, deja a fost construită o compoziție din N algoritmi de bază. Care va fi ținta pentru noul, N+1-lea algoritm?
De ce sunt utile evaluările leneșe?
Ce este spill-ul de date în Spark și cum să îl eviți dacă nu poți adăuga resurse simplu?
Cum ai gestiona transformările de date cu încărcare mare?
Cum diferă modurile de lansare ale Spark: cluster, client și local?
Care sunt avantajele și dezavantajele implementării unui încărcător API ca operator/hook personalizat Airflow în comparație cu o bibliotecă sau serviciu de containere separat?
2. Există un tabel t, care listează suma tranzacțiilor clienților pe zi: - Scrieți o interogare care pentru fiecare rând arată tranzacțiile clientului pentru ziua curentă și cea precedentă Tabelul final este mai jos:
Ce sunt evaluările leneșe și cum să le înțelegi?
Ce sarcini tipice ai rezolvat în Airflow?
Data, numărul comenzii, suma select date, sum(amount) as sum_amount from t group by date having sum(amount) > 1000000 order by sum_amount desc limit 3
Ce sunt modelele în stea și Data Vault?
Spune-ne despre tine: unde ai lucrat ultima dată, ce ai făcut, ce cauți și de ce?
Unde se află Driver și Executors în modul cluster și de ce este folosit în producție?
Unde anume apare gradientul în algoritmul de boosting pe gradient dacă algoritmul de bază este un simplu arbore de decizie?
Din ce componente sunt alcătuite Greenplum și Hadoop HDFS?