Ako by ste navrhli škálovateľné načítanie dát z viacerých REST API: od získavania dát po S3, s rozhraním pre analytika?
Data Engineer
Čo je procedurálny SQL?
Povedzte nám o sebe a svojich skúsenostiach v dátovom inžinierstve.
Existuje 101 objekt: 100 nula a 1 jedna. Po zoradení podľa skóre, najprv sú 50 nula, potom jedna, a potom ďalších 50 nula. Aké sú jeho ROC AUC a tvar ROC krivky?
Aké sú nevýhody indexov okrem zaberanej miesta?
V gradient boostingu je už postavená kompozícia N základných algoritmov. Čo bude cieľom pre nový, N+1-ty algoritmus?
Prečo sú lenivé hodnotenia užitočné?
Čo je data spill v Spark a ako ho chcete predísť, ak nemôžete jednoducho pridať zdroje?
Ako by ste obravnavali visoko obremenjene transformacije podatkov?
Ako sa líšia spustenia Spark: cluster, client a local?
Aké sú výhody a nevýhody implementácie API loadera ako vlastného operátora/hooku v Airflow v porovnaní s samostatnou knižnicou alebo kontajnerovou službou?
2. Existuje tabuľka t, ktorá uvádza súčet transakcií klientov za deň: - Napíšte dotaz, ktorý pre každý riadok ukáže transakcie klienta za aktuálny a predchádzajúci kalendárny deň Finálna tabuľka je nižšie:
Čo sú lenivé hodnotenia a ako ich pochopiť?
Aké typické úlohy ste vyriešili v Airflow?
dátum, číslo objednávky, suma select date, sum(amount) as sum_amount from t group by date having sum(amount) > 1000000 order by sum_amount desc limit 3
Čo sú hviezdne modely a Data Vault?
Povedzte nám o sebe: kde ste naposledy pracovali, čím ste sa zaoberali, čo hľadáte a prečo?
Kde sa nachádzajú Driver a Executors v režime cluster a prečo sa používa v produkcii?
Kde presne sa v algoritme gradient boosting vyskytuje gradient, ak je základný algoritmus jednoduché rozhodovacie strom?
Z akých komponentov sa skladá Greenplum a Hadoop HDFS?