Jak zaprojektowałbyś skalowalne ładowanie danych z wielu API REST: od pozyskiwania danych do S3, z interfejsem dla analityka?
Data Engineer
Czym jest SQL procedural?
Opowiedz nam o sobie i swoim doświadczeniu w inżynierii danych.
Jest 101 obiekt: 100 zer i 1 jedynka. Po sortowaniu według wyniku, najpierw są 50 zer, potem jeden, a potem kolejne 50 zer. Jakie są ROC AUC i kształt krzywej ROC?
Jakie są wady indeksów oprócz zajmowanego miejsca?
W boostingu gradientowym już zbudowano kompozycję N bazowych algorytmów. Co będzie celem dla nowego, N+1-ego algorytmu?
Dlaczego leniwe oceny są przydatne?
Czym jest spill danych w Spark i jak go unikać, jeśli nie można po prostu dodać zasobów?
Jak poradziłbyś sobie z wysokim obciążeniem transformacji danych?
Czym różnią się tryby uruchomienia Spark: cluster, client i local?
Jakie są zalety i wady implementacji ładowarki API jako niestandardowego operatora/hooka Airflow w porównaniu do osobnej biblioteki lub usługi kontenerowej?
2. Istnieje tabela t, która zawiera sumę transakcji klientów za dzień: - Napisz zapytanie, które dla każdego wiersza pokaże transakcje klienta za bieżący i poprzedni dzień kalendarzowy Ostateczna tabela jest poniżej:
Czym są leniwe oceny i jak je rozumieć?
Jakie typowe zadania rozwiązałeś w Airflow?
Data, numer zamówienia, suma select date, sum(amount) as sum_amount from t group by date having sum(amount) > 1000000 order by sum_amount desc limit 3
Czym są modele gwiazdy i Data Vault?
Opowiedz o sobie: gdzie ostatnio pracowałeś, czym się zajmowałeś, czego szukasz i dlaczego?
Gdzie znajdują się Driver i Executors w trybie cluster i dlaczego jest to używane w produkcji?
Gdzie dokładnie występuje gradient w algorytmie boostingu gradientowego, jeśli podstawowy algorytm to prosty drzewo decyzyjne?
Z jakich komponent składa się Greenplum i Hadoop HDFS?