Sobes.tech

Data Engineer

Jak zaprojektowałbyś skalowalne ładowanie danych z wielu API REST: od pozyskiwania danych do S3, z interfejsem dla analityka?

Senior
3

Czym jest SQL procedural?

Middle
3

Opowiedz nam o sobie i swoim doświadczeniu w inżynierii danych.

Senior
3

Jest 101 obiekt: 100 zer i 1 jedynka. Po sortowaniu według wyniku, najpierw są 50 zer, potem jeden, a potem kolejne 50 zer. Jakie są ROC AUC i kształt krzywej ROC?

Middle+
3

Jakie są wady indeksów oprócz zajmowanego miejsca?

Middle
3

W boostingu gradientowym już zbudowano kompozycję N bazowych algorytmów. Co będzie celem dla nowego, N+1-ego algorytmu?

Middle+
3

Dlaczego leniwe oceny są przydatne?

Middle
3

Czym jest spill danych w Spark i jak go unikać, jeśli nie można po prostu dodać zasobów?

3

Jak poradziłbyś sobie z wysokim obciążeniem transformacji danych?

3

Czym różnią się tryby uruchomienia Spark: cluster, client i local?

3

Jakie są zalety i wady implementacji ładowarki API jako niestandardowego operatora/hooka Airflow w porównaniu do osobnej biblioteki lub usługi kontenerowej?

Senior
3

2. Istnieje tabela t, która zawiera sumę transakcji klientów za dzień: - Napisz zapytanie, które dla każdego wiersza pokaże transakcje klienta za bieżący i poprzedni dzień kalendarzowy Ostateczna tabela jest poniżej:

Middle
3

Czym są leniwe oceny i jak je rozumieć?

Middle
3

Jakie typowe zadania rozwiązałeś w Airflow?

Middle
3

Data, numer zamówienia, suma select date, sum(amount) as sum_amount from t group by date having sum(amount) > 1000000 order by sum_amount desc limit 3

Middle
3

Czym są modele gwiazdy i Data Vault?

Middle
3

Opowiedz o sobie: gdzie ostatnio pracowałeś, czym się zajmowałeś, czego szukasz i dlaczego?

Middle+
2

Gdzie znajdują się Driver i Executors w trybie cluster i dlaczego jest to używane w produkcji?

2

Gdzie dokładnie występuje gradient w algorytmie boostingu gradientowego, jeśli podstawowy algorytm to prosty drzewo decyzyjne?

Middle+
2
/38