Jak byste navrhli škálovatelné načítání dat z více REST API: od získávání dat po S3, s rozhraním pro analytika?
Data Engineer
Co je procedurální SQL?
Povězte nám o sobě a svých zkušenostech v datovém inženýrství.
Existuje 101 objekt: 100 nula a 1 jedna. Po seřazení podle skóre přichází nejprve 50 nul, pak jedna, a pak dalších 50 nul. Jaké jsou jeho ROC AUC a tvar ROC křivky?
Jaké jsou nevýhody indexů kromě jejich zabraného místa?
V gradient boosting již byla postavena kompozice N základních algoritmů. Jaký bude cíl pro nový, N+1-tý algoritmus?
Proč jsou lenivé hodnocení užitečné?
Co je to data spill v Spark a jak mu zabránit, pokud nelze jednoduše přidat zdroje?
Jak byste řešili transformace dat s vysokou zátěží?
Jak se liší režimy spuštění Spark: cluster, client a local?
Jaké jsou výhody a nevýhody implementace API loaderu jako vlastního operátora/hooku v Airflow ve srovnání s samostatnou knihovnou nebo kontejnerovou službou?
2. Existuje tabulka t, která uvádí součet transakcí klientů za den: - Napiš dotaz, který pro každý řádek ukáže transakce klienta za aktuální a předchozí kalendářní den Finální tabulka je níže:
Co jsou líné vyhodnocení a jak je pochopit?
Jaké typické úkoly jste vyřešili v Airflow?
Datum, objednávkové číslo, částka select date, sum(amount) as sum_amount from t group by date having sum(amount) > 1000000 order by sum_amount desc limit 3
Co jsou hvězdové modely a Data Vault?
Povězte nám o sobě: kde jste naposledy pracoval, čím jste se zabýval, co hledáte a proč?
Kde se nachází Driver a Executors v režimu cluster a proč se používá v produkci?
Kde přesně se v algoritmu gradient boosting vyskytuje gradient, pokud je základní algoritmus jednoduché rozhodovací strom?
Z jakých komponent se skládá Greenplum a Hadoop HDFS?