Povězte mi o úloze s nastavením replikace, kterou jste řešili.
Data Engineer
Jak se vyhnout/odstranit zkreslení dat v Spark?
Jaký je diagnostický algoritmus a co dělat, pokud je dotaz stále pomalý po přidání několika indexů?
Co je normalizace a ER-model, k čemu slouží?
V jakých případech se používá normalizace a v jakých denormalizace?
Povězte o základních konceptech Kafka (skupina spotřebitelů, oddíly, témata).
Jaké jsou typické příčiny toho, že dotaz v relační databázi funguje pomalu?
Navrhněte řešení pro pravidelné inkrementální načítání velké tabulky s flexibilní (měnitelnou) frekvencí aktualizace z Postgres do Data Lake.
Jaké ne zřejmé problémy mohou nastat při načítání velkých tabulek (kromě výkonu)?
Jak sou spojeny řazení uvnitř okna funkce a konečné řazení ORDER BY v dotazu?
Jak spravovat zdroje aplikace Spark, aby nedocházelo k překročení paměti při změně objemu vstupních dat?
Jak pracovat s partiemi pomocí coalesce a repartition?
Existují jiné mechanismy řízení shuffle kromě coalesce/repartition?
Jaké Docker obrazy jste museli sestavit a proč?
Jaké parametry Spark JDBC byly použity pro paralelní čtení?