Cuéntame sobre la tarea de configuración de replicación que resolviste.
Data Engineer
¿Cómo evitar/eliminar el sesgo de datos en Spark?
¿Qué algoritmo de diagnóstico y qué hacer si la consulta sigue siendo lenta después de agregar varios índices?
¿Qué es la normalización y el modelo ER, para qué sirven?
¿En qué casos se aplica la normalización y en cuáles la desnormalización?
Cuente sobre los conceptos básicos de Kafka (grupo de consumidores, particiones, temas).
¿Cuáles son las causas típicas de que una consulta en una base de datos relacional funcione lentamente?
Proponga una solución para la carga incremental regular de una gran tabla con una frecuencia de actualización flexible (cambiable) desde Postgres hacia Data Lake.
¿Qué problemas no evidentes pueden surgir al cargar tablas grandes (aparte del rendimiento)?
¿Cómo están relacionados la ordenación dentro de la función de ventana y la ordenación final ORDER BY en la consulta?
¿Cómo gestionar los recursos de una aplicación Spark para no gastar de más memoria al cambiar el volumen de datos de entrada?
¿Cómo trabajar con particiones a través de coalesce y repartition?
¿Existen otros mecanismos de control de shuffle además de coalesce/repartition?
¿Qué imágenes de Docker has tenido que construir y para qué?
¿Qué parámetros de Spark JDBC se utilizaron para paralelizar la lectura?