¿Cómo diseñarías una carga de datos escalable desde múltiples API REST: desde la adquisición de datos hasta S3, con una interfaz para un analista?
Data Engineer
¿Qué es SQL procedural?
Cuéntanos sobre ti y tu experiencia en ingeniería de datos.
Hay 101 objetos: 100 ceros y 1 uno. Después de ordenar por puntuación, primero vienen 50 ceros, luego uno, y después otros 50 ceros. ¿Cuáles son su ROC AUC y la forma de la curva ROC?
¿Cuáles son las desventajas de los índices además del espacio que ocupan?
En el boosting de gradiente, ya se ha construido una composición de N algoritmos base. ¿Cuál será el objetivo para el nuevo, N+1-ésimo algoritmo?
¿Por qué son útiles las evaluaciones perezosas?
¿Qué es el spill de datos en Spark y cómo evitarlo si no se pueden agregar recursos fácilmente?
¿Cómo manejaría las transformaciones de datos de alta carga?
¿En qué se diferencian los modos de lanzamiento de Spark: cluster, client y local?
¿Cuáles son las ventajas y desventajas de implementar un cargador de API como un operador/hook personalizado de Airflow en comparación con una biblioteca o servicio de contenedores separado?
2. Hay una tabla t, que lista la suma de transacciones de clientes por día: - Escribe una consulta que para cada fila muestre las transacciones del cliente para el día calendario actual y el anterior La tabla final está abajo:
¿Qué son las evaluaciones perezosas y cómo entenderlas?
¿Qué tareas típicas has resuelto en Airflow?
fecha, número de pedido, cantidad select date, sum(amount) as sum_amount from t group by date having sum(amount) > 1000000 order by sum_amount desc limit 3
¿Qué son los modelos en estrella y Data Vault?
Cuéntanos sobre ti: ¿dónde trabajaste por última vez, qué hacías, qué buscas y por qué?
¿Dónde se encuentran Driver y Executors en modo cluster y por qué se usa en producción?
¿Dónde exactamente ocurre el gradiente en el algoritmo de boosting por gradiente si el algoritmo base es un árbol de decisión simple?
¿De qué componentes consta Greenplum y Hadoop HDFS?