Data Engineer
¿Qué tipo de almacenamiento tiene Parquet: de filas o de columnas?
¿Por qué bool([""]) devuelve True?
¿En qué campos se realizó la unión de datos y cómo se eliminaron los duplicados en la vista?
¿Qué sabes sobre spill en Spark?
¿En qué tecnologías se basa su lakehouse y qué problemas surgen al trabajar con Apache Iceberg?
¿S3 fue el único almacenamiento principal o se utilizaron varios?
¿Cómo ejecutar el segundo DAG de Airflow inmediatamente después de que el primero termine con éxito?
Cuéntenos sobre el proyecto o tarea más importante en Python en el último año.
¿Qué comando cambia los permisos de acceso a los archivos en Linux?
Cuéntame, ¿dónde has trabajado como analista de sistemas y qué tareas realizaste?
¿Qué es la normalización y el modelo ER, para qué sirven?
¿Además de la API, qué otros métodos y protocolos utilizó para trabajar con las fuentes de datos?
¿Has trabajado con gestores de contexto en Python? ¿Qué son y para qué sirven?
¿Qué agentes y modelos se utilizan dentro de su solución de IA corporativa? ¿Escribe código por usted?
¿Para qué sirven cache y persist en Spark?
¿Cómo ejecutaron los DAGs: por cron, conjuntos de datos, disparadores o dependencias?
importar clickhouse_driver from airflow.hooks.base import * def get_clickhouse_client(): conn = BaseHook.get_connection("clickhouse_default") return clickhouse_driver.Client( host=conn.host, port=conn.port, user=conn.login, password=conn.password, database=conn.schema )
¿Qué parámetros de Spark JDBC se utilizaron para paralelizar la lectura?
¿Qué es un CROSS JOIN y cuál es el resultado de su aplicación?
¿En qué dirección sería interesante desarrollarse: escaparates, desarrollo, análisis, tal vez IA?