Sobes.tech

Data Engineer

¿Qué procesos se inician cuando eliminamos o modificamos registros en ClickHouse?

187

Data Vault es una herramienta conveniente, pero hay demasiados objetos. ¿Puedes explicar la diferencia entre hubs, enlaces y satélites?

187

¿Puedes contar qué vamos a obtener al final aquí? Necesitas comentar cada paso, cómo funciona.

186

¿Conoces alguna biblioteca en Rust que sea multihilo, muy rápida, y que pueda reemplazar Pandas para procesamiento de Data Science y Big Data?

184

¿En qué se diferencia CTE de una subconsulta?

183

¿Cómo dividir la consulta en etapas? ¿Qué hacemos para ello?

180

¿Qué tecnologías utilizaste para cargar los datos en Parquet, y qué mecanismos se usaron para obtener y cargar los datos?

178

¿Ha cargado datos desde Spark a S3 en formato Parquet, y luego desde Parquet a Greenplum? ¿Cómo es el proceso de carga?

175

¿Cómo escribiste el DAG de Airflow y las tareas: a mano o usando plantillas?

175

¿Cómo se cargaron los datos de la tabla externa en las tablas de destino?

175

¿Con streaming, Iceberg funcionaba, escuchaste? Es un almacenamiento de archivos basura.

173

¿Con dependencias entre trabajos, entre DAGs, utilizaste sensores para que varios trabajos se ejecutaran uno tras otro?

171

¿Cómo solías diseñar el esquema de la base de datos? ¿Lo hacías manualmente en la base, o almacenabas los scripts en algún lugar, o simplemente usabas Liquibase? ¿Cuál era el proceso?

171

¿Has trabajado con Git? ¿Qué almacenabas en Git?

170

Esto es en tiempo real, ¿cómo se puede implementar entre Kafka y ClickHouse Spark?

170

¿Tiene sentido usar CTE si se usa solo una vez en la consulta?

169

Vamos a analizar JSON — ¿quién analizará JSON? Hasta donde sé, en ClickHouse no hay funciones.

166

¿Has tenido que trabajar directamente con Spark? ¿Cuál es su desventaja?

163

Necesitamos un motor de pipeline: un mecanismo que permita crear flujos muy rápidamente mediante la entrada de contratos y parámetros. ¿Cómo lo implementarías a un nivel superior?

161

¿Qué tipo de lectura se utiliza en Greenplum: basada en filas o en columnas?

159
/3