¿Cómo usas Python en tu trabajo y en qué te sientes más seguro: en Python o en SQL?
Data Engineer
Hay 101 objetos: 100 objetos de la clase 0 y 1 objeto de la clase 1. El primer modelo da la misma puntuación a todos los objetos. ¿Cuáles son su ROC AUC y la forma de la curva ROC?
¿Cómo probar si una serie temporal es estacionaria?
Dado una consulta SQL escrita por un analista. Identifica ineficiencias en la consulta y sugiere cómo evitarlas. La consulta une dos tablas: - tabla de hechos 'events' con clave 'event_id' - tabla de referencia de fuente de tráfico con clave 'referer_str' Ambas tablas contienen miles de millones de registros. select * from (select distinct e.event_id, e.user_id, e.category_id, e.location_id, s.source_name, s.medium_name, s.campaign_name, row_number() over(partition by e.event_id, e.user_id, e.category_id, e.location_id, s.source_name, s.medium_name, s.campaign_name) as rnk from events e left join traffic_source s on e.referer_str = s.referer_str where e.event_date = current_date() - 1 group by 1,2,3,4,5,6,7) t where rnk = 1
Hay un objetivo continuo no negativo y cuatro algoritmos: regresión lineal, árbol de decisión, bosque aleatorio y boosting en árboles. ¿Cuáles de ellos pueden producir pronósticos negativos?
Se han cargado datos en una tabla ReplacingMergeTree; ¿qué ocurrirá durante la lectura si la fusión aún no ha ocurrido, y cómo obtener la versión más reciente de los registros?
¿Qué es la desnormalización?
¿Es posible combinar deduplicación y posterior volcado de datos sin usar tablas separadas; y si es así, ¿cómo?
¿Qué es la prueba de hipótesis? ¿Qué son los errores de Tipo I y Tipo II y el valor p?
¿Qué estructuras de índices existen y cómo funcionan?
¿Qué formas conoces para acelerar la ejecución de tareas en PostgreSQL?
¿Qué es una serie temporal estacionaria y por qué la estacionaridad es importante para los modelos clásicos?
¿Qué es bagging y boosting, y en qué se diferencian?
¿Cuáles son las características del uso de JOIN al construir vitrinas en PostgreSQL/Greenplum en comparación con ClickHouse?
¿Estás familiarizado con el modelado uplift? ¿Qué sabes sobre ello?
¿Cómo prevenir el crecimiento de la tabla si el almacenamiento de datos está limitado en tiempo, por ejemplo, dos años?
¿Qué es ROC AUC?
Hay que verificar si en la tabla hay clientes con varios correos electrónicos. Si los hay, eliminarlos (solo dejar la última entrada por create_date).
¿Qué es un watermark en Spark Structured Streaming?
¿Qué es la normalización y cuándo se aplica?