Machine Learning / AI
¿Cómo diseñar un sistema de almacenamiento y búsqueda para 10,000 canales de Telegram con 300,000 publicaciones al día y una latencia inferior a 2 segundos?
Cuéntame en dos palabras sobre el equipo en el que trabajaste en [empresa].
¿Por qué eligieron la búsqueda híbrida BM25 + embeddings en lugar de solo la distancia coseno?
¿Por qué se utiliza Layer Norm en el transformador en lugar de Batch Norm?
En la tabla de diálogos hay 80 millones de mensajes, y la consulta analítica para el conjunto de evaluación tarda 25 minutos y a veces devuelve pares de preguntas-respuestas duplicados. ¿Qué corregirías primero y por qué?
¿Cuál es la varianza de la constante?
¿Qué es el término 'PropNail/TopNail Optimization' que has utilizado?
¿Cómo evaluar la calidad de la búsqueda en una base de datos vectorial sin etiquetado?
¿Cómo evalúa su nivel de dominio de Python y SQL?
Cuéntenos sobre su experiencia gestionando simultáneamente proyectos en dos empresas: ¿cuáles fueron esos proyectos y qué tan cómodo fue el proceso?
¿Qué métricas existen en PLN?
¿Cómo reduces las alucinaciones en la canalización de extracción de información?
¿Seleccionan un subconjunto de características en los nodos individuales del árbol o para todo el árbol en su conjunto?
Cuéntenos sobre el proyecto de agrupación de solicitudes con clasificación por importancia comercial.
¿Por qué el proyecto se desarrolló durante dos años, si dices que lo principal se hizo hace otros dos años? ¿El proyecto está en mantenimiento ahora o se ha desarrollado más?
¿Qué es DSSM, sabes?
¿Cómo abordarías la tarea de resumir un diálogo de varias personas en una conferencia (por ejemplo, 10 desarrolladores en Slack)?
¿Qué es el suavizado de etiquetas en la clasificación de imágenes?
¿Qué otros boosting has probado además de CatBoost?
¿Cómo implementó y desplegó el servicio para procesar pull requests?