¿Qué es la máscara de relleno de clave frente a la máscara de atención en PyTorch?
Machine Learning / AI
¿Se realizó un dropout basado en la pérdida o en la eliminación aleatoria de pesos?
¿Cómo aumentar la cantidad de datos para el entrenamiento con un número reducido de objetos etiquetados?
¿Qué trucos prácticos aceleran la inferencia de transformadores (decodificación especulativa, medusa)?
¿Qué es la atención?
¿Cómo reconocer texto en imágenes usando NLP?
¿Cómo implementar un algoritmo para contar y desplazar ceros en una matriz en Python?
¿Cuál es la diferencia entre el aprendizaje de árboles nivel por nivel y hoja por hoja?
¿Es necesario poner shuffle en DataLoader?
¿Qué tipos de destilación de modelos existen?
¿Qué es una partición en ClickHouse?
¿En qué casos es necesario seleccionar backbones y cuándo se puede usar ResNet50?
¿Qué es la destilación?
¿En qué se diferencia sparse MoE de dense MoE?
¿Qué errores en el ciclo de entrenamiento pueden empeorar el aprendizaje y la calidad del modelo?
¿YOLOv8 es un detector de un solo paso o de dos pasos?