Sobes.tech

Machine Learning / AI

Hoe evalueer je de kwaliteit van de retriever? Waar haal je een collectie documenten vandaan om de metrics te beoordelen?

370

Je hebt een kleine dataset met filmrecensies in het Russisch en hun binaire sentimentlabel (labels: 0 — negatief, 1 — positief). Jouw taak is om binnen 15 minuten een volledige pipeline te implementeren voor het trainen van een eenvoudig tekstclassificatiemodel zonder gebruik te maken van vooraf getrainde encoders zoals BERT, en de nauwkeurigheid (accuracy) op deze gegevens te tonen. reviews = [ "Deze film is gewoon geweldig!", "Verschrikkelijk acteerwerk en saai verhaal.", "Ik heb van elk moment genoten!", "De slechtste film die ik heb gezien.", "Uitstekend camerawerk en geweldig verhaal.", "Onverdraaglijk saai en voorspelbaar." ] labels = [1, 0, 1, 0, 1, 0]

183

Welke parameter in het embedding-model bepaalt het maximale aantal tokens op de invoer? Wat gebeurt er als je meer tokens dan de limiet invoert?

168

Hoe beïnvloedt een vier keer grotere batchgrootte de leersnelheid en waarom? Hoe werkt backpropagation?

163

Hoe worden gegevens uit de vector database gehaald op basis van een gebruikersvraag?

153

Wat is modelquantisatie en wat gebeurt er met de gewichten bij toepassing in vLLM?

153

Wat gebeurt er als je een context van 120.000 tokens geeft in een LLM met een limiet van 60.000?

151

Hoe was de zoekactie in de vector database georganiseerd? Waarom werd Qdrant gebruikt?

141

Wat is LangGraph, waar wordt het voor gebruikt, hoe worden vertakkingen en voorwaardelijke overgangen geïmplementeerd? Hoe verschillen tools van knooppunten?

140