Hoe ontwerp je een agent die reageert op gebruikers op basis van gegevens uit een transactionele database: welke stack en architectuur zijn nodig, en is het zinvol om multi-agentiteit toe te passen?
Machine Learning / AI
Welke optimalisaties voor inferentie van standaard LLM kunnen worden voorgesteld als de bedrijfs-GPT traag werkt?
Wat is speculatieve decoding en hoe versnelt het de generatie?
Wat is MoE (Mixture of Experts) en waarom kan deze architectuur voordelig zijn voor inferentie?
Wat gebeurt er daarna in de Transformer-blok nadat de aandacht de uitgangsvector heeft gegeven?
Waarom moet vector RAG niet worden gebruikt als het belangrijkste mechanisme voor antwoorden in transactionele SQL-databases?
Wat is de uitgangsdimensie van de MLP-laag?
Correcte haakjesreeks Laten we een reeks beschouwen die bestaat uit ronde, vierkante en accolades '{', '}', '[', ']'. Het programma moet bepalen of deze haakjesreeks correct is. - Een lege reeks is correct. - Als A een correcte reeks is, dan zijn (A), [A], {A} correct. - Als A en B correcte reeksen zijn, dan is AB correct. Invoerschema: In één regel wordt de haakjesreeks ingevoerd, met niet meer dan 100000 haakjes. Uitvoerschema: Als de reeks correct is, moet het programma 'yes' afdrukken, anders 'no'.
Analyseer prefill en decode afzonderlijk: Q/K/V, matrixvormen en faseverschillen.
Na token-ID en embeddings, wat komt er precies in de decoder: wat is de vorm van de representaties, hoe wordt de positionele informatie toegevoegd en wat gebeurt er daarna?
Hoe verloopt over het algemeen de weg van een ML/LLM-toepassing vanaf Dockerfile en broncode tot een uitgeruste service en gebruikersverkeer in Kubernetes?
Wat werd er gedaan met compliance in het RAG-systeem?
Wat wordt er gedaan met de logits vóór het sampling en welke samplingparameters ken je?
Waarmee wordt de Q-vector vermenigvuldigd tijdens decoding en wat wordt er verkregen?
Welke belangrijke onderwerpen over jezelf of je werkstijl wil je extra benadrukken aan de leidinggevende?
Welke IDE of omgeving gebruik je voor het werken met AI-tools?
Waarom kan een gekwantiseerde LLM sneller werken en waarom vertraagt kwantisatie soms juist de inferentie?
Wat werd gebruikt om documenten te reinigen en te normaliseren: Redis of regex?
Welke soorten aandacht bestaan er die de kwadratische complexiteit van volledige zelfaandacht bij lange contexten kunnen voorkomen?
Beschrijf stap voor stap het pad van het gebruikersbericht door LLM tijdens inferentie — van chat tot antwoord, inclusief architectonische details van de Transformer.