Come progettare un agente che risponde agli utenti in base ai dati di un database transazionale: quale stack e architettura sono necessari, e conviene applicare la multiagente?
Machine Learning / AI
Quali ottimizzazioni dell'inferenza di un LLM standard si possono proporre se GPT aziendale funziona lentamente?
Cos'è la decodifica speculativa e come accelera la generazione?
Cos'è MoE (Mix di Esperti) e perché questa architettura può essere vantaggiosa per l'inferenza?
Analizza separatamente prefill e decode: Q/K/V, forme di matrici e differenze di fase.
Perché non usare RAG vettoriale come meccanismo principale per risposte in database SQL transazionali?
Sequenza di parentesi corretta Consideriamo una sequenza composta da parentesi tonde, quadre e graffe '{', '}', '[', ']'. Il programma deve determinare se questa sequenza di parentesi è corretta. - Una sequenza vuota è corretta. - Se A è una sequenza corretta, allora (A), [A], {A} sono corretti. - Se A e B sono sequenze corrette, allora AB è corretta. Formato di input: In una sola riga si inserisce la sequenza di parentesi, contenente non più di 100000 parentesi. Formato di output: Se la sequenza è corretta, il programma deve mostrare 'yes', altrimenti 'no'.
Dopo l'ID del token e gli embedding, cosa entra esattamente nel decoder: qual è la forma delle rappresentazioni, come viene aggiunta l'informazione posizionale e cosa succede dopo?
Qual è la dimensione di uscita dello strato MLP?
Cosa succede dopo nel blocco Transformer una volta che l'attenzione ha prodotto il vettore di output?
Cosa è stato fatto con la conformità nel sistema RAG?
Cosa si fa con i logit prima del campionamento e quali parametri di campionamento conosci?
Come si svolge generalmente il percorso di un'app ML/LLM dal Dockerfile e dal codice sorgente al servizio distribuito e al traffico utente in Kubernetes?
Con cosa viene moltiplicato il vettore Q durante la decodifica e cosa si ottiene?
Quali argomenti importanti su di te o sul tuo stile di lavoro vorresti evidenziare ulteriormente al dirigente?
Perché una LLM quantizzata può funzionare più velocemente e perché a volte la quantizzazione, al contrario, rallenta l'inferenza?
import unittest class Solution: def isvalid(self, s:str) -> bool: matching_brackets = { ")": "(", "]": "[", "}": "{", } stack: list[str] = [] for bracket in s: if bracket in "([{": stack.append(bracket) continue if bracket not in matching_brackets: return False if not stack or stack[-1] != matching_brackets[bracket]: return False stack.pop() return not stack class SolutionTest: def __init__(self): self.Solution = Solution() def run(self): test_cases = [ ("", True), ("()", True), ("(){}[]", True), ("(({}))", True), ("(", False), (")", False), ("(((", False), ("{[]}", False), ] for brackets, expected in test_cases: actual = self.Solution.isvalid(brackets) assert actual == expected, ( f"Errore per {brackets!r}" f"Volevamo ottenere {expected}, ma abbiamo ottenuto {actual}" ) print(f"Tutti i test sono passati: {len(test_cases)}") if __name__ == "__main__": SolutionTest().run()
Quali sono i tipi di attenzione che permettono di evitare la complessità quadratica dell'auto-attention completa in contesti lunghi?
Cosa è stato usato per pulire e normalizzare i documenti: Redis o regex?
Quale IDE o ambiente utilizzi per lavorare con strumenti di IA?