Sobes.tech

Machine Learning / AI

Come progettare un agente che risponde agli utenti in base ai dati di un database transazionale: quale stack e architettura sono necessari, e conviene applicare la multiagente?

Senior
192

Quali ottimizzazioni dell'inferenza di un LLM standard si possono proporre se GPT aziendale funziona lentamente?

Senior
179

Cos'è la decodifica speculativa e come accelera la generazione?

Senior
174

Cos'è MoE (Mix di Esperti) e perché questa architettura può essere vantaggiosa per l'inferenza?

Senior
164

Analizza separatamente prefill e decode: Q/K/V, forme di matrici e differenze di fase.

Senior
160

Perché non usare RAG vettoriale come meccanismo principale per risposte in database SQL transazionali?

Senior
158

Sequenza di parentesi corretta Consideriamo una sequenza composta da parentesi tonde, quadre e graffe '{', '}', '[', ']'. Il programma deve determinare se questa sequenza di parentesi è corretta. - Una sequenza vuota è corretta. - Se A è una sequenza corretta, allora (A), [A], {A} sono corretti. - Se A e B sono sequenze corrette, allora AB è corretta. Formato di input: In una sola riga si inserisce la sequenza di parentesi, contenente non più di 100000 parentesi. Formato di output: Se la sequenza è corretta, il programma deve mostrare 'yes', altrimenti 'no'.

Senior
158

Dopo l'ID del token e gli embedding, cosa entra esattamente nel decoder: qual è la forma delle rappresentazioni, come viene aggiunta l'informazione posizionale e cosa succede dopo?

Senior
156

Qual è la dimensione di uscita dello strato MLP?

Senior
156

Cosa succede dopo nel blocco Transformer una volta che l'attenzione ha prodotto il vettore di output?

Senior
155

Cosa è stato fatto con la conformità nel sistema RAG?

Senior
152

Cosa si fa con i logit prima del campionamento e quali parametri di campionamento conosci?

Senior
143

Come si svolge generalmente il percorso di un'app ML/LLM dal Dockerfile e dal codice sorgente al servizio distribuito e al traffico utente in Kubernetes?

Senior
142

Con cosa viene moltiplicato il vettore Q durante la decodifica e cosa si ottiene?

Senior
142

Quali argomenti importanti su di te o sul tuo stile di lavoro vorresti evidenziare ulteriormente al dirigente?

Senior
137

Perché una LLM quantizzata può funzionare più velocemente e perché a volte la quantizzazione, al contrario, rallenta l'inferenza?

Senior
135

import unittest class Solution: def isvalid(self, s:str) -> bool: matching_brackets = { ")": "(", "]": "[", "}": "{", } stack: list[str] = [] for bracket in s: if bracket in "([{": stack.append(bracket) continue if bracket not in matching_brackets: return False if not stack or stack[-1] != matching_brackets[bracket]: return False stack.pop() return not stack class SolutionTest: def __init__(self): self.Solution = Solution() def run(self): test_cases = [ ("", True), ("()", True), ("(){}[]", True), ("(({}))", True), ("(", False), (")", False), ("(((", False), ("{[]}", False), ] for brackets, expected in test_cases: actual = self.Solution.isvalid(brackets) assert actual == expected, ( f"Errore per {brackets!r}" f"Volevamo ottenere {expected}, ma abbiamo ottenuto {actual}" ) print(f"Tutti i test sono passati: {len(test_cases)}") if __name__ == "__main__": SolutionTest().run()

Senior
135

Quali sono i tipi di attenzione che permettono di evitare la complessità quadratica dell'auto-attention completa in contesti lunghi?

Senior
133

Cosa è stato usato per pulire e normalizzare i documenti: Redis o regex?

Senior
132

Quale IDE o ambiente utilizzi per lavorare con strumenti di IA?

Senior
131
/2