Sobes.tech

Data Analyst

Cos'è il valore p e come si utilizza per trarre conclusioni nell'analisi di un test A/B (rifiutare o non rifiutare l'ipotesi nulla)?

358

Spiega a parole l'algoritmo per calcolare il prodotto scalare di due vettori compressi (codificati in RLE) in un solo passaggio senza decomprimerli. Qual è la complessità asintotica in tempo?

318

È stato utilizzato ML per la selezione delle caratteristiche nel compito di classificazione delle auto?

298

Parlami dei tuoi progetti più interessanti e perché vuoi svilupparti nell'analisi.

267

D. Fuochi d'artificio cinesi Vladimir ha acquistato un set di 3 fuochi d'artificio cinesi. Sono esattamente uguali e sono mescolati in una scatola, ma secondo le istruzioni, hanno affidabilità diverse: 1. "Elite" — tasso di difetto del 10% (probabilità di successo 0.9). 2. "Standard" — tasso di difetto del 20% (probabilità di successo 0.8). 3. "Economy" — tasso di difetto del 40% (probabilità di successo 0.6). Vladimir prende casualmente il primo fuoco d'artificio, lo accende, e funziona con successo. Felice, Vladimir decide di lanciare gli altri due fuochi uno dopo l'altro. Qual è la probabilità che anche il secondo e il terzo fuoco funzionino con successo — senza difetti? Arrotonda la risposta a tre decimali.

152

La soluzione proposta funzionerebbe con SQLite?

150

Qual è la complessità asintotica della soluzione proposta in termini di tempo e memoria?

148

C'era una volta, uno stagista antifrode di Yandex Ads si unì al team. Mentre il gruppo di frodi operava, simulando traffico sui loro siti tramite visite di bot, e riceveva così denaro per impressioni pubblicitarie da parte di bot, il compito dello stagista era trovare tutti quei siti fraudolenti con traffico falso. Curiosamente, tutto il traffico su questi siti veniva generato con sostituzione di IP, facendo sembrare che un bot visitasse da città A, ma in realtà, il dispositivo si trovava in un luogo completamente diverso. Passato molto tempo, e lo stagista cercò di coprire tutto questo gruppo di frodi, riuscendo anche a catturare alcuni siti parzialmente. Ma l'intera rete non poté essere catturata. Dopo un po', notò una notizia: in città A, il 02.08.2025, non c'era affatto internet mobile. Tuttavia, internet cablato (domestico) continuava a funzionare. Dato ciò, come può lo stagista trovare tutti i siti falsi? Hai i log dei siti in formato tabella per il periodo dal 30.07.2025 al 10.08.2025: timestamp | site_id | city_id Ogni record corrisponde a una visita a un sito da parte di un dispositivo. Si sa che il traffico di bot cambia molto meno rispetto al traffico reale per giorno. Il tuo compito è trovare tutti i siti il cui traffico consisteva principalmente di bot che falsificavano la loro regione in città A. Nota La tabella contenente i dati si chiama logs. Esempio di record di tabella: timestamp | site_id | city_id [phone]:13:53 | 6e84d9b71ca44aea | A

148

Perché ha ancora senso standardizzare il formato di risposta nel benchmark, anche se limita il modello?

140

È possibile risolvere Product of Array Except Self in modo più semplice se si consente di utilizzare qualsiasi operazione?

138

Qual è la complessità in memoria della soluzione al problema Product of Array Except Self e quali variabili aggiuntive vengono utilizzate?

129

-- 1.2 Come cambierà la risposta se si cambia il tipo di JOIN in LEFT? -- 1.3 Indica l'ordine di esecuzione degli operatori in questa query. from join group by select order by limit -- 2. La tabella campaigns è stata corretta: sono stati rimossi i duplicati, è stata aggiunta la chiave (PK). -- Sono state condotte più campagne, a causa di bug alcuni utenti hanno iniziato a ricevere tentativi di consegna delle comunicazioni falliti, e alcuni non sono riusciti a mostrarle affatto. -- Sulle campagne promozionali inviate agli utenti: -- 2.1 Scrivi una query che mostra il numero di utenti che hanno ricevuto con successo la comunicazione per ogni campagna. -- 2.2 Modifica la query per mostrare: il numero di utenti che non hanno ricevuto nessuna comunicazione di successo, per ogni campagna.

128

Come confrontare la risposta del modello con il ground truth in un benchmark? Quale metrica usare?

127

A. Il Miglior Laboratorio Scientifico In una certa città, diversi laboratori scientifici si occupano di studiare colture batteriche. Esaminano una sequenza di campioni, dove ogni campione appartiene a un ceppo specifico (tipo di batteri). L'università principale di ricerca biologica ha annunciato un concorso: trovare il massimo numero di campioni consecutivi che possono essere analizzati considerando la restrizione. In particolare: in qualsiasi segmento continuo della sequenza, non devono esserci più di K ceppi diversi. Il nostro laboratorio aspira a diventare il migliore in città. Per vincere il concorso, dobbiamo trovare esattamente questa lunghezza massima di segmento che soddisfa la condizione rigorosa. Contiamo su di te, perché in caso di vittoria, il laboratorio riceverà un finanziamento che aprirà nuovi orizzonti per le nostre ricerche. Formato di input La prima riga contiene due numeri: N — la lunghezza della sequenza di campioni e K — il limite sul numero di ceppi diversi. La seconda riga contiene N numeri — gli elementi della sequenza. Formato di output Il programma deve stampare il numero della lunghezza massima di un segmento della sequenza di campioni. Esempio 1 Input [phone] Output 3

123

Per una lista di numeri interi, restituire una lista della stessa dimensione, dove alla posizione i-esima c'è il prodotto di tutti gli elementi della lista, tranne l'elemento alla posizione i della lista originale Esempi: [2, 3, 4] -> [3*4, 2*4, 2*3] -> [12, 8, 6] def product_except_self(nums: list[int]) -> list[int]: # il tuo codice qui

122

Scrivi una funzione completa sum_series in Python e verificane l'esempio del problema.

121

Puoi raccontare quale stack tecnologico e quali strumenti hai usato e imparato a padroneggiare?

120

Quanto sei interessato all'apprendimento automatico e vorresti applicarlo nel tuo lavoro come strumento?

120

Cosa cambia se sostituisci COUNT(*) con COUNT() senza argomento?

117

Come creeresti un benchmark sulla geometria? Descrivi la catena dall'idea al dataset finale.

117
/3