Come usi Python nel tuo lavoro e dove ti senti più sicuro: in Python o in SQL?
Data Engineer
Ci sono 101 oggetti: 100 oggetti di classe 0 e 1 oggetto di classe 1. Il primo modello assegna lo stesso punteggio a tutti gli oggetti. Qual è il suo ROC AUC e la forma della curva ROC?
Come si testa una serie temporale per la stazionarietà?
Dato un'interrogazione SQL scritta da un analista. Identifica le inefficienze nell'interrogazione e suggerisci come evitarle. L'interrogazione unisce due tabelle: - tabella dei fatti 'events' con chiave 'event_id' - tabella di riferimento della fonte di traffico con chiave 'referer_str' Entrambe le tabelle contengono miliardi di record. select * from (select distinct e.event_id, e.user_id, e.category_id, e.location_id, s.source_name, s.medium_name, s.campaign_name, row_number() over(partition by e.event_id, e.user_id, e.category_id, e.location_id, s.source_name, s.medium_name, s.campaign_name) as rnk from events e left join traffic_source s on e.referer_str = s.referer_str where e.event_date = current_date() - 1 group by 1,2,3,4,5,6,7) t where rnk = 1
C'è un obiettivo continuo non negativo e quattro algoritmi: regressione lineare, albero decisionale, foresta casuale e boosting sui alberi. Quali di essi possono produrre previsioni negative?
I dati sono stati caricati in una tabella ReplacingMergeTree; cosa succede durante la lettura se la merge non è ancora avvenuta, e come ottenere l'ultima versione dei record?
Cos'è la denormalizzazione?
È possibile combinare deduplicazione e successivo spill dei dati senza usare tabelle separate; e se sì, come?
Cos'è il test di ipotesi? Quali sono gli errori di Tipo I e Tipo II e il p-valore?
Quali sono le strutture degli indici e come funzionano?
Quali metodi conosci per accelerare l'esecuzione dei task in PostgreSQL?
Cos'è una serie temporale stazionaria e perché la stazionarietà è importante per i modelli classici?
Cos'è il bagging e il boosting, e come si differenziano?
Quali sono le caratteristiche dell'uso di JOIN nella costruzione di data mart in PostgreSQL/Greenplum rispetto a ClickHouse?
Conosci la modellazione uplift? Cosa ne sai?
Come prevenire la crescita della tabella se lo spazio di archiviazione dei dati è limitato nel tempo, ad esempio due anni?
Cos'è ROC AUC?
È necessario verificare se nella tabella ci sono clienti con più email. Se ci sono, eliminarli (lasciare solo l'ultimo record per create_date).
Cos'è una watermark in Spark Structured Streaming?
Cos'è la normalizzazione e quando viene applicata?