Data Engineer
Il tracciamento mostra solo le richieste REST o qualcos'altro?
Cos'è la partizione dei dati e come aiuta a evitare una scansione completa della tabella?
Quali metodi (tipi) di archiviazione della cronologia dei dati conosci? Come si accumula la cronologia nelle tabelle?
Viene rispettato l'ACID in Greenplum?
Come funziona Merge Join (unione con ordinamento)?
Quali sono le tue aspettative salariali?
In cosa si differenzia HDFS dai normali sistemi di file distribuiti?
Cosa fa OPTIMIZE in ClickHouse e perché non bisogna avviarlo senza pensarci?
-- Tabella originale stretch -- È necessario riempire con il valore precedente (non NULL) in base all'id - eseguire il riempimento verso il basso id | ttime | val ---|-------|----- 1 | 07:30 | NULL 1 | 09:21 | 10 1 | 13:53 | NULL 1 | 16:12 | NULL 2 | 09:42 | 133 2 | 15:20 | NULL 2 | 21:33 | NULL 3 | 08:01 | NULL 3 | 11:41 | 8 3 | 14:23 | NULL 3 | 16:17 | NULL 3 | 19:54 | 2 4 | 13:10 | 312 4 | 14:42 | NULL 4 | 16:31 | 7 4 | 17:44 | NULL id | ttime | val ---|-------|----- 1 | 07:30 | NULL 1 | 09:21 | 10 1 | 13:53 | 10 1 | 16:12 | 10 2 | 09:42 | 133 2 | 15:20 | 133 2 | 21:33 | 133 3 | 08:01 | NULL 3 | 11:41 | 8 3 | 14:23 | 8 3 | 16:17 | 8 3 | 19:54 | 2 4 | 13:10 | 312 4 | 14:42 | 312 4 | 16:31 | 7 4 | 17:44 | 7 -- Query SQL per ottenere la tabella desiderata SELECT id, ttime, COALESCE(val, LAST_VALUE(val) OVER(PARTITION BY id ORDER BY ttime)) as val FROM stretch
Cos'è la statistica nel contesto dei sistemi di gestione dei database e dell'ottimizzazione delle query?
Qual è la complessità algoritmica per ottenere un elemento tramite chiave da un dizionario (dict) in Python?
Qual è la differenza tra ROWS BETWEEN e RANGE BETWEEN?
Come recuperare il lavoro da un branch remoto se ricevi un messaggio di errore che dice che il branch non è trovato quando provi a fare `git checkout hotfix/missing-footer`?
Cos'è GIL (Global Interpreter Lock)?
Nell'immagine mostrata ci sono due strutture dati; in quale di esse la ricerca del valore 2 sarà più veloce e perché?
Quali sono i vantaggi e gli svantaggi dell'ACID, oltre alla velocità di lettura?
Come evitare/rimuovere il bias dei dati in Spark?
Lo storage è stato costruito secondo lo schema Data Vault — anche tu lo hai sviluppato, mantenuto? Hai aggiunto manualmente hub, link?
Quali query SQL scrivi: controlli semplici o script complessi per i data warehouse?
Parla di Greenplum — formati di archiviazione dei dati, archiviazione in riga e colonna.