Data Engineer
Quali sono i limiti nell'uso delle tabelle hash?
Dati due tabelle t1 e t2. Il compito è elencare tutti i tipi di join che conosci e il risultato della query select * from t1 <join> t2 on t1.t = t2.t per ciascuno di essi. |t1.t| ------ 1 2 4 null ------ |t2.t| ------ 1 3 null null cross 1 1 - null null - INNER JOIN [phone] LEFT JOIN 1 - 1 2 - NULL 4 - NULL NULL - NULL RIGHT JOIN [phone] NULL - 3 NULL - NULL NULL - NULL FULL JOIN [phone] - NULL 4 - NULL NULL - 3 null - NULL null - NULL null - NULL
Quali sono gli svantaggi dell'architettura MPP in Greenplum?
Quali sono le tue aspettative salariali?
Come può verificarsi un'iniezione SQL attraverso il campo di input della data?
Il tracciamento mostra solo le richieste REST o qualcos'altro?
Cosa fai quando incontri un problema nella pipeline di produzione?
Come recuperare il lavoro da un branch remoto se ricevi un messaggio di errore che dice che il branch non è trovato quando provi a fare `git checkout hotfix/missing-footer`?
Come funzionavano le funzioni analitiche (funzioni finestra)?
Quali tipi di tabelle hai usato in Greenplum? In quali casi si usava heap e in quali Append-Optimized?
In cosa si differenzia HDFS dai normali sistemi di file distribuiti?
È in tempo reale, come implementarlo tra Kafka e ClickHouse Spark?
Ci sono stati problemi con OpenAPI durante il passaggio da Spring Boot 2 a 3?
Come funziona MapReduce, in particolare la fase Reduce?
Cosa succede quando si parallelizzano le query in un singolo nodo di Postgres?
Come si possono trasferire i dati da Greenplum e Trino a ClickHouse?
Quali sono i vantaggi e gli svantaggi dell'ACID, oltre alla velocità di lettura?
A cosa servono gli indici, quali sono i vantaggi e gli svantaggi?
Come funziona la partizione in Hive e come viene rappresentata fisicamente nel file system?
Parlami di te — esperienza lavorativa, stack tecnologico