Data Engineer
O que é uma partição no ClickHouse e com base em que princípio ela é escolhida?
O que é a idempotência em DAG/tarefa no Airflow?
Por que escolheram especificamente o DBT? Quais são as vantagens e desvantagens deste framework?
Dadas duas tabelas t1 e t2. A tarefa é listar todos os tipos de joins que conhece e o resultado da consulta select * from t1 <join> t2 on t1.t = t2.t para cada um deles. |t1.t| ------ 1 2 4 null ------ |t2.t| ------ 1 3 null null cross 1 1 - null null - INNER JOIN [phone] LEFT JOIN 1 - 1 2 - NULL 4 - NULL NULL - NULL RIGHT JOIN [phone] NULL - 3 NULL - NULL NULL - NULL FULL JOIN [phone] - NULL 4 - NULL NULL - 3 null - NULL null - NULL null - NULL
Tem experiência a trabalhar com a biblioteca Langchain? Que tarefas resolveu com a sua ajuda?
Como funciona o particionamento no Hive e como é representado fisicamente no sistema de ficheiros?
O que é o YARN e para que serve?
Que problemas a rastreabilidade pode identificar?
Como pode ocorrer uma injeção SQL através do campo de entrada de data?
Quão bem conhece Python?
O que é uma injeção SQL?
Quais são as limitações no uso de tabelas hash?
Isto é em tempo real, como implementar entre Kafka e ClickHouse Spark?
Quais os tipos de junções físicas de tabelas existem (Hash Join, Merge Join, Nested Loop)?
Que tipos de ligações físicas (métodos de junção) existem?
Como recuperar o trabalho de uma branch remota se ao tentar fazer `git checkout hotfix/missing-footer` receber uma mensagem de erro dizendo que a branch não foi encontrada?
De que forma é possível transferir os dados do Greenplum e Trino para o ClickHouse?
Dada uma string de zeros e uns. É necessário escrever uma função func() que retorne o maior número de uns consecutivos. Por exemplo: func("010111011") -> 3
Iceberg é um motor que permite transformar o S3 numa base de dados, ele até segue os princípios ACID. Qual é a sua desvantagem?
Quais métodos existem para remover dados no ClickHouse?