Já trabalhou com o otimizador AQE (Execução de Consulta Adaptativa) no Spark? Você sabe como ele funciona?
Data Engineer
Qual formato de trabalho é mais conveniente para si — escritório, híbrido ou remoto? Temos dois escritórios, na Kutuzovsky e na Tula.
Como ocorre fisicamente o mecanismo de broadcast — como as partições de uma tabela pequena chegam aos executores com uma tabela grande?
Como é que o Spark determina que uma tabela é suficientemente 'pequena' para um broadcast join (limite superior)?
Como são orquestrados os lançamentos no DBT? Usa Airflow?
Por favor, conte-me sobre a sua experiência no último ano: que equipa, que tarefas, qual foi o papel, e qual foi a tarefa mais interessante.
Com as suas próprias palavras, o que é um FULL JOIN?
E se precisarmos de todos os clientes, mesmo que não tenham tido transações nessa data, como podemos exibi-los?
Que tipos de JOIN existem em SQL (lógicos) e em que se diferenciam?