Como projetaria uma carga de dados escalável de múltiplas APIs REST: desde a aquisição de dados até S3, com uma interface para um analista?
Data Engineer
O que é SQL procedural?
Fale-nos sobre você e sua experiência em engenharia de dados.
Existem 101 objetos: 100 zeros e 1 um. Após ordenar por pontuação, vêm primeiro 50 zeros, depois um, e depois outros 50 zeros. Quais são o ROC AUC e a forma da curva ROC?
Quais são os pontos negativos dos índices além do espaço que ocupam?
No boosting de gradiente, já foi construída uma composição de N algoritmos base. Qual será o objetivo para o novo, N+1-ésimo algoritmo?
Por que as avaliações preguiçosas são úteis?
O que é o spill de dados no Spark e como evitá-lo se não for possível simplesmente adicionar recursos?
Como lidaria com transformações de dados de alta carga?
Como diferem os modos de lançamento do Spark: cluster, client e local?
Quais são as vantagens e desvantagens de implementar um carregador de API como um operador/hook personalizado do Airflow em comparação com uma biblioteca ou serviço de contêiner separado?
2. Existe uma tabela t, que lista a soma das transações dos clientes por dia: - Escreva uma consulta que, para cada linha, mostre as transações do cliente para o dia atual e o dia anterior A tabela final está abaixo:
O que são avaliações preguiçosas e como entendê-las?
Que tarefas típicas resolveu no Airflow?
data, número de pedido, valor select date, sum(amount) as sum_amount from t group by date having sum(amount) > 1000000 order by sum_amount desc limit 3
O que são modelos em estrela e Data Vault?
Fale-nos sobre si: onde trabalhou recentemente, o que fazia, o que procura e por quê?
Onde estão localizados o Driver e os Executors no modo cluster e por que é usado em produção?
Onde exatamente ocorre o gradiente no algoritmo de boosting por gradiente se o algoritmo base for uma árvore de decisão simples?
De que componentes são compostos o Greenplum e o Hadoop HDFS?