Data Engineer
Come organizzi i tuoi progetti? Scrivi un README o qualcos'altro?
Hai lavorato con incidenti di qualità dei dati?
Perché non è consigliabile fare molte piccole inserzioni in ClickHouse?
Hai ricevuto un compito con il numero ABC. Qual è il tuo ordine di azioni in Git all'inizio del lavoro?
Come ti sei connesso a OpenMetadata e cosa hai fatto con essa?
Hai mai dovuto interagire direttamente con i Data Scientist, raccogliendo le loro specifiche?
Perché hai deciso di mettere il ranking in una CTE separata? Perché non poteva essere usato direttamente nella prima CTE?
Hai lavorato con le vetrine dei dati (strato DWH)?
Quale operazione ha eseguito il comando? - Ha eseguito git revert sul commit con config.yaml - Ha eseguito git filter-branch --index-filter "git rm --cached config.yaml" -- --all - Ha eseguito git rebase -i eliminando i commit che contenevano modifiche al file - Ha eseguito git commit --amend e git push --force - Ha usato git cherry-pick per creare un nuovo branch senza config.yaml
Forse hai esperienza nel campo della Data Science — lavoro con modelli, statistica?
[nome] ha chiesto: Cosa bisogna aggiungere al motore delle tabelle affinché i dati siano aggiornati su tutti i nodi del cluster?
Chi erano i consumatori di dati e come venivano costruite le vetrine?
Cosa hai scritto in Python oltre all'Airflow DAG?
Mostrare il numero di ordini e "prodotti della categoria necessaria nell'ordine" per il 2021 nelle categorie "Abbigliamento" e per il 2022 nella categoria "Calzature" (vista finale: 2 righe. Campi: anno, numero di prodotti, numero di ordini) with cte as( select year(o.order_date) as year_orders, g.cat_1, count(distinct o.order_id) as count_orders, sum(g.quantity) as count_quan from Orders o join Goods g on o.order_id = g.order_id where (g.cat_1 = 'Abbigliamento' and Year(o.order_date) = 2021) or (g.cat_1 = 'Calzature' and Year(o.order_date) = 2022) group by year_orders, g.cat_1 ) select year_orders, count_quan, count_orders from cte per il 2025, i primi 3 in ogni categoria per quantità di vendita modello with cte as( select cat_1, price, quantity, model, rank() over(partition by cat_1) as rk from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 ) per il 2025, i primi 3 in ogni categoria per somma di vendite modello with cte as( select g.cat_1, g.model, (price * quantity), rank() over(partition by g.cat_1) as rk from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 ) with cte as( select g.cat_1, g.model, sum(price * quantity) as sum_, rank() over(partition by g.cat_1 order by sum() desc) as rk from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 ) with cte1 as( select g.cat_1, g.model, sum(price * quantity) as sum_total, from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 ), cte2 as(select g.cat_1, g.model, sum_total, rank() over(partition by g.cat_1 order sum_total desc) as rk from cte1 ) select g.cat_1, g.model, sum_total from cte2 where rk <=3 conoscere il nome della categoria, il modello e il totale delle vendite (top 3) with cte1 as( select g.cat_1 as cat_name, g.model as model, sum(price * quantity) as sum_total, from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 group by Year(o.order_date), g.model ), cte2 as(select cat_name, model, sum_total, rank() over(partition by cat_name order sum_total desc) as rk from cte1 ) select cat_name, model, sum_total from cte2 where rk <=3
Cos'è CDC e hai esperienza con esso?
[nome] ha chiesto: Il campo 'hanno trovato voli' ha solo due valori (sì/no). Come è meglio rappresentarlo in ClickHouse? Quale tipo di dato viene usato internamente per Bool?
A cosa servono le "cartelle"/prefissi in S3 oltre alla comodità?
Quando puoi dare feedback e hai offerte in mano?
Cosa ti motiva nel lavoro? Elenca i tuoi punti di forza in termini di hard skills.
Hai costruito dashboard e lavorato con strumenti di visualizzazione dei dati (strumenti BI)?