Data Engineer
Hoe ging je gewoonlijk om met fouten en waarschuwingen in pipelines?
# wat wordt weergegeven s = 'abracadabra' print(s[5][0][0][0]) print(s[::-2]) s = [1, 2, 3] print(s * 2)
Wat gebeurt er in PostgreSQL na het uitvoeren van een SELECT * FROM [tabel]?
# wat wordt weergegeven s = 'Abracadabra' print(s[5][0]) b = 'a' b[0] print(s[::2]) s = [1, 2, 3] print(s * 2)
Met welke parameters van de Distributed-motor in ClickHouse bent u vertrouwd?
Hoe zou je in code controleren dat een waarde significant afwijkt van een normale (verwachte) verdeling?
Hoe voorkom je dat onjuiste gegevens die in de vitrine of tussenliggende tabel zijn geladen, in de hogere pipelines terechtkomen?
Heb je statistische controles gedaan?
Met welke problemen bent u geconfronteerd bij het werken met Greenplum?
Wat gebeurt er fysiek tijdens een INSERT, UPDATE en DELETE in Greenplum; waarom wordt de ruimte op de schijf niet vrijgegeven na een DELETE en waarin verschilt DELETE van TRUNCATE?
Hoe verschillen de vereisten voor rekenkracht van opslag bij ETL en ELT?
Toon het aantal bestellingen en "producten van de benodigde categorie in de bestelling" voor 2021 in de categorieën "Kleding" en voor 2022 in de categorie "Schoenen" (eindweergave: 2 regels. Velden: jaar, aantal producten, aantal bestellingen) with cte as( select year(o.order_date) as year_orders, g.cat_1, count(distinct o.order_id) as count_orders, sum(g.quantity) as count_quan from Orders o join Goods g on o.order_id = g.order_id where (g.cat_1 = 'Kleding' and Year(o.order_date) = 2021) or (g.cat_1 = 'Schoenen' and Year(o.order_date) = 2022) group by year_orders, g.cat_1 ) select year_orders, count_quan, count_orders from cte voor 2025, top 3 in elke categorie op basis van verkoophoeveelheid model with cte as( select cat_1, price, quantity, model, rank() over(partition by cat_1) as rk from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 ) voor 2025, top 3 in elke categorie op basis van verkoopbedrag model with cte as( select g.cat_1, g.model, (price * quantity), rank() over(partition by g.cat_1) as rk from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 ) with cte as( select g.cat_1, g.model, sum(price * quantity) as sum_, rank() over(partition by g.cat_1 order by sum() desc) as rk from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 ) with cte1 as( select g.cat_1, g.model, sum(price * quantity) as sum_total, from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 ), cte2 as(select g.cat_1, g.model, sum_total, rank() over(partition by g.cat_1 order sum_total desc) as rk from cte1 ) select g.cat_1, g.model, sum_total from cte2 where rk <=3 ken de naam van de categorie, model en de totale verkoop with cte1 as( select g.cat_1 as cat_name, g.model as model, sum(price * quantity) as sum_total, from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 group by Year(o.order_date), g.model ), cte2 as(select cat_name, model, sum_total, rank() over(partition by cat_name order sum_total desc) as rk from cte1 ) select cat_name, model, sum_total from cte2 where rk <=3
Wat is RDD in Apache Spark en hoe verschilt het van andere abstracties van Spark?
Waarom heeft u besloten de ranking in een aparte CTE te plaatsen? Waarom kon het niet direct in de eerste CTE worden gebruikt?
Wat zijn decorators in Python?