Wat is de trigger voor het maken van een nieuwe Job in Spark, en hoe wordt een Job verdeeld in Stages en Tasks?
Data Engineer
Vertel op hoofdlijnen hoe de architectuur van Spark is opgebouwd: welke componenten zijn er en hoe werken ze samen bij het uitvoeren van een SQL-query.
Wat is partitionering? Wat is sharding? Wat is replicatie?
Waarvoor is de Rijgroep verantwoordelijk in de structuur van een Parquet-bestand?
Als we een filtervoorwaarde op de transatiedatum in WHERE (na LEFT JOIN) plaatsen, beperkt dit dan het resultaat van de eerste tabel (klanten)?
## vraag over modus # Er is een lijst met getallen. Schrijf een functie die de modus van deze lijst vindt. # find_mode([1, 2, 3, 3, 4, 5]) #> 3
-- t1 -- num --------- -- 1 -- 2 2 null null 4 -- t2 -- num --------- -- [telefoon] null null 5 SELECT a.num ALS a_num, b.num ALS b_num VAN t1 a LINKS JOIN t2 b OP a.num = b.num;
Wat geeft de functie find_mode terug voor de lijst [1, 2, 3, 3, 4, 5]? Leg het stap voor stap uit.
SELECT client_id, ФИО, SUM(suma) AS total_amount FROM clients JOIN transactions ON clients.client_id = transactions.client_id WHERE дата = '2025-05-01' GROUP BY client_id, ФИО;
Vertel me waar je hebt gewerkt als systeemanalist en welke taken je hebt uitgevoerd?
Wat is het verschil tussen het opslagformaat Parquet en CSV?
Wat is het verschil tussen partitionering en sharding?
Welke methoden (typen) voor het opslaan van gegevensgeschiedenis ken je? Hoe wordt de geschiedenis in tabellen opgebouwd?
De kwaliteitscontroles van gegevens deed je zelf, of kwamen de eisen van het bedrijf/de klanten?
Wat voor werkformaat is het handigst voor jou — kantoor, hybride of remote? We hebben twee kantoren, aan de Kutuzovsky en Tula.
Heb je ooit met de AQE (Adaptive Query Execution) optimizer in Spark gewerkt? Weet je hoe het werkt?
Hoe krijg je de laatste volledige naam voor elke klant, als alleen de startdatum bekend is (einddatum is onbekend)?
Welke soorten fysieke JOINs bestaan er in Spark?
Wat betekent UNBOUNDED PRECEDING in de grenzen van een vensterfunctie?
Welke fysieke JOIN-mechanisme wordt gebruikt bij het samenvoegen van de transactietabel met de kalender tabel op basis van de ongelijkheid (datum <= datum)?