We hebben een tabel met klanten (id, naam, adres, enz.), producten (id, naam, enz.), productbeweging (hier hebben we klant-id, product, datum, hoeveelheid, som), we moeten vinden welke producten op 1 januari zijn verkocht, alleen de unieke, en ook de naam van de koper en... tonen
Data Engineer
Heeft u gewerkt met datavitrines (DWH-laag)?
Als je transacties samenvoegt met klanten op basis van client_id en date_start (zonder BETWEEN), wat wordt er dan vastgelegd in het resultaat?
Vertel over een paar van je belangrijkste taken met betrekking tot de datakwaliteit.
Wat is het salaris dat je verwacht?
Wat is een CROSS JOIN? Heb je hiermee gewerkt?
Waarom ben je nu op zoek naar een nieuwe baan, wil je van baan veranderen?
Welke soorten JOIN ken je? (logisch)
Kan je in Spark parallel gegevens lezen uit één Parquet-bestand, of alleen met één kern in een taak?
Wat zijn de voordelen en nadelen van rij- en kolomgebaseerde databases? Welke is efficiënter voor groepering en aggregatie?
In welke richting zou het interessant zijn om te ontwikkelen — etalages, ontwikkeling, analyse, misschien AI?
Beschrijf de vensterfuncties in de meest uitgebreide vorm: welke sleutelwoorden worden gebruikt en waar dient elk van hen voor.
Wat is een index? Wat is het verschil tussen een geclusterde en een niet-geclusterde index?
Als er 10 cores op de executor zijn, hoeveel taken worden er gelijktijdig uitgevoerd op een moment?
Vertel eens over jezelf — werkervaring, technologiestack
-- Gegeven tabel numbers met één kolom num (hele getallen, kunnen zich herhalen). -- Schrijf een SQL-query die de getallen splitst in twee kolommen: -- even – even getallen (op volgorde van klein naar groot) -- odd – oneven getallen (op volgorde van klein naar groot) -- De getallen moeten rij voor rij worden geplaatst: in de eerste rij – het eerste even en het eerste oneven, -- in de tweede rij – het tweede even en het tweede oneven, enz. -- Als in één van de groepen meer getallen zijn dan in de andere, moeten de ontbrekende plaatsen NULL zijn. -- oorspronkelijke tabel -- num -- --------- -- [phone] -- resultaat van de query -- even | odd -- -----|----- -- 2 | 1 -- 4 | 3 -- 6 | 5 -- 8 | 7 -- 10 | 9 -- NULL | 11 -- NULL | 11
Vertel eens over jouw begrip van datakwaliteit — heb je ervaring met dit vakgebied?
Wat is LEFT SEMI JOIN en LEFT ANTI JOIN in Spark SQL, heb je ze ooit moeten gebruiken?
Welke fysieke JOINs ken je?
Hoe werkt de Nested Loop Join en wat is de algoritmische complexiteit ervan? Wat is de complexiteit van alle drie de algoritmes?