Data Engineer
Waar kunnen de taaklogs in Airflow worden bekeken?
CREATE TABLE orders ( driver_id varchar, city varchar, order_id varchar ); -- Haal de top 10 chauffeurs op basis van het aantal bestellingen in elke stad
Gegeven zijn twee tabellen t1 en t2. De taak is om alle soorten joins die je kent op te sommen en het resultaat van de query select * from t1 <join> t2 on t1.t = t2.t voor elk van hen. |t1.t| ------ 1 2 4 null ------ |t2.t| ------ 1 3 null null
Waar werkt gegevenscompressie het beste — in kolomgebaseerde of rijgebaseerde opslag en waarom?
SELECT * FROM table1 AS t1 LEFT JOIN table2 AS t2 ON t1.date_start > t2.date_start
SELECT * VAN tabel1 ALS t1 LINKS JOIN tabel2 ALS t2 ON t1.date_start > t2.date_start d = { True: 42, 1: 2, 1.0: 100500 } print(d)
Wat zijn indexen in databases, waar dienen ze voor en wat is hun interne structuur?
Wat is het verschil tussen een lus over een string en een lus over een tuple in Python? Welke types zijn basaal en hoe beïnvloedt dit de prestaties?
Analyse van bezoekersaantallen in fitnessclubs Je werkt als analist bij een netwerk van fitnessclubs. Je hebt informatie over gebruikersbezoeken en de abonnementen die ze kopen. Het is nodig om de effectiviteit van het gebruik van abonnementen te analyseren. Bereken voor elk type abonnement: • het totale aantal gebruikers dat dit type abonnement heeft gebruikt. Alleen unieke user_id's overwegen; • het totale aantal bezoeken door dit abonnement. Alle bezoeken van gebruikers met dit abonnement overwegen; • het aandeel van gebruikers van dit abonnement in procenten van het totale aantal gebruikers (afgerond op één decimaal). Gebruik voor de berekening de verhouding tussen het aantal gebruikers met dit abonnement en het totale aantal unieke gebruikers. Elke gebruiker kan slechts één abonnement hebben. Sorteer het resultaat op alfabetische volgorde van het abonnements type. Invoerformaat Tabel memberships: • membership_id (int) — uniek identificatienummer van het abonnement • user_id (int) — uniek identificatienummer van de gebruiker • membership_type (text) — type abonnement Tabel visits: • visit_id (int) — uniek identificatienummer van het bezoek • user_id (int) — identificatienummer van de gebruiker • visit_date (timestamp) — datum en tijd van het bezoek De gegevens bevatten geen ontbrekende of onjuiste waarden. Uitvoerformaat De query moet een tabel retourneren met de volgende velden in deze volgorde: • membership_type (text) — type abonnement • users_count (int) — aantal unieke gebruikers met dit type abonnement • total_visits (int) — totaal aantal bezoeken van deze gebruikers • user_share (numeric) — aandeel van gebruikers van dit type abonnement in procenten van het totaal, afgerond op één decimaal De resultaten worden gesorteerd op alfabetische volgorde van het abonnements type.
Threading, multiprocessing, asyncio: wat is het verschil en wanneer is het beter om wat te gebruiken?
Vertel ons over je ervaring met Greenplum, DBT en Data Vault. Waarom ben je overgestapt van het sneeuwvlokmodel naar Data Vault?
Hoe ga je om met de situatie waarin het bedrijf vraagt om een rapport met datavisualisatie over een nieuwe actie?
Verticaal en horizontaal gegevensopslag: wat weet je erover? Wanneer en welke moet je kiezen en waarom?
Vertel me over je werkervaring: taken, technologiestack
Wat is het verschil tussen RANK() en DENSE_RANK()?
Waar verschijnt parallelisme in Airflow?
Waarom is Pandas beter dan gewone lijsten en woordenboeken in Python?
Hoe behandelt Pandas ontbrekende gegevens?
Hoe werkten jullie met Impala?
Hoeveel extra geheugen vereist een oplossing met woordenboek, exclusief de geretourneerde gegevens?