Data Engineer
## vraag over modus # Er is een lijst met getallen. Schrijf een functie die de modus van deze lijst vindt. # find_mode([1, 2, 3, 3, 4, 5]) #> 3
Vertel over de basisconcepten van Kafka (consumer group, partitions, topics).
Wat geeft de functie find_mode terug voor de lijst [1, 2, 3, 3, 4, 5]? Leg het stap voor stap uit.
Heeft u unittests geschreven? Heeft u die ervaring?
Waarom overweeg je momenteel vacatures?
Heeft u gewerkt met parameters en hints die het gebruik van Broadcast Join bepalen?
We hebben een ORDER BY op basis van het aantal bestellingen, en er zijn twee bestellingen met 5, nog twee met 3. Hoe zullen RANK() en DENSE_RANK() zich gedragen?
Hoe maakte je meestal het schema van de database — deed je dat handmatig in de database, bewaarde je de scripts ergens, of gebruikte je Liquibase? Wat was het proces?
Heeft u ervaring met het schrijven van documentatie?
Zijn er functies en mogelijkheden in Greenplum die niet in gewone MySQL en andere dialecten voorkomen?
Wat weet je over spill in Spark?
Wat zijn je plannen voor de komende 5 jaar? In welke richtingen zou je je willen ontwikkelen?
Wat is LEFT SEMI JOIN en LEFT ANTI JOIN in Spark SQL, heb je ze ooit moeten gebruiken?
Welke fysieke JOIN-mechanisme wordt gebruikt bij het samenvoegen van de transactietabel met de kalender tabel op basis van de ongelijkheid (datum <= datum)?
Vertel over best practices voor het gebruik van indexen - wanneer en hoe vaak ze te gebruiken.
Vertel me over je Python-niveau: wat je hebt gebruikt, hoe diep je objectgeoriënteerd programmeren kent
Hoe vermindert u het geheugenverbruik van de DataFrame in Pandas?
Hoe beheer je shuffle in Spark (partitionering, broadcast join, etc.)?
Wat zijn de kenmerken en verschillen tussen Set en List in Python? Behalve de prestaties, welke andere kenmerken zijn er?
Welke traceertools zijn gebruikt? In Spring Boot 2 en Spring Boot 3?