Data Engineer
Voor elke rij in de tabel salaries, toon de naam van de werknemer, de datum, het salaris en voeg met een vensterfunctie een kolom toe "gemiddeld salaris per afdeling op deze datum".
Is er een concept genaamd transactiesisolatieniveaus? Wat weet je erover?
Hoe zijn de sortering binnen de vensterfunctie en de uiteindelijke sortering ORDER BY in de query gerelateerd?
print(len(' '.join(map(str, [0, 1]))))
Hoe beheer je de bronnen van een Spark-toepassing om niet te veel geheugen te verbruiken bij het wijzigen van het volume van de invoergegevens?
Wat is partitionering en distributie (sharding)?
Wat is een "dode tuple" (dead tuple)?
dict1 = { (1, 2), [3, 4, 5] : 0 } var = 1, 2
Taak #2 Schrijf een query die de TOP-3 werknemers met het hoogste salaris in elke afdeling toont. Toon de naam van de afdeling, de naam van de werknemer en zijn salaris. employee tabel: | id | name | salary | dept_id | |----|-------|--------|---------| | 10 | John | 1000 | 2 | | 20 | Tom | 5000 | 3 | | 30 | Bill | 3000 | 2 | department tabel: | id | name | |----|-----------| | 1 | Marketing | | 2 | IT | | 3 | Finance | Uitvoer: department_name, num, employee_name, salary met cte als( select d.name as department_name, e.name as employee_name, e.salary, dense_rank from employee e join department d on e.id = d.id
Vertel over een interessante taak in het bedrijf in de afgelopen 2,5 jaar, bijvoorbeeld gerelateerd aan ClickHouse.
Vertel een voorbeeld waarin je kunstmatige intelligentie hebt gebruikt om routinematige processen te automatiseren.
Waarom zijn er op maat gemaakte scripts in Python/Airflow gekozen voor Data Quality in plaats van een kant-en-klare motor, zoals Great Expectations?
In je eigen woorden, wat is een FULL JOIN?
Wat is een CROSS JOIN en wat is het resultaat van het gebruik ervan?
Hoe voeg je een voortschrijdend gemiddelde toe van de som van bestellingen voor de huidige en de twee voorgaande dagen per gebruiker?
Hoe werkt hash join voor tabellen met 1.000 en 1.000.000 rijen?
Vertel over de replicatie-instelling die je hebt opgelost.
Wat zijn de nadelen van UDF's in Spark en wat is hun grootste minpunt?
Vertel over de basisconcepten van Kafka (consumer group, partitions, topics).
Bent u ooit de fout `Too many parts` van ClickHouse tegengekomen bij het invoegen? Hoe hebt u het opgelost?