Data Engineer
Wat zijn uw salarisverwachtingen?
Wat is de algoritmische complexiteit voor het verkrijgen van een element op basis van een sleutel uit een woordenboek (dict) in Python?
Welke processen worden gestart wanneer we records verwijderen of wijzigen in ClickHouse?
Wordt ACID nageleefd in Greenplum?
Welke soorten fysieke verbindingen (join-methoden) zijn er?
Maak een lijst van dure boekingen Vraag Hoe kun je een lijst maken van boekingen op de dag van [telefoon] die de kosten voor de lid (of gast) meer dan $30 laten bedragen? Onthoud dat gasten verschillende kosten hebben dan leden (de vermelde kosten zijn per halfuur 'slot'), en dat de gastgebruiker altijd ID 0 is. Voeg in je output de naam van de faciliteit, de naam van het lid geformatteerd als één kolom, en de kosten toe. Sorteer op aflopende kosten, en gebruik geen subqueries.
Er is een speciale sequentie gemaakt genaamd even_sequence, die alleen even getallen genereert. Wat moet er op de plaats van [...] worden ingevuld zodat, indien de waarde van even_column niet is opgegeven bij het invoegen, de waarde wordt gehaald uit even_sequence? create table some_table( even_column [...] ); integer computed as nextval('even_sequence') integer generated always as identity (start with 2 increment by 2) integer default nextval('even_sequence') integer unique default nextval('even_sequence') integer generated by even_sequence’
Hoe verschilt HDFS van gewone gedistribueerde bestandssystemen?
Toetsing toont alleen REST-verzoeken of iets anders?
Heb je gewerkt met incrementele en volledige ladingen? Hoe ging je om met duplicaten?
Welke soorten JOIN ken je? Vertel 2-3 belangrijkste.
Wat is gegevenspartitionering en hoe helpt het om een volledige scan van de tabel te voorkomen?
Welke methoden (typen) voor het opslaan van gegevensgeschiedenis ken je? Hoe wordt de geschiedenis in tabellen opgebouwd?
Hoe werkt Merge Join (samenvoeging met sortering)?
-- Oorspronkelijke stretch-tabel -- Het is nodig om NULL-waarden in te vullen met de vorige niet-NULL waarde per id - naar beneden uitvullen id | ttime | val ---|-------|----- 1 | 07:30 | NULL 1 | 09:21 | 10 1 | 13:53 | NULL 1 | 16:12 | NULL 2 | 09:42 | 133 2 | 15:20 | NULL 2 | 21:33 | NULL 3 | 08:01 | NULL 3 | 11:41 | 8 3 | 14:23 | NULL 3 | 16:17 | NULL 3 | 19:54 | 2 4 | 13:10 | 312 4 | 14:42 | NULL 4 | 16:31 | 7 4 | 17:44 | NULL id | ttime | val ---|-------|----- 1 | 07:30 | NULL 1 | 09:21 | 10 1 | 13:53 | 10 1 | 16:12 | 10 2 | 09:42 | 133 2 | 15:20 | 133 2 | 21:33 | 133 3 | 08:01 | NULL 3 | 11:41 | 8 3 | 14:23 | 8 3 | 16:17 | 8 3 | 19:54 | 2 4 | 13:10 | 312 4 | 14:42 | 312 4 | 16:31 | 7 4 | 17:44 | 7 -- SQL-query om de gewenste tabel te verkrijgen SELECT id, ttime, COALESCE(val, LAST_VALUE(val) OVER(PARTITION BY id ORDER BY ttime)) as val FROM stretch
Hoe voorkom/verwijder je datavervorming in Spark?
Heeft u ervaring met het optimaliseren van Spark-taken? Kunt u een concreet voorbeeld geven?
De opslag is gebouwd volgens het Data Vault-schema — heb je het ook ontwikkeld, onderhouden? Heb je handmatig hubs, links toegevoegd?
Vertel op hoofdlijnen hoe de architectuur van Spark is opgebouwd: welke componenten zijn er en hoe werken ze samen bij het uitvoeren van een SQL-query.
Vertel me over Greenplum — gegevensopslagformaten, rij- en kolomopslag.