Data Engineer
Hoe werkt Merge Join (samenvoeging met sortering)?
Maak een lijst van dure boekingen Vraag Hoe kun je een lijst maken van boekingen op de dag van [telefoon] die de kosten voor de lid (of gast) meer dan $30 laten bedragen? Onthoud dat gasten verschillende kosten hebben dan leden (de vermelde kosten zijn per halfuur 'slot'), en dat de gastgebruiker altijd ID 0 is. Voeg in je output de naam van de faciliteit, de naam van het lid geformatteerd als één kolom, en de kosten toe. Sorteer op aflopende kosten, en gebruik geen subqueries.
Waarom hebben jullie specifiek voor DBT gekozen? Welke voordelen en nadelen zie je in dit framework?
Toetsing toont alleen REST-verzoeken of iets anders?
Wat is GIL (Global Interpreter Lock) en hoe werkt het in Python?
Wat zijn uw salarisverwachtingen?
Hoe verschilt HDFS van gewone gedistribueerde bestandssystemen?
Wat is het verschil tussen ROWS BETWEEN en RANGE BETWEEN?
Wat is dynamische typisering?
Wordt ACID nageleefd in Greenplum?
Welke methoden bestaan er om gegevens te verwijderen in ClickHouse?
Hoe herstel je werk van een remote branch als je bij het proberen `git checkout hotfix/missing-footer` een foutmelding krijgt dat de branch niet gevonden is?
Wat zijn de voordelen en nadelen van rij- en kolomgebaseerde databases? Welke is efficiënter voor groepering en aggregatie?
Welke voor- en nadelen van ACID kunnen worden genoemd, behalve de leessnelheid?
Vertel me over Greenplum — gegevensopslagformaten, rij- en kolomopslag.
Welke soorten tabellen heb je in Greenplum gebruikt? In welke gevallen werd heap gebruikt en in welke Append-Optimized?
Welke operators van Airflow heb je gebruikt? Hoe heb je via Airflow met dbt gecommuniceerd?
-- Oorspronkelijke stretch-tabel -- Het is nodig om NULL-waarden in te vullen met de vorige niet-NULL waarde per id - naar beneden uitvullen id | ttime | val ---|-------|----- 1 | 07:30 | NULL 1 | 09:21 | 10 1 | 13:53 | NULL 1 | 16:12 | NULL 2 | 09:42 | 133 2 | 15:20 | NULL 2 | 21:33 | NULL 3 | 08:01 | NULL 3 | 11:41 | 8 3 | 14:23 | NULL 3 | 16:17 | NULL 3 | 19:54 | 2 4 | 13:10 | 312 4 | 14:42 | NULL 4 | 16:31 | 7 4 | 17:44 | NULL id | ttime | val ---|-------|----- 1 | 07:30 | NULL 1 | 09:21 | 10 1 | 13:53 | 10 1 | 16:12 | 10 2 | 09:42 | 133 2 | 15:20 | 133 2 | 21:33 | 133 3 | 08:01 | NULL 3 | 11:41 | 8 3 | 14:23 | 8 3 | 16:17 | 8 3 | 19:54 | 2 4 | 13:10 | 312 4 | 14:42 | 312 4 | 16:31 | 7 4 | 17:44 | 7 -- SQL-query om de gewenste tabel te verkrijgen SELECT id, ttime, COALESCE(val, LAST_VALUE(val) OVER(PARTITION BY id ORDER BY ttime)) as val FROM stretch
Wat is gegevenspartitionering en hoe helpt het om een volledige scan van de tabel te voorkomen?
Wat doe je als je een probleem in de productie-pijplijn tegenkomt?