Data Engineer
Welke Spark JDBC-parameters werden gebruikt om het lezen te paralleliseren?
In welke richting zou het interessant zijn om te ontwikkelen — etalages, ontwikkeling, analyse, misschien AI?
-- t1 -- num --------- -- 1 -- 2 2 null null 4 -- t2 -- num --------- -- [telefoon] null null 5 SELECT a.num ALS a_num, b.num ALS b_num VAN t1 a LINKS JOIN t2 b OP a.num = b.num;
Welke niet-voor de hand liggende problemen kunnen zich voordoen bij het laden van grote tabellen (behalve prestaties)?
De vensterfunctie SUM() OVER (PARTITION BY user_id) — in één geval voegen we ORDER BY aankoopdatum toe, in het andere niet. Wat is het verschil?
Hoe zijn uw dbt-modellen opgebouwd en hoe verzamelt u de vitrine uit meerdere bronnen via Trino?
Wat voor soort opslag heeft Parquet: rij of kolom?
Wat was jouw architectuur in het project? DWH of iets anders?
Waarom geeft bool([""]) True?
Vertel me over je ervaring met gedistribueerde databases (Greenplum, ClickHouse)?
Stel een oplossing voor voor het regelmatige incrementele laden van een grote tabel met een flexibele (wijzigbare) frequentie van updates van Postgres naar Data Lake.
En als we alle klanten nodig hebben, zelfs als ze op die datum geen transacties hadden, hoe kunnen we ze weergeven?
Wat is de trigger voor het maken van een nieuwe Job in Spark, en hoe wordt een Job verdeeld in Stages en Tasks?
Wat is LEFT SEMI JOIN en LEFT ANTI JOIN in Spark SQL, heb je ze ooit moeten gebruiken?
Op welke technologieën is jouw lakehouse gebouwd en welke problemen ontstaan bij het werken met Apache Iceberg?
Wat is RDD in Apache Spark en hoe verschilt het van andere abstracties van Spark?
Heeft u ervaring met de volledige cyclus: van een niet-gestructureerd verzoek van de gebruiker tot het uiteindelijke visualisatiepaneel? Vindt u dit soort werk leuk?
Hoe is het precies gelukt om de queries op Data Vault te optimaliseren, terwijl het meestal het aantal joins verhoogt?
Heb je XCom gebruikt in Airflow?
Wat is normalisatie en het ER-model, waar zijn ze voor?