Data Engineer
Ați folosit Bridge și tabele PIT în Data Vault? Oferiți un exemplu și explicați scopul.
Povestiți despre sarcina de configurare a replicării pe care ați rezolvat-o.
Care sunt dezavantajele UDF-urilor în Spark și care este cel mai mare dezavantaj al lor?
Cum determină Spark că un tabel este suficient de 'mic' pentru un join de tip broadcast (limita superioară)?
În PostgreSQL, antetul de versiune al rândului include parametrul xmax. Care este rolul său în gestionarea tranzacțiilor? - Pentru crearea unui identificator unic pentru rând în tabel - Pentru verificarea vizibilității rândului de către alte tranzacții - Pentru indicarea numărului de tranzacție care a șters sau actualizat rândul - Pentru blocarea rândului împotriva modificărilor simultane de către mai multe tranzacții - Pentru indicarea valorii maxime care poate fi scrisă într-o coloană numerică
Povestește în general despre experiența ta și ce ai studiat.
Ce este important pentru tine într-un proiect nou, o echipă nouă sau o companie nouă?
Ce procese sunt inițiate atunci când ștergem sau modificăm înregistrări în ClickHouse?
Ce este VACUUM în PostgreSQL? Ce tipuri există? Se poate folosi în producție?
Ce este LEFT SEMI JOIN și LEFT ANTI JOIN în Spark SQL, a fost nevoie să le folosiți vreodată?
Care este diferența dintre comenzile docker run și docker exec?
A fost creată o secvență specială numită even_sequence, care generează doar numere pare. Ce trebuie să se pună în locul [...] pentru ca, în cazul în care valoarea even_column nu a fost specificată la inserare, să se ia valoarea din even_sequence? create table some_table( even_column [...] ); integer computed as nextval('even_sequence') integer generated always as identity (start with 2 increment by 2) integer default nextval('even_sequence') integer unique default nextval('even_sequence') integer generated by even_sequence’
Care este complexitatea algoritmică pentru obținerea unui element după cheie dintr-un dicționar (dict) în Python?
Cum să alegi cheia de sharding corectă pentru o distribuție uniformă a datelor?
Cum ai proceda cu lanțul Materialized View printr-o tabelă intermediară ReplacingMergeTree pentru a popula corect datele deja existente înainte de lansarea noii MV?
Ce este o Vizualizare Materializată și în ce constă diferența față de o Vizualizare obișnuită?
Cum verificați corectitudinea datelor în timpul traducerii unui pipeline de la SAS la DBT?
Ce nu-ți place în prezent la locul tău de muncă?
Care este diferența dintre refactorizare și optimizare?
Când nu avem nevoie de stocare de date?