Data Engineer
Întrebarea #1 Câte înregistrări va returna interogarea cu inner, left, right, full join a două tabele la unirea pe atributul id t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:
Ați stocat rezultatele vizualizărilor tabelare în Parquet sau altfel în S3?
De ce cauți un nou loc de muncă?
Cu ce se ocupă Grupul de Rânduri în structura fișierului Parquet?
Ce imagini Docker a fost nevoie să construiți și de ce?
De ce iei în considerare oferte noi acum?
Cât timp ați lucrat în total cu Spark și cât de profund v-ați implicat în el?
Ce este un CROSS JOIN și care este rezultatul aplicării sale?
Cum ați rezolvat problemele de optimizare atunci când interogarea durează mult și efectuează o scanare completă? Cum ați aborda o astfel de sarcină nouă?
Ce face parametrul depends_on_past în Airflow?
Pentru ce ai avut nevoie în general de Data Vault?
A fost utilizată metoda comparării hash-urilor înregistrărilor pentru calcularea diferenței dintre sursă și tabelul țintă?
Ce se întâmplă când aplici `s ** 2` pe lista `s = [1, 2, 3]`?
V-ați confruntat vreodată cu eroarea ClickHouse `Too many parts` la inserare? Cum ați rezolvat-o?
Cu ce formate de fișiere ai lucrat?
Ce tipuri de JOIN-uri fizice există în Spark?
Ce se întâmplă fizic în timpul unui INSERT, UPDATE și DELETE în Greenplum; de ce spațiul pe disc nu este eliberat după un DELETE și în ce constă diferența dintre DELETE și TRUNCATE?
De ce pot fi pierdute datele? Oferă câteva motive.
Spuneți despre dvs.: experiență, sarcini, caracteristici sau realizări de care sunteți mândru.
Ai experiență cu FastAPI?