Data Engineer
Въпрос #1 Колко записа ще върне заявката с inner, left, right, full join на две таблици при свързването им по атрибута id t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:
Запазихте ли резултатите от таблицата изгледи в Parquet или по друг начин в S3?
Защо търсите нова работа?
За какво отговаря Групата на редовете в структурата на Parquet файла?
Какви Docker образи трябваше да изградите и защо?
Защо сега разглеждаш нови предложения?
Колко общо работихте със Spark и колко дълбоко се потопихте в него?
Какво е CROSS JOIN и какъв е резултатът от неговото прилагане?
Как решавахте проблемите с оптимизацията, когато заявката работи дълго и извършва пълно сканиране? Как бихте подходили към такава нова задача?
Какво прави параметърът depends_on_past в Airflow?
За какво изобщо ви беше нужен Data Vault?
Използва ли се методът за сравняване на хешове на записи за изчисляване на разликата между източника и целевата таблица?
Какво ще се случи, ако приложите `s ** 2` към списъка `s = [1, 2, 3]`?
Сблъсквали ли сте се с грешката ClickHouse `Too many parts` при вмъкване? Как я решихте?
С кои файлови формати работихте?
Какви видове физически JOIN-ове съществуват в Spark?
Какво се случва физически при INSERT, UPDATE и DELETE в Greenplum; защо след DELETE мястото на диска не се освобождава и каква е разликата между DELETE и TRUNCATE?
Защо могат да се загубят данните? Дайте няколко причини.
Разкажете за себе си: опит, задачи, функции или постижения, с които се гордеете.
Имаш ли опит с FastAPI?