Ce este ACID? Ce înseamnă fiecare literă? Cum se raportează la tranzacții?
Data Engineer
Cunoști formatul Avro?
Vorbește despre bazele de date relaționale în general — ce sunt acestea?
Când nu avem nevoie de stocare de date?
Ai experiență cu imaginile Docker, configurând medii pe o mașină virtuală?
Ce este tiparea rață (duck typing)?
Ai menționat procesele Docker, poți să ne spui mai detaliat cum este organizat acest lucru la voi?
Cum este organizat QA-ul dvs. (verificarea calității datelor)?
Care sunt limitările în utilizarea tabelelor hash?
Care este diferența dintre refactorizare și optimizare?
Ai experiență cu Table Engine Join în ClickHouse?
Povestiți-mi despre experiența dvs. cu bazele de date distribuite (Greenplum, ClickHouse)?
Presupune că Data Vault nu este disponibil și există două tabele largi care trebuie unite. Cum ai optimiza acest lucru în Greenplum? Și dacă ar fi în ClickHouse?
Ce este un plan de interogare? La ce sunt folosiți?
Ce tipuri de conexiuni fizice (metode de join) există?
Ce nu-ți place în prezent la locul tău de muncă?
Se poate gândi la ceva în plus în loc de un CTE obișnuit, având în vedere că filtrarea încă are loc în memorie pe întreaga tabelă?
În ce mediu a fost lansat Spark?
Aveți experiență cu motoare precum Trino sau cu formate tabelare (Iceberg, Parquet) în Spark?
Care este diferența dintre == și is în Python?