Data Engineer
Koji ste okvir koristili za pisanje pipeline-ova? Kako ste koristili Airflow?
Svojim rečima, šta je FULL JOIN?
Технички, база података у систему за управљање базама података (СУБД) је једноставно фајл, од којег потичу ограничења као што су NULL/NOT NULL? За шта служе ове логичке апстракције?
Da li ste ikada naišli na grešku ClickHouse `Too many parts` prilikom ubacivanja? Kako ste je rešili?
Da li je moguće koristiti slučajnu distribuciju u Greenplum i kada je to prikladno?
Zašto tražite novi posao?
Šta se fizički dešava prilikom INSERT, UPDATE i DELETE u Greenplum; zašto se nakon DELETE mesta na disku ne oslobađa i čime se DELETE razlikuje od TRUNCATE?
Kako sprečiti da netačni podaci učitani u vitrin ili međuspremnu tabelu dođu do viših pipeline-ova?
Zašto podaci mogu biti izgubljeni? Navedi nekoliko razloga.
Kako su povezani sortiranje unutar funkcije prozora i završno sortiranje ORDER BY u upitu?
Zašto su u S3 potrebne "fajl strukture"/prefiksi osim za udobnost?
Са којим Python библиотекама сте радили?
Šta je particionisanje i distribucija (sharding)?
dict1 = { (1, 2), [3, 4, 5] : 0 } var = 1, 2
Ispričaj primer kada si koristio veštačku inteligenciju za automatizaciju rutinskih procesa.
Šta radi parametar depends_on_past u Airflow-u?
Koja je razlika između ACID i CAP teoreme?
# šta prikazuje s = 'abracadabra' print(s[5][0][0][0]) print(s[::-2]) s = [1, 2, 3] print(s * 2)
Kako su radili sa 1C: preuzimali su podatke direktno iz baze podataka, putem šine ili na drugi način?
Šta se dešava u PostgreSQL nakon izvršenja upita SELECT * FROM [tabela]?