Објасни уопштено како је организована архитектура Spark: које компоненте постоје и како сарађују приликом извршавања SQL упита.
Data Engineer
SELECT client_id, ФИО, SUM(suma) AS total_amount FROM clients JOIN transactions ON clients.client_id = transactions.client_id WHERE дата = '2025-05-01' GROUP BY client_id, ФИО;
Ako postavimo uslov za filtriranje po datumu transakcije u WHERE (nakon LEFT JOIN), da li će to ograničiti rezultat na prvoj tabeli (klijentima)?
Čime se razlikuje format skladištenja Parquet od CSV?
Čime se razlikuje particionisanje od shardinga?
Šta je particionisanje? Šta je sharding? Šta je replikacija?
Šta je indeks? Čime se razlikuje klasterizovani indeks od neklausterizovanog?
У којем правцу би било интересно развијати се: витрине, развој, анализа, можда AI?
## задатак о моди # Постоји листа бројева. Напишите функцију која проналази мод у овој листи. # find_mode([1, 2, 3, 3, 4, 5]) #> 3
Kako pravilno odrediti polje distribucije u Greenplum? Šta se dešava tokom Motion?
Ispričaj mi gdje si radio kao sistemski analitičar i koje zadatke si obavljao?
Za šta je odgovorna Grupa redova u strukturi Parquet fajla?
Koje metode (tipove) čuvanja istorije podataka poznaješ? Kako se istorija akumulira u tabelama?
Šta pokreće kreiranje novog Job-a u Spark-u i kako se Job deli na Stages i Tasks?
Da li ste sami vršili provere kvaliteta podataka ili su zahtevi dolazili od poslovnog/klijentskog?
Kako prikazati poslednje puno ime za svakog klijenta, ako je poznat samo početni datum (datum završetka nije poznat)?
Zašto tražiš novo radno mesto i čime bi voleo da se baviš u budućnosti?
Šta znači UNBOUNDED PRECEDING u granicama okvira funkcije okvira?
Koji fizički mehanizam JOIN će biti korišćen pri spajanju tabele transakcija sa tabelom kalendara po uslovu nejednakosti (datum <= datum)?
Da li ste ikada radili sa AQE (Adaptive Query Execution) optimizatorom u Spark-u? Znate li kako on funkcioniše?