Ինչքան լավ եք ծանոթ Linux/Docker-ին?
Data Engineer
Ինչ է shuffle-ը Spark-ում և ինչու է դա անհրաժեշտ?
Ինչպես կառավարել shuffle-ը Spark-ում (բաժանում, broadcast join և այլն):
Ի՞նչ է բերում Iceberg ձևաչափը սովորական Parquet-ի համեմատ։
Դուք ծանոթ եք ընդհանուր աղյուսակային արտահայտություններին (CTE)? Տվեք օգտագործման օրինակ։
Ի՞նչ է վիճակագրությունը տվյալների բազաների կառավարման համակարգերի և հարցումների օպտիմալացման համատեքստում։
Ինչպե՞ս գտնել Linux-ում լոգ ֆայլի կոնկրետ սյունակում ենթատեքստ (օրինակ, երրորդ սյունակում ամսաթիվ):
[անունը] խոսեց իր փորձառության մասին տարբեր տվյալների բազաների կառավարման համակարգերով աշխատելու, որքան խորությամբ պետք է մտնել օպտիմիզացիայի և ներքին մանրամասների մեջ։
Նկարագրեք մանրամասն աղբյուրից ինկրեմենտի բռնումի ալգորիթմը, որպեսզի ոչինչ չկորցվի բեռնման հաճախականության փոփոխության ժամանակ։
Ինչպե՞ս կազմակերպել Kafka- ի նույն հաղորդագրության ընթերցումը մի քանի տարբեր սպառողների կողմից (fan-out):
Ինչպես լուծել խնդիրը, երբ ընթերցման գործընթացը կարող է տեսնել աղյուսակի միջանկյալ (չհամապատասխան) վիճակը շատփուլային ETL (delete+insert) ժամանակ Iceberg-ում?
Ինչպե՞ս համեմատել սկզբնական («կենդանի») և նպատակային աղյուսակը, եթե աղբյուրը մշտապես փոխվում է։
Ի՞նչ է «մեռած տիպիկը» (dead tuple):
Ինչպես են կապված Spark-ի բաժանումները և աղյուսակների բաժանումները (օրինակ, Iceberg-ում):
Պատմեք ինդեքսների կիրառման լավագույն պրակտիկաների մասին՝ երբ և որքան հաճախ օգտագործել։
Ի՞նչ է Spark JDBC-ն և ինչպես արդյունավետորեն բեռնել մեծ աղյուսակը դրա միջոցով:
Ինչպես հայտնաբերել տվյալների խեղաթյուրվածությունը (data skew) Spark-ում?
Ի՞նչ է տրանսակցիոն օրագրը (WAL) տվյալների բազայի կառավարման համակարգում և ինչու է այն անհրաժեշտ:
Նշանակվե՞լ է գրանցումների հեշների համեմատության մեթոդը՝ տարբերությունը հաշվարկելու համար աղբյուրի և նպատակային աղյուսակի միջև։
Ինչու են անհրաժեշտ cache և persist-ը Spark-ում։