Data Engineer
Դուք երբևէ աշխատե՞լ եք Python-ի դեկորատորների հետ: Ի՞նչ են դրանք և որտեղ են կիրառվում:
Ինչպես օպտիմալացրին աղյուսակները և հարցումները՝ բաժանումներ, ինդեքսներ, ընտրության տրամաբանություն։
Ինչպե՞ս եք լուծել օպտիմիզացիայի խնդիրները, երբ հարցումը երկար է տևում և իրականացնում է լրիվ սկան: Ինչպե՞ս մոտենաք նման նոր խնդիրներին։
Ինչպե՞ս ավելացնել օգտագործողի համար ընթացիկ և նախորդ երկու օրվա պատվերների գումարի մանրէային միջինը։
Ինչ է shuffle-ը Spark-ում և ինչու է դա անհրաժեշտ?
Նկարագրեք մանրամասն աղբյուրից ինկրեմենտի բռնումի ալգորիթմը, որպեսզի ոչինչ չկորցվի բեռնման հաճախականության փոփոխության ժամանակ։
Դու կարո՞ղ եք աշխատել Oracle Data Integrator (ODI)-ի հետ։
Ինչպես լուծել խնդիրը, երբ ընթերցման գործընթացը կարող է տեսնել աղյուսակի միջանկյալ (չհամապատասխան) վիճակը շատփուլային ETL (delete+insert) ժամանակ Iceberg-ում?
Պահոցը կառուցվել է Data Vault սխեմայի համաձայն — դու էլ զարգացար, պահպանում էիր? Հավաքածու, հղումներ ձեռքով ավելացնո՞ւմ էիր։
Դուք ինքն եք կատարել տվյալների որակի ստուգումները, թե պահանջները եկել էին բիզնեսից/հաճախորդներից?
Ի՞նչ է որոնման ալգորիթմական բարդությունը բառարանում ամենավատ դեպքերում։
Ներկայացրեք Airflow-ում DAG գրելու սովորական առաջադրանքի օրինակ։
Ի՞նչ տեղի ունեցավ և ինչպես վերականգնել աշխատանքը։
Ի՞նչ է ACID-ը: Ի՞նչ է նշանակում յուրաքանչյուր տառը: Ինչպե՞ս է դա կապված գործարքների հետ:
Ինչ է տարբերությունը EXPLAIN ANALYZE և սովորական EXPLAIN-ի միջև: Ինչու՞ չի ցանկալի այն գործարկել DELETE/UPDATE հարցումներում։
Ի՞նչ է RDD-ը Apache Spark-ում և ինչպե՞ս է այն տարբերվում մյուս Spark-ի ամփոփումներից։
Կարող եք բացատրել, թե ինչ ենք ստանալու այստեղ վերջում? Պետք է մեկնաբանել յուրաքանչյուր քայլը, ինչպես է դա աշխատում։
Ինչ պետք է ստուգել, եթե լոգերը չեն բացվում (գործողություն 403)?
Որ փուլում են կատարվում տվյալների որակի ստուգումները (Data Quality), ինչպիսի՞ ստուգումներ են կատարվում և ինչ է տեղի ունենում անվավեր տվյալների հետ։
Airflow-ի առաջադրանքների օրագրերը սովորաբար ինչից են բաղկացած?