Ինչու bool([""]) վերադարձնում է True?
Data Engineer
Ի՞նչ կլինի, եթե ստեղծեք DAG, որի start_date-ը 2024 թվականի հունվարի 1-ն է։
Ի՞նչ է տարբերությունը repartition և coalesce-ի միջև Spark-ում։
Ինչպես պայքարել տվյալների անհամապատասխանության դեմ։
Առաջադրանք #3 Պետք է գտնել հաճախորդներին, որոնց պատվերների միջև տարբերությունը > 60 օր է: Նրանց համար ցույց տալ առավելագույն տարբերությունը (gap_days): Պատվերների աղյուսակ: | order_id | customer_id | order_dt | |----------|-------------|------------| | 1 | 1 | [phone] | | 2 | 1 | [phone] | | 3 | 1 | [phone] | | 4 | 1 | [phone] | | 5 | 2 | [phone] | | 6 | 2 | [phone] | | 7 | 3 | [phone] | Վերջնական արդյունքը: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 |
Ինչպե՞ս կպատմեիր կոդում, որ արժեքը զգալիորեն տարբերվում է նորմալ (պահանջվող) բաշխումից։
Ինչու կարող են տվյալները կորել: Տվեք մի քանի պատճառներ։
Ինչ եք գիտակցում spill- ի մասին Spark-ում?
Դուք աշխատե՞լ եք Python-ում կոնտեքստային մենեջերների հետ: Ի՞նչ են դրանք և ինչու են անհրաժեշտ:
Ինչպե՞ս կանխել սխալ տվյալների բեռնումը վիտրինա կամ միջնակարգ աղյուսակում և նրանց բարձրագույն պայպլայններին հասցնելը։
Ի՞նչ է անում depends_on_past պարամետրը Airflow-ում։
Ի՞նչ մեթոդներ եք ճանաչում Airflow-ի առաջադրանքների միջև տվյալների փոխանցման համար:
Ինչպե՞ս հետևում էիք տվյալների որակին։
Եթե DAG-ի ժամանակացույցը @daily է, նա իրականում երբ է սկսվում?
Python-ի բառարանն փոփոխական կամ անփոփոխ տեսակ է: Ի՞նչ պահանջներ կան նրա բանալիների և արժեքների համար:
Կատարե՞լ եք վիճակագրական ստուգումներ:
Ի՞նչ է որոնման ալգորիթմական բարդությունը բառարանում ամենավատ դեպքերում։
Ինչպես սկսել երկրորդ DAG-ը Airflow-ով անմիջապես առաջինի հաջող ավարտից հետո?