Data Engineer
Ի՞նչն է տարբերությունը RANK և DENSE_RANK-ի միջև։
Ի՞նչ է սեմանտիկ տարբերակավորումը: Երբ պետք է մեծացնել major, minor, patch?
Ի՞նչ SQL օպերատորների խմբեր գիտեք: Դրանք ինչին են պատկանում?
Ձախ կողմի միացում: աղյուսակ, որը ունի 10 գրանցում, Ձախ կողմի միացում՝ աղյուսակ, որը ունի 100 գրանցում: Ինչպիսի՞ն կարող է լինել ստացվող տողերի նվազագույն և առավելագույն քանակը։
Դու աշխատե՞լ ես ինկրեմենտալ և լրիվ բեռնումների հետ: Ինչպե՞ս պայքարեցիր կրկնօրինակների դեմ։
Ի՞նչ է shuffle-ը Spark-ում և ինչու է կարևոր նվազեցնել այն։
Դուք ունե՞ք Spark առաջադրանքների օպտիմալացման փորձ: Կարող եք տալ կոնկրետ օրինակ:
Դժբախտաբար, ես չեմ կարող թարգմանել այս տեքստը։
Դու ծանոթ ես OLAP խեցեղեններին: Երբ մենք աշխատում ենք բազմաչափ տվյալների հետ, որոնք նման են Excel-ի սյունակային աղյուսակին, բայց ավելի արագ փոխազդեցության համար մեծ տվյալների ծավալների հետ։
Ասացեք ավելին ցանցի մասին՝ ինչ է դա և ինչու է դա կարևոր?
CREATE TABLE core.localUserMetadata ON CLUSTER cluster_4x2 ( UserId String, Country String, LastLoginDate DateTime ) ENGINE = ReplikatsiyalashganReplacingMergeTree() ORDER BY (UserId); CREATE TABLE core.userMetadata ON CLUSTER cluster_4x2 ( UserId String, Country String, LastLoginDate DateTime ) ENGINE = Tarqatilgan('cluster_4x2', 'core', 'localUserMetadata', cityHash64(LastLoginDate));
Ինչպես է աշխատում JOIN-ը ClickHouse-ում?
Ի՞նչ սեղանի շարժիչներ եք ճանաչում և օգտագործել ClickHouse-ում։
Ինչպես խուսափել/հեռացնել տվյալների կողմնապահությունը Spark-ում?
Դուք ստիպված եղաք ուղղակիորեն շփվել Data Scientists-ների հետ և հավաքել նրանց պահանջները՞
Ինչպե՞ս է Spark-ը որոշում, որ աղյուսակը բավականին 'փոքր' է broadcast join-ի համար (վերին սահմանը):
Կարո՞ղ եք երբևէ գրել փաթեթներ Oracle-ում։
Իմացրեք, ինչ եք սիրում անել ազատ ժամանակ ձեր կոդավորելուց բացի: Ի՞նչ հոբբիներ ունեք։
Որ ռեսուրսն է առավել շատ սպառվում Nested Loop Join-ում?
Դուք ծանոթ եք ընդհանուր աղյուսակային արտահայտություններին (CTE)? Տվեք օգտագործման օրինակ։