Data Engineer
Ի՞նչ լրացուցիչ պարամետրեր DDL/CREATE TABLE- ի մասին գիտեք ClickHouse-ում, դրանք ինչի վրա են ազդում և ինչ դեպքերում են օգտագործվում։
Ինչ տեսակի պահեստավորում ունի Parquet՝ տողային թե սյունակային?
Ինչ փորձ ունեք SQL և հարաբերական տվյալների բազաների հետ?
Ի՞նչ վատություններ ունեն Spark-ի UDF-ները և ինչ է նրանց բացթողումը։
Ի՞նչ լրացուցիչ Data Vault միավորներ են օգտագործվել՝ օրինակ, same-as links կամ transactional links:
Պատմեք Python-ում փոփոխական և անփոփոխ տվյալների տեսակների մասին և տվեք օրինակներ։
Ի՞նչ տեխնիկական դաշտեր են օգտագործվել satellites, links և hubs Data Vault-ում։
Կարո՞ղ է Greenplum-ում օգտագործել պատահական բաշխում և երբ դա տեղին է։
Հարց #1 Ի՞նչ քանակի գրառումներ կվերադարձնի հարցումը inner, left, right, full join-ով երկու աղյուսակների միացման ժամանակ, ըստ id ատրիբուտի t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:
Ինչու եք նոր աշխատանք փնտրում?
Ի՞նչ է պատասխանատու Սյունակային խմբի համար Parquet ֆայլի կառուցվածքում։
Որ Docker պատկերները պետք է կառուցեիք և ինչու՞:
Ամեն մի տողի համար salary աղյուսակում ցույց տվեք աշխատակցի անունը, ամսաթիվը, աշխատավարձը և օգտագործելով պատուհանի ֆունկցիա, ավելացրեք «բաժնի միջին աշխատավարձ այս ամսաթվին» սյունակը։
Ի՞նչ չափով եք աշխատել Spark-ով և որքան խորությամբ եք ներգրավվել դրանում։
Ի՞նչ է բաժանումը և բաշխումը (sharding):
Պատմեք ընկերությունում վերջին 2,5 տարվա ընթացքում հետաքրքիր առաջադրանքի մասին, օրինակ՝ կապված ClickHouse-ի հետ։
Ինչպե՞ս ավելացնել օգտագործողի համար ընթացիկ և նախորդ երկու օրվա պատվերների գումարի մանրէային միջինը։
Ինչպես է աշխատում hash join-ը 1,000 և 1,000,000 տող ունեցող աղյուսակների համար?
Նշանակվե՞լ է գրանցումների հեշների համեմատության մեթոդը՝ տարբերությունը հաշվարկելու համար աղբյուրի և նպատակային աղյուսակի միջև։
Պատմեք Kafka-ի հիմնական հասկացությունների մասին (օգտագործողների խումբ, բաժիններ, թեմաներ):