Data Engineer
Դու աշխատե՞լ եք feature store-ների հետ։
Ինչ եք գիտակցում spill- ի մասին Spark-ում?
Նախատեսեք, որ Data Vault հասանելի չէ և կան երկու լայն աղյուսակներ, որոնք պետք է միացվեն: Ինչպե՞ս եք դա օպտիմալացնում Greenplum-ում: Իսկ եթե դա լիներ ClickHouse-ում:
Ինչպե՞ս կիրականացնես ֆիլտրումը միացման առաջ հարցումում։
Դու Մոսկվայից ես? Դու այստեղ երկար ժամանակ ես ապրում? Ինչու տեղափոխվեցիր Մոսկվա?
Ինչպես է ֆիզիկապես տեղի ունենում broadcast մեխանիզմը — ինչպես են փոքր աղյուսակի բաժանումները հասնում մեծ աղյուսակով աշխատող executor-ներին?
Ինչու օգտագործվեց Parquet՝ փոխարեն ORC-ի?
Ինչպե՞ս է լուծվելու տվյալների անհամապատասխանության ռիսկերի հետ աշխատելը և տվյալների պատասխանատվությունը։
Ինչպե՞ս եք աշխատել ֆայլերի հետ DAG-ի կրկնակի գործարկումից հետո, որպեսզի չխորանաք տվյալները S3-ում անավարտ տվյալներով:
Տրոյական 3 չափանիշ՝ ընտրելու առաջարկը, եթե մի քանի առաջարկ կա։
Ի՞նչ է «մեռած տիպիկը» (dead tuple):
Ի՞նչ է Spark JDBC-ն և ինչպես արդյունավետորեն բեռնել մեծ աղյուսակը դրա միջոցով:
Վահանակի ֆունկցիա SUM() OVER (PARTITION BY user_id) — մի դեպքում ավելացնում ենք ORDER BY գնելու ամսաթիվը, մյուս դեպքում՝ ոչ: Ինչ տարբերություն կա?
Ինչպե՞ս են կառուցված ձեր dbt մոդելները և ինչպես եք հավաքում վիտրինան մի քանի աղբյուրներից Trino-ի միջոցով։
Ի՞նչ է ձեր համար գործարար և ենթակառուցվածքային խնդիրների իդեալական հարաբերակցությունը:
Ինչ տեսակի պահեստավորում ունի Parquet՝ տողային թե սյունակային?
Պատմեք ռեպլիկացիայի կարգավորման խնդիրն մասին, որը դուք լուծել եք։
Ի՞նչ կլինի, եթե կիրառեք `s ** 2` ցանկին `s = [1, 2, 3]`։
Կա՞ն այլ մեխանիզմներ shuffle- ի կառավարումից բացի coalesce/repartition- ից։
Ինչն է քեզ գրավում travel ոլորտում: Միգուցե քեզ դուր է գալիս ինքնուրույն ճանապարհորդել, կամ travel-tech-ը ինչ-որ կերպ հետաքրքրել է քեզ?