Data Engineer
Ինչպիսի՞ն են XCom- ի օգտագործման առանձնահատկությունները Airflow-ում:
Աշխատե՞լ եք FTP-ի հետ ֆայլեր կամ տվյալներ ստանալու համար պորտալով:
Պատմեք ձեր տվյալների որակի հետ կապված մի քանի կարևոր գործերի մասին։
## մոդայի խնդիր # Անդամների ցանկ կա։ Գրեք ֆունկցիա, որը գտնում է այդ ցանկի մոդան։ # find_mode([1, 2, 3, 3, 4, 5]) #> 3
Ի՞նչ կվերադարձնի find_mode ֆունկցիան [1, 2, 3, 3, 4, 5] ցուցակի համար: Պատմիր քայլ առ քայլ։
Ի՞նչ է բաժանումը: Ի՞նչ է շարդինգը: Ի՞նչ է ռեպլիկացիան:
Ինչու եք հիմա աշխատանքային առաջարկները դիտարկում?
Որ հրամանը պետք է օգտագործել նախագծի հիմնական թղթապանակից՝ docs/ ենթամոդուլը թարմացնելու համար՝ հեռավոր պահոցից վերջին տարբերակին և այս փոփոխությունը պատրաստելու համար՝ կոմիտեի համար? git fetch docs/ && git merge docs/FETCH_HEAD git pull --recurse-submodules git submodule update --remote docs/ cd docs/ && git pull && cd .. && git commit -am "Թարմացում" git submodule update --init docs/
Ինչպես են կազմակերպվում DBT-ում մեկնարկները: Օգտագործու՞մ եք Airflow-ը։
Ինչպես են ներկայումս տվյալները մշակվում: Եթե դրանք տարբեր ձևաչափերում են, ինչպես են նորմալիզացվում և միավորվում մեկ ձևի մեջ:
Ի՞նչ ֆիզիկական ռազմավարություններ եք գիտակցում join-ի իրականացման համար։
Ինչպես ապահովել հիմնական բանալի գլոբալ յուրահատկությունը PostgreSQL-ում sharding-ի ժամանակ?
Ինչպես է աշխատում Nested Loop Join-ը և ինչ է նրա ալգորիթմական բարդությունը: Ինչ է բոլոր երեք ալգորիթմների բարդությունը?
Կանխատեսում կա՝ տրանզակցիոն անջատման մակարդակներ։ Ինչ գիտեք այդ մասին։
Ի՞նչ է դեկորատորը Python-ում։
Երբ պետք է օգտագործել B-ծառ և hash- ինդեքսները PostgreSQL-ում?
Ի՞նչ առանձնահատկություններ և տարբերություններ կան Set և List-ների միջև Python-ում: Բացի կատարողականությունից, ինչ այլ առանձնահատկություններ կան?
Ինչպես հայտնաբերել տվյալների խեղաթյուրվածությունը (data skew) Spark-ում?
Ի՞նչ էր տեղի ունենում, երբ ակտիվացվում էր տվյալների որակի սահմանափակումը՝ զգուշացում, անկում, վերագործարկում։
Ինդեքսը ինչ է: Ինչպե՞ս է տարբերվում կլաստերացված ինդեքսը ոչ կլաստերացվածից: