Data Engineer
Greenplum-ში INSERT, UPDATE და DELETE-ის დროს რა ხდება ფიზიკურად; რატომ არ იხსნება დისკის ადგილი DELETE-ის შემდეგ და რა განსხვავებაა DELETE-სა და TRUNCATE-ს შორის?
როგორ აღწერდი კოდში იმას, რომ მნიშვნელობა მნიშვნელოვნად განსხვავდება ნორმალური (მოლოდინით) განაწილებიდან?
რატომ შეიძლება დაკარგოს მონაცემებმა? მიეცით რამდენიმე მიზეზი.
როგორ არის დაკავშირებული ფანჯრის ფუნქციის შიგნით სორტირება და შეკითხვის საბოლოო ORDER BY სორტირება?
რომელი Python ბიბლიოთეკებით მუშაობდით?
რა არის პარტიციონირება და დისტრიბუცია (sharding)?
dict1 = { (1, 2), [3, 4, 5] : 0 } var = 1, 2
გააზიარეთ საინტერესო დავალება კომპანიაში ბოლო 2,5 წლის განმავლობაში, მაგალითად, ClickHouse-თან დაკავშირებული.
მოყევ მაგალითი, როდესაც გამოიყენე ხელოვნური ინტელექტი რუტინული პროცესების ავტომატიზაციისთვის.
Airflow-ში depends_on_past პარამეტრი რა აკეთებს?
რა განსხვავებაა ACID და CAP თეორემას შორის?
შედარეთ ETL და ELT მიდგომები: რა განსხვავებაა და როდის გამოიყენება თითოეული?
როგორ მუშაობდნენ 1C-თან: მონაცემებს პირდაპირ მონაცემთა ბაზიდან იღებდნენ, თუ სხვა გზით, მაგალითად, ბუსით?
თქვენ ოდესმე შეხვედროდით ClickHouse `Too many parts` შეცდომას შეტანისას? როგორ გადაჭარით?
რა ტექნიკური ველები გამოიყენეს satellites, links და hubs Data Vault-ში?
საყურადღებოა #1 რა რაოდენობის ჩანაწერი დაბრუნდება, თუ ორი ცხრილი იდ ატრიბუტის მიხედვით შეერთება inner, left, right, full join-ით? t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:
S3-ში ცხრილის სახის შედეგებს პარექით ან სხვა გზით ინახავდით?
რამდენი დროის განმავლობაში მუშაობდით Spark-თან და რამდენად ღრმად ჩაეფლეთ მასში?
რატომ არის S3-ში "ფოლდერები"/პრეიფიქსები საჭირო, გარდა კომფორტისა?
PostgreSQL-ში რა ხდება SELECT * FROM [ცხრილი] შეკითხვის შესრულების შემდეგ?