ამ სქემაში Trino მონაცემების დამუშავებაზეა პასუხისმგებელი — როგორ აძლევს ტექნოლოგიების ფენა საცავსა და გამოთვლებს განცალკევებას?
Data Engineer
Greenplum-ში ACID დაცულია?
რას იწყებს ClickHouse-ში ჩანაწერების წაშლის ან შეცვლის დროს?
რა განსხვავებაა CTE-სა და ქვედაპირზე?
როგორ დავყოთ მოთხოვნა ეტაპებად? ამისთვის რა გავაკეთოთ?
შეგიძლიათ იცოდეთ Rust-ით დაწერილი მრავალთრედული, ძალიან სწრაფი ბიბლიოთეკა, რომელიც შეიძლება შეცვალოს Pandas-ი Data Science და Big Data-ისთვის?
სამუშაოებს შორის, DAG-ების შორის დამოკიდებულებებთან — იყენებდით სენსორებს, რათა ისინი ერთის შემდეგ მეორე გამოიძახათ?
რა ტექნოლოგიებს იყენებდით მონაცემების ჩასატვირთად Parquet-ში და რა მექანიზმები გამოიყენებოდა მონაცემების მიღებისა და ჩატვირთვისთვის?
როგორ დაწერე Airflow DAG და სამუშაოები — ხელით თუ შაბლონებით?
თქვით მონაცემები Spark-დან S3-ზე Parquet ფორმატში და შემდეგ Parquet-დან Greenplum-ზე — როგორ მიმდინარეობს ჩატვირთვის პროცესი?
როგორ ხერხდებოდა ჩვეულებრივ მონაცემთა ბაზის სქემის შექმნა — პირდაპირ ბაზაში ხელით ან სქრიპტებს სადმე ინახავდით, ან საერთოდ იყენებდით Liquibase-ს, რა იყო პროცესი?
გიტთან მუშაობდი? რა ინახავდი გიტში?
სტრიმინგის დროს, Iceberg მუშაობდა, გაგიგია? ეს ფაილების ნაგავდაცვაა.
როგორ ჩაიტანეს მონაცემები გარე ცხრილიდან სამიზნე ცხრილებში?
ეს რეალურ დროშია, როგორ განვახორციელოთ ეს Kafka და ClickHouse Spark შორის?
თუ CTE-ს მხოლოდ ერთხელ იყენებთ სავალდებულო კითხვაში, აქვს თუ არა ამის გამოყენების აზრი?
თქვენ უნდა მუშაობოდით პირდაპირ Spark-თან? რა არის მისი მინუსი?
ჩვენ გვჭირდება პაიპლაინი — მექანიზმი, რომელიც საშუალებას მოგცემთ ძალიან სწრაფად შექმნათ ნაკადები კონტრაქტებისა და პარამეტრების მიწოდებით. როგორ განახორციელებდი ამას მაღალ დონეზე?
ჩვენ JSON-ს დავალაგებთ — ვინ გააკეთებს JSON-ის ანალიზს? ჩემი ცოდნით, ClickHouse-ში ფუნქციები არ არის.
Iceberg — ეს არის ძრავა, რომელიც საშუალებას აძლევს S3-ს გახდეს მონაცემთა ბაზა, ის אפילו აკმაყოფილებს ACID-ს. რა არის მისი ნაკლი?