Data Engineer
API-ს გარდა, რა სხვა მეთოდებს და პროტოკოლებს იყენებდით მონაცემთა წყაროებთან მუშაობისთვის?
გააზიარეთ თქვენი მონაცემების ხარისხის შესახებ გაგება — გაქვთ ამ სფეროში გამოცდილება?
რა აგენტები და მოდელები გამოიყენება თქვენს კორპორატიულ AI გადაწყვეტილებაში? დაწერს თუ არა ის კოდს თქვენი სახელით?
რატომ არის საჭირო cache და persist Spark-ში?
როგორ დაიწყეთ DAG-ები: cron, მონაცემთა ნაკადები, ტრიგერები ან დამოკიდებულებები?
clickhouse_driver-ი იმპორტი from airflow.hooks.base import * def get_clickhouse_client(): conn = BaseHook.get_connection("clickhouse_default") return clickhouse_driver.Client( host=conn.host, port=conn.port, user=conn.login, password=conn.password, database=conn.schema )
რისთვის გამოიყენებოდა Spark JDBC-ის პარამეტრები წაკითხვის პარალელიზაციისთვის?
რა არის CROSS JOIN და რა არის მისი გამოყენების შედეგი?
რომელი მიმართულებით იქნებოდა საინტერესო განვითარდეს: витრინები, განვითარება, ანალიტიკა, იქნებ AI?
-- t1 -- num --------- -- 1 -- 2 2 null null 4 -- t2 -- num --------- -- [ტელეფონი] null null 5 არჩევა a.num როგორც a_num, b.num როგორც b_num t1-დან a მარცხენა JOIN t2 b-ზე a.num = b.num;
რა გაურკვეველი პრობლემები შეიძლება წარმოიშვას დიდი სვეტების ჩატვირთვისას (გარდა შესრულების)?
ფანჯრის ფუნქცია SUM() OVER (PARTITION BY user_id) — ერთ შემთხვევაში ვამატებთ ORDER BY-ის ყიდვის თარიღს, მეორეში — არა. რა განსხვავებაა?
რატომ გჭირდებოდათ ზოგადად Data Vault?
Parquet-ის შენახვის ტიპი რა არის: ხაზი თუ სვეტი?
გთხოვთ, მოგვიყევით რეპლიკაციის კონფიგურაციის ამოცანაზე, რომელსაც თქვენ გადაჭარით.
CREATE TABLE datamarts.daily_revenue_per_country ON CLUSTER cluster_4x2 ( event_date Date, country String, total_revenue Float64 ) ENGINE = MergeTree() PARTITION BY toYYYYMM(event_date) ORDER BY (event_date);
CI/CD პროცესები, მონაცემთა ბაზაში ცვლილებები, ვერსიების მართვა და სქემის მიგრაციები (სქემის ევოლუცია) შესახებ მომიყევი.
რა გიბიძგებს მოგზაურობის სფეროში? შესაძლოა, თავად გიყვარს მოგზაურობა, ან travel-tech რამენაირად გატაცებს?
შეგიძლიათ მითხრათ თქვენი გამოცდილების შესახებ განაწილებული მონაცემთა ბაზებთან (Greenplum, ClickHouse)?
შეთავაზეთ რეგულარული ინკრემენტული დატვირთვის გადაწყვეტა დიდი ცხრილისთვის მოქნილი (ცვლილებადი) განახლების სიხშირით Postgres-დან Data Lake-ში.