Data Engineer
გააზიარეთ თქვენი ამბავი: გამოცდილება, დავალებები, ფუნქციები ან მიღწევები, რომლებითაც გსურთ იამაყოთ.
გაქვს გამოცდილება FastAPI-თან?
რამდენი დროის განმავლობაში მუშაობდით Spark-თან და რამდენად ღრმად ჩაეფლეთ მასში?
dict1 = { (1, 2), [3, 4, 5] : 0 } var = 1, 2
გააზიარეთ საინტერესო დავალება კომპანიაში ბოლო 2,5 წლის განმავლობაში, მაგალითად, ClickHouse-თან დაკავშირებული.
რის დროს ლექსიკონის ძიება შეიძლება გაუარესდეს ყველაზე უარეს შემთხვევამდე?
როგორ გადაჭრიდით ოპტიმიზაციის პრობლემებს, როდესაც სერვისი დიდხანს მუშაობს და სრულ სკანირებას ახორციელებს? როგორ მი 접근ებოდით ასეთ ახალ ამოცანას?
როგორ დავამატოთ მომხმარებლისთვის მიმდინარე და ორი წინამორბედი დღის შეკვეთების ჯამის მოძრავი საშუალო?
def extract_from_s3(**kwargs): df = pd.read_csv("s3://my-bucket/data/transactions_{}.csv".format(datetime.now().strftime("%Y-%m-%d"))) kwargs["ti"].xcom_push(key="df", value=df.to_dict()) def load_to_raw_table(**kwargs): df = pd.DataFrame(kwargs["ti"].xcom_pull(task_ids="extract", key="df")) rows = [tuple(r) for r in df[["transaction_id", "user_id", "amount", "created_at"]].to_numpy()] CLICKHOUSE_CLIENT.execute( "INSERT INTO raw.transactions (transaction_id, user_id, amount, created_at) VALUES", rows ) def build_aggregate_view(): query = """ INSERT INTO datamarts.daily_revenue_per_country SELECT toDate(r.created_at) as event_date, u.country, sum(r.amount) as total_revenue FROM raw.transactions r LEFT JOIN core.userMetadata u ON r.user_id = u.UserId WHERE toDate(r.created_at) = '{}' GROUP BY event_date, u.country """.format(datetime.now().strftime("%Y-%m-%d")) CLICKHOUSE_CLIENT.execute(query) transactions_sensor = S3KeySensor( task_id="transactions_sensor", bucket_key="data/transactions_{}.csv".format(datetime.now().strftime("%Y-%m-%d")), bucket_name="my-bucket", aws_conn_id="aws_default", timeout=600, poke_interval=30, mode="poke" ) extract = PythonOperator( task_id="extract", python_callable=extract_from_s3, provide_context=True ) load = PythonOperator( task_id="load", python_callable=load_to_raw_table, provide_context=True ) aggregate = PythonOperator( task_id="aggregate", python_callable=build_aggregate_view ) transactions_sensor >> extract >> load >> aggregate
Airflow-ში depends_on_past პარამეტრი რა აკეთებს?
რატომ გჭირდებოდათ ზოგადად Data Vault?
გთხოვთ, მოგვიყევით რეპლიკაციის კონფიგურაციის ამოცანაზე, რომელსაც თქვენ გადაჭარით.
ჩაწერილობების ჰეშების შედარების მეთოდი გამოიყენებოდა წყაროს და სამიზნე სარეგისტრაციოს შორის განსხვავების გამოთვლისთვის?
რა ხდებოდა, როდესაც მონაცემების ხარისხის შეზღუდვა აქტიურდებოდა: გაფრთხილება, ჩამოვარდნა, გადატვირთვა?
შედარეთ ETL და ELT მიდგომები: რა განსხვავებაა და როდის გამოიყენება თითოეული?
როგორ მუშაობდნენ 1C-თან: მონაცემებს პირდაპირ მონაცემთა ბაზიდან იღებდნენ, თუ სხვა გზით, მაგალითად, ბუსით?
სად მონაცემთა ბაზებთან მუშაობდით? როგორ მუშაობს MongoDB და როგორ მასშტაბირდება?
როგორ განსაზღვრეთ, რომ ჩანაწერი უკვე არსებობს და მისი ხელახლა ჩაწერა საჭირო არ არის?
NULL plus 5 — რამდენი იქნება?
Spark-ში ერთდროულად შესაძლებელია ერთ Parquet ფაილიდან მონაცემების წაკითხვა, თუ მხოლოდ ერთი ბირთვით ერთ დავალებაში?