Data Engineer
Kāpēc meklējat jaunu darbu un ko vēlētos darīt nākotnē?
CREATE TABLE datamarts.daily_revenue_per_country ON CLUSTER cluster_4x2 ( event_date Date, country String, total_revenue Float64 ) ENGINE = MergeTree() PARTITION BY toYYYYMM(event_date) ORDER BY (event_date);
Kāpēc bool([""]) atgriež True?
Pastāstiet man par savu pieredzi ar izplatītajām datu bāzēm (Greenplum, ClickHouse)?
Kāpēc tu tagad meklē jaunu darbu, vēlies mainīt darbu?
Un ja mums ir nepieciešami visi klienti, pat ja viņiem šajā datumā nebija darījumu, kā to parādīt?
Kuras papildus Data Vault elementi, izņemot hub, link un satellite, tika izmantoti: piemēram, same-as links vai transactional links?
Vai esat strādājis ar partijām vai straumēšanu?
Vai S3 bija vienīgā galvenā glabātuve vai izmantojāt vairākas?
Kāds ir diagnostikas algoritms un ko darīt, ja pieprasījums joprojām ir lēns pēc vairāku indeksu pievienošanas?
Kā organizēt datu ielādi ClickHouse lielā PostgreSQL tabulā, kur pastāvīgi ienāk jauni ieraksti ar monotoniski pieaugošu primāro atslēgu?
Kas ir normalizācija un ER modelis, kam tie ir nepieciešami?
Papildus API, ar kādiem citiem veidiem un protokoliem jūs strādājāt ar datu avotiem?
print(len(' '.join(map(str, [0, 1]))))
Kā pareizi noteikt sadales lauku Greenplum? Kas notiek Motion laikā?
Ja executor'ī ir 10 kodoli, cik uzdevumi tiks paralēli vienlaikus?
Vai jums ir pieredze darbā ar Gin tīmekļa ietvaru? Pastāstiet mums sīkāk, kādus uzdevumus risinājāt ar tā palīdzību.
Kādam mērķim ir cache un persist Spark?
Kādus jautājumus man?
Kādā virzienā būtu interesanti attīstīties: vitrīnās, izstrādē, analīzē, varbūt AI?