Hoe gebruik je Python in je werk en waar voel je je zekerder: in Python of in SQL?
Data Engineer
Er zijn 101 objecten: 100 objecten van klasse 0 en 1 object van klasse 1. Het eerste model geeft alle objecten dezelfde score. Wat zijn zijn ROC AUC en de vorm van de ROC-curve?
Hoe test je een tijdreeks op stationariteit?
Stel dat een analist een SQL-query heeft geschreven. Identificeer inefficiënties in de query en stel voor hoe deze te vermijden. De query voegt twee tabellen samen: - feitentabel 'events' met sleutel 'event_id' - referentietabel verkeersbron met sleutel 'referer_str' Beide tabellen bevatten miljarden records. select * from (select distinct e.event_id, e.user_id, e.category_id, e.location_id, s.source_name, s.medium_name, s.campaign_name, row_number() over(partition by e.event_id, e.user_id, e.category_id, e.location_id, s.source_name, s.medium_name, s.campaign_name) as rnk from events e left join traffic_source s on e.referer_str = s.referer_str where e.event_date = current_date() - 1 group by 1,2,3,4,5,6,7) t where rnk = 1
Er is een niet-negatieve continue target en vier algoritmes: lineaire regressie, beslissingsboom, willekeurige bos en gradient boosting op bomen. Welke van hen kunnen negatieve voorspellingen geven?
Gegevens zijn geladen in een ReplacingMergeTree-tabel; wat gebeurt er tijdens het lezen als de merge nog niet heeft plaatsgevonden, en hoe krijg je de nieuwste versie van de records?
Wat is denormalisatie?
Is het mogelijk om deduplicatie en daaropvolgend data spill te combineren zonder aparte tabellen te gebruiken; en zo ja, hoe?
Wat is hypothese testen? Wat zijn Type I- en Type II-fouten en p-waarde?
Wat zijn indexstructuren en hoe werken ze?
Welke manieren ken je om de uitvoering van taken in PostgreSQL te versnellen?
Wat is een stationaire tijdreeks en waarom is stationariteit belangrijk voor klassieke modellen?
Wat is bagging en boosting, en hoe verschillen ze?
Wat zijn de kenmerken van het gebruik van JOIN bij het bouwen van datamarts in PostgreSQL/Greenplum in vergelijking met ClickHouse?
Ben je bekend met uplift-modellering? Wat weet je erover?
Hoe voorkom je dat de tabel groeit als de gegevensopslag beperkt is in tijd, bijvoorbeeld twee jaar?
Wat is ROC AUC?
Het is nodig om te controleren of er klanten met meerdere e-mails in de tabel staan. Zo ja, verwijder ze (laat alleen de laatste record op basis van create_date).
Wat is een watermark in Spark Structured Streaming?
Wat is normalisatie en wanneer wordt het toegepast?