Angenommen, ein Analyst hat eine SQL-Abfrage geschrieben.
Identifizieren Sie Ineffizienzen in der Abfrage und schlagen Sie vor, wie man sie vermeiden kann.
Die Abfrage verbindet zwei Tabellen:
- Faktentabelle 'events' mit Schlüssel 'event_id'
- Referenztabelle der Traffic-Quelle mit Schlüssel 'referer_str'
Beide Tabellen enthalten Milliarden von Datensätzen.
select *
from (select distinct
e.event_id,
e.user_id,
e.category_id,
e.location_id,
s.source_name,
s.medium_name,
s.campaign_name,
row_number() over(partition by e.event_id, e.user_id, e.category_id, e.location_id,
s.source_name, s.medium_name, s.campaign_name) as rnk
from events e
left join traffic_source s on e.referer_str = s.referer_str
where e.event_date = current_date() - 1
group by 1,2,3,4,5,6,7) t
where rnk = 1