Senior
/* Adatokat kell átvinni egy forrásból egy fogyasztóhoz. A forrás kis csomagokban (~tíz rekord) adja az adatokat, míg a fogyasztó hatékonyabban működik nagyobb csomagokkal (~ezer rekord). Egy valódi példa a Kafka típusú sorokból származó adatok átadása a Clickhouse adatbázisba. Forrás: - Szinte végtelen. - A forrás soha nem ad vissza több mint MaxItems rekordot egy Next hívásban. - Egy "munkamenet" (egy Pipe függvényhívás) során a forrás minden Next hívásnál új adatokat ad. - Azonban újraindítás után a forrás a korábbi "megerősített" pozícióból kezd, amit a cookie határoz meg. Ezért minden Next által visszaadott cookie érték, miután az adatokat a fogadóba mentettük, a Commit hívással kell megerősíteni, ugyanabban a sorrendben, ahogyan a Next visszaadta. Fogadó: - Nem képes egyszerre több mint MaxItems adatot feldolgozni. Alapszint: Implementálni kell a func Pipe(p Producer, c Consumer) error függvényt, ami adatokat olvas a forrásból, azokat MaxItems-nél nem nagyobb bufferbe gyűjti, és a fogadóba menti, és ezt követően megerősíti a haladást a forrásban. Különlegesség: A Next, Process és Commit metódusok hálózati hívásokhoz kötöttek, és elég hosszú ideig tarthatnak. A folyamat felgyorsítása érdekében párhuzamosítani kell az olvasási, írási és haladási megerősítési folyamatokat. Így, a Process vagy Commit hívás közben, az olvasás a forrásból és az új buffer kialakítása folytatódhat. */ const MaxItems = 9999 type Producer interface { // Next visszaad: // - egy csomag elemet az feldolgozásra // - egy cookie-t, amit a feldolgozás befejezése után kell megerősíteni // - egy hibát Next() (items []any, cookie int, err error) // Commit a feldolgozott adatcsomagot jelöli meg Commit(cookie int) error } type Consumer interface { Process(items []any) error } func Pipe(p Producer, c Consumer) error { // TODO }
sobes.tech MI
Válasz az MI-től
Для реализации функции Pipe с параллельной обработкой чтения, записи и подтверждения прогресса можно использовать каналы и горутины. Идея:
- Одна горутина читает данные из источника (Producer.Next), формируя батчи не более MaxItems.
- Вторая горутина обрабатывает батчи (Consumer.Process).
- Третья горутина подтверждает прогресс (Producer.Commit) строго в порядке получения cookie.
Для сохранения порядка подтверждения можно использовать очередь или канал с буфером, где cookie будут храниться в порядке поступления.
Пример реализации:
func Pipe(p Producer, c Consumer) error {
type batch struct {
items []any
cookie int
}
batches := make(chan batch, 10) // Канал для передачи батчей на обработку
commitCh := make(chan int, 10) // Канал для передачи cookie на подтверждение
errCh := make(chan error, 3) // Канал для ошибок
done := make(chan struct{}) // Канал для остановки
// Чтение данных
go func() {
defer close(batches)
for {
items, cookie, err := p.Next()
if err != nil {
errCh <- err
return
}
if len(items) == 0 {
// Источник пуст, можно завершать
return
}
// Формируем батчи не более MaxItems
for start := 0; start < len(items); start += MaxItems {
end := start + MaxItems
if end > len(items) {
end = len(items)
}
batches <- batch{items: items[start:end], cookie: cookie}
}
}
}()
// Обработка данных
go func() {
defer close(commitCh)
for b := range batches {
if err := c.Process(b.items); err != nil {
errCh <- err
return
}
commitCh <- b.cookie
}
}()
// Подтверждение
go func() {
for cookie := range commitCh {
if err := p.Commit(cookie); err != nil {
errCh <- err
return
}
}
close(done)
}()
select {
case err := <-errCh:
return err
case <-done:
return nil
}
}
В этом примере:
- Чтение и формирование батчей происходит в первой горутине.
- Обработка батчей — во второй.
- Подтверждение cookie — в третьей.
Каналы обеспечивают поток данных и порядок подтверждения. Ошибки передаются через errCh, что позволяет прервать работу при возникновении ошибки.
Такой подход позволяет параллельно читать, обрабатывать и подтверждать данные, повышая общую производительность.