OCR i automatyzacja katalogów PDF - złożone dane produktowe w Excelu jednym kliknięciem
- OCR i ekstrakcja danych z katalogów PDF
- Normalizacja, weryfikacja i ręczne korekty
- Eksport do XLSX i integracja przez API
1Problem
Drugi przykład to firma z branży okulistycznej działająca na rynku sprzętu i produktów optycznych, która współpracuje z szeroką bazą dostawców. Jej pracownicy regularnie otrzymywali obszerne katalogi produktowe w formacie PDF od różnych producentów - setki stron tabel, specyfikacji i cen, z których dane musieli następnie wprowadzać do wewnętrznych arkuszy Excel. Proces ten przebiegał manualnie: pracownik przekopywał się przez PDF, kopiował lub przepisywał kluczowe informacje (np. nazwy produktów, kody, parametry techniczne, ceny) do Excela.
Było to zajęcie powtarzalne i czasochłonne. Sytuację komplikował fakt, że każdy dostawca stosował inny układ stron, tabel i opisów produktów. Brak wspólnego formatu utrudniał aktualizowanie informacji w systemie i zwiększał zakres ręcznej weryfikacji. Firma potrzebowała rozwiązania, które odczyta z obsługiwanych katalogów zdefiniowane pola, ujednolici dane i przygotuje je do dalszej pracy w Excelu.

2Rozwiązanie
Zbudowaliśmy system łączący OCR z analizą układu dokumentu. Narzędzie rozpoznaje tekst i wskazane obszary katalogu, a następnie przypisuje nazwy produktów, kody, parametry i ceny do wspólnej struktury. Reguły normalizacji ujednolicają między innymi różne nazwy kolumn i formaty wartości.
Wyodrębnione dane trafiają do aplikacji webowej, w której pracownik może sprawdzić wynik, poprawić wartość lub uzupełnić brakujące pole. Po akceptacji zestawienie można pobrać jako plik XLSX albo przekazać dalej przez API. Taki model łączy automatyczną ekstrakcję z kontrolą człowieka i pozwala obsłużyć wyjątki bez ukrywania niepewności wyniku. Dokumenty są przetwarzane w środowisku uzgodnionym z klientem.
3Rezultaty
Rezultatem jest powtarzalny przepływ od pliku PDF do uporządkowanego arkusza. System wykonuje pierwszą ekstrakcję i normalizację, a pracownik koncentruje się na sprawdzeniu pól oznaczonych do weryfikacji oraz na przypadkach nietypowych.
Wspólna struktura danych ułatwia import produktów i porównywanie ofert różnych dostawców. Nie opisujemy rozwiązania jako bezbłędnego ani uniwersalnego dla każdego PDF: skuteczność zależy od jakości dokumentu i układu informacji, dlatego interfejs zachowuje etap kontroli przed eksportem.

4Wiarygodność i źródła
Dokumenty handlowe klienta oraz wyniki ekstrakcji nie są publiczne. Case study opisuje architekturę i funkcje rozwiązania bez ujawniania katalogów źródłowych.
Jak opisaliśmy rezultaty
Nie podajemy uniwersalnej skuteczności ani czasu przetwarzania. Wynik zależy od jakości PDF, układu strony i zakresu pól. Wiarygodny benchmark wymagałby oznaczonego zestawu katalogów, poprawności liczonej osobno dla każdego pola oraz udziału ręcznych korekt.
Źródła i kontekst
Poniższe materiały służą do weryfikacji opisu lub wyjaśniają kontekst technologiczny. Nie są pomiarem rezultatów tego konkretnego wdrożenia.