Logo Aixir – strona główna
Projekt 2

OCR i automatyzacja katalogów PDF - złożone dane produktowe w Excelu jednym kliknięciem

  • OCR i ekstrakcja danych z katalogów PDF
  • Normalizacja, weryfikacja i ręczne korekty
  • Eksport do XLSX i integracja przez API

1Problem

Drugi przykład to firma z branży okulistycznej działająca na rynku sprzętu i produktów optycznych, która współpracuje z szeroką bazą dostawców. Jej pracownicy regularnie otrzymywali obszerne katalogi produktowe w formacie PDF od różnych producentów - setki stron tabel, specyfikacji i cen, z których dane musieli następnie wprowadzać do wewnętrznych arkuszy Excel. Proces ten przebiegał manualnie: pracownik przekopywał się przez PDF, kopiował lub przepisywał kluczowe informacje (np. nazwy produktów, kody, parametry techniczne, ceny) do Excela.

Było to zajęcie powtarzalne i czasochłonne. Sytuację komplikował fakt, że każdy dostawca stosował inny układ stron, tabel i opisów produktów. Brak wspólnego formatu utrudniał aktualizowanie informacji w systemie i zwiększał zakres ręcznej weryfikacji. Firma potrzebowała rozwiązania, które odczyta z obsługiwanych katalogów zdefiniowane pola, ujednolici dane i przygotuje je do dalszej pracy w Excelu.

Papierowe katalogi oprawek okularowych przygotowane do automatycznego odczytu danych

2Rozwiązanie

Zbudowaliśmy system łączący OCR z analizą układu dokumentu. Narzędzie rozpoznaje tekst i wskazane obszary katalogu, a następnie przypisuje nazwy produktów, kody, parametry i ceny do wspólnej struktury. Reguły normalizacji ujednolicają między innymi różne nazwy kolumn i formaty wartości.

Wyodrębnione dane trafiają do aplikacji webowej, w której pracownik może sprawdzić wynik, poprawić wartość lub uzupełnić brakujące pole. Po akceptacji zestawienie można pobrać jako plik XLSX albo przekazać dalej przez API. Taki model łączy automatyczną ekstrakcję z kontrolą człowieka i pozwala obsłużyć wyjątki bez ukrywania niepewności wyniku. Dokumenty są przetwarzane w środowisku uzgodnionym z klientem.

3Rezultaty

Rezultatem jest powtarzalny przepływ od pliku PDF do uporządkowanego arkusza. System wykonuje pierwszą ekstrakcję i normalizację, a pracownik koncentruje się na sprawdzeniu pól oznaczonych do weryfikacji oraz na przypadkach nietypowych.

Wspólna struktura danych ułatwia import produktów i porównywanie ofert różnych dostawców. Nie opisujemy rozwiązania jako bezbłędnego ani uniwersalnego dla każdego PDF: skuteczność zależy od jakości dokumentu i układu informacji, dlatego interfejs zachowuje etap kontroli przed eksportem.

Formularz aplikacji OCR do skanowania katalogów produktowych na tablecie

4Wiarygodność i źródła

Dokumenty handlowe klienta oraz wyniki ekstrakcji nie są publiczne. Case study opisuje architekturę i funkcje rozwiązania bez ujawniania katalogów źródłowych.

Jak opisaliśmy rezultaty

Nie podajemy uniwersalnej skuteczności ani czasu przetwarzania. Wynik zależy od jakości PDF, układu strony i zakresu pól. Wiarygodny benchmark wymagałby oznaczonego zestawu katalogów, poprawności liczonej osobno dla każdego pola oraz udziału ręcznych korekt.

Wróć do realizacji

Masz pytania?

Porozmawiajmy! Skontaktuj się z nami i sprawdź, jak inteligentna automatyzacja może pomóc również Twojemu biznesowi - bez zbędnego ryzyka i bez zobowiązań.

Skontaktuj się