Tekst, tabele i pola z dokumentów drukowanych. Każdy odczyt ma ramkę na stronie, więc widać, skąd pochodzi wartość.
Wycinki pisma ręcznego sprawdza dodatkowo model rozpoznający obraz. Przy trudnych formularzach douczamy model OCR na Twoich dokumentach.
Zakreślone TAK/NIE, krzyżyki i kółka odczytujemy klasycznym przetwarzaniem obrazu, bo tu modele AI zawodzą (wyniki niżej).
Czy wszystkie pola są wypełnione, czy są podpisy, czy sumy się zgadzają. Dokument dostaje listę uwag z zaznaczeniem miejsc na stronie.
OCR i modele działają lokalnie albo w hostingu w UE. Dokumenty nie trafiają do zewnętrznych usług AI.
Odczytane dokumenty trafiają do wyszukiwarki i czatu, w którym można zapytać o treść całego archiwum.
Formularz produkcyjny, 22 kratki: 14 zakreślonych długopisem i 8 pustych. Puste kratki to kontrola negatywna.
| Metoda | Wynik |
|---|---|
| Klasyczne przetwarzanie obrazu (OpenCV) | 22 / 22 poprawnie |
| Model OCR Nanonets (4B) | 11 / 22 |
| Llama 3.2 Vision (11B) | 14 / 22: zaznaczała TAK w każdej kratce, także pustej |
Bez pustych kratek model vision miałby 14/14 i wyglądałby na bezbłędny. Dlatego każdy test robimy z kontrolą negatywną.
Douczony model OCR i Qwen na vLLM na serwerze klienta. Poprawnie odczytane pola pisma ręcznego wzrosły z 23 do 32 na 44.
OCR skanów i formularzy, wyszukiwanie i czat na dokumentach firmy. Model wybrany testem na prawdziwych dokumentach.
Bierzemy kilkadziesiąt prawdziwych dokumentów, także tych najgorszych: krzywe skany, pismo ręczne, pieczątki.
Porównujemy kilka silników OCR i modeli na Twojej próbce, z kontrolą negatywną. Wybieramy po wynikach, nie po opisie.
Stawiamy OCR na serwerze, łączymy z Twoim systemem i budujemy podgląd z ramkami odczytu.
Na stałym zestawie testowym mierzymy, ile pól odczytano poprawnie. Każda zmiana modelu musi ten wynik poprawić.
