Dokumenty zawierają dane pacjentów, receptury albo tajemnice firmy i nie mogą trafić do publicznego ChatGPT.
Dział prawny wymaga, żeby dane nie opuszczały Unii Europejskiej albo firmowego serwera.
Połowa dokumentacji to skany i formularze wypełniane ręcznie. Zwykły OCR sobie z nimi nie radzi.
Wiedza jest rozproszona w tysiącach PDF-ów i nikt nie potrafi szybko znaleźć odpowiedzi.
Kontrola jakości ręcznie przegląda setki stron i szuka tych samych błędów w kółko.
Nie wiesz, który model wybrać, bo rankingi w internecie nie mówią nic o Twoich dokumentach.
Asystent odpowiada na pytania na podstawie Twoich dokumentów (RAG) i podaje, skąd wziął odpowiedź. Działa na serwerze w firmie albo w UE.
Odczyt skanów, tabel i formularzy, także polskiego pisma ręcznego, zaznaczeń i skreśleń. Tam, gdzie gotowe modele nie wystarczają, douczamy je na Twoich danych.
Nazwy, daty, numery serii, dawki i kontrahenci trafiają z dokumentu do bazy albo systemu, zamiast być przepisywane ręcznie.
Sprawdzanie kompletności i zgodności. Twarde reguły piszemy jako kod, a model językowy zajmuje się tym, czego regułą opisać się nie da.
Rozpoznawanie mowy, tłumaczenie i drugi model, który sprawdza, czy w tłumaczeniu nic nie zginęło.
Wyszukiwarka, która rozumie sens pytania, a nie tylko słowa kluczowe. Łączy wyszukiwanie pełnotekstowe z wektorowym.
Bez nazw klientów, bo to ich dane. Przy każdym projekcie piszemy uczciwie, na jakim jest etapie.
Wyszukiwanie, czat i agent na dokumentach firmy. OCR skanów, rozpoznawanie nazw po polsku, odczyt zaznaczeń na formularzach. Model wybraliśmy testem na prawdziwych dokumentach: Llama 3.3 70B hostowana w UE, pierwszy token po 0,25 s.
Odczyt polskiego pisma ręcznego w dokumentacji serii produkcyjnej (GMP) i sprawdzanie jej regułami. Własne douczenie modelu OCR i Qwen na vLLM na serwerze z GPU. Dziś kontrola jakości poświęca na 100 stron około 6 godzin.
Rozpoznawanie mowy, tłumaczenie i drugi model, który weryfikuje tłumaczenie. Zachował 95,8% kluczowych informacji przy opóźnieniu około 1,1 s i wyłapał oba celowo wprowadzone błędy, w tym złą dawkę leku.
| Co mierzyliśmy | Wynik |
|---|---|
| Pismo ręczne, poprawnie odczytane pola | 23/44 → 32/44 |
| Druk, poprawnie odczytane pola | 37/42 → 40/42 |
| Dokładne dopasowanie po douczeniu (545 próbek) | 66,4% zamiast 28,8% |
| Rozpoznanie struktury strony | 92% pól, ok. 10 s na stronę |
| Zaznaczenia na formularzach | ok. 99% |
Wyniki na próbce dokumentów klienta, przed i po douczeniu modeli OCR.
Nie jesteśmy przywiązani do jednego dostawcy. Model dobieramy do zadania, sprzętu i wymagań dotyczących danych.
Polskie modele, takie jak Bielik i PLLuM, trenowano z naciskiem na język polski. Llama i Qwen mają za sobą największą społeczność i narzędzia. Który wypadnie najlepiej u Ciebie, pokazuje dopiero test na Twoich dokumentach. W jednym z projektów porównaliśmy trzy modele na tych samych dziesięciu dokumentach i różnice były wyraźne.
Modele uruchamiamy przez vLLM albo Ollamę, na Twoim serwerze z kartą graficzną albo w hostingu GPU w UE. Wokół modelu budujemy resztę systemu: wyszukiwarkę, bazę dokumentów, panel i integracje. Tak jak przy każdej aplikacji webowej.
Dostajemy kilkadziesiąt prawdziwych dokumentów i ustalamy, co system ma z nimi robić i jak zmierzymy, czy działa.
Kilka modeli dostaje te same zadania. Wybieramy ten, który wypada najlepiej na Twoich danych, a nie w rankingu.
Działająca wersja na wybranym procesie. Mierzymy wyniki i pokazujemy, gdzie system się myli.
Na Twoim serwerze albo w hostingu w UE. Integracja z systemami, konta i uprawnienia.
Monitorujemy jakość odpowiedzi, douczamy modele na nowych przykładach i podmieniamy je, gdy pojawi się lepszy.