W naszym teście na 10 dokumentach Llama 3.3 70B hostowana w OVH AI Endpoints była najbliżej dotychczasowego modelu OpenAI, a gpt-oss-20b dała prawie te same wyniki przy koszcie około 17 razy niższym. Mistral Small najlepiej trafiał daty, ale najgorzej typy dokumentów, a model z trybem rozumowania odpadł, zanim cokolwiek policzyliśmy. Poniżej opisujemy, po co klient szukał modelu w UE, jak wyglądał test i czego nie da się z niego wyczytać, ile to kosztuje, co sprawdziliśmy w kwestii lokalizacji danych i jak przełączyliśmy system bez nowego wdrożenia.
Po co szukać modelu językowego hostowanego w UE?
Projekt klienta to system przetwarzania dokumentów w firmie produkcyjnej. Aplikacja czyta umowy, aneksy i pisma, a model językowy wyciąga z nich metadane: typ dokumentu, datę, strony umowy. Do tej pory robił to model OpenAI, więc treść dokumentów wychodziła poza Unię Europejską. To łamało wymagania klienta dotyczące danych, które miały zostać w UE.
Mieliśmy dwie drogi: model na serwerze GPU klienta albo model hostowany w UE z dostępem przez API. Projekt nie miał własnego serwera GPU, więc wybraliśmy drugą. OVH AI Endpoints udostępnia otwarte modele przez API zgodne z OpenAI, co oznacza, że w kodzie zmienia się adres, klucz i nazwa modelu, a nie cała integracja.
Chcesz przenieść AI z USA do UE? Porównamy modele na Twoich dokumentach, a nie na benchmarku, i przełączymy system na model hostowany w UE albo na Twoim serwerze. Opisz, co dziś robi model i jakie dane przez niego przechodzą. Lokalne modele AI →
Jak porównaliśmy Llama 3.3, gpt-oss i Mistral Small?
Wzięliśmy 10 prawdziwych dokumentów z produkcji i puściliśmy je przez to samo zadanie: zwróć metadane w formacie JSON. Punktem odniesienia był model OpenAI, który obsługiwał system w tamtym momencie. Dla każdego modelu liczyliśmy trzy rzeczy:
- czy typ dokumentu zgadza się z wynikiem modelu OpenAI,
- czy zgadza się data,
- czy cały wynik jest zgodny, czyli typ, data i pozostałe pola naraz.
Mierzyliśmy też średni czas odpowiedzi. Uczciwie: 10 dokumentów to mała próba. Różnica jednego dokumentu to 10 punktów procentowych, więc wynik 6/10 kontra 5/10 nie dowodzi, że jeden model jest lepszy od drugiego. Test dobrze nadaje się do odsiania modeli, które nie działają z istniejącym kodem, i do zgrubnego ustawienia kolejności. Nie zastępuje ewaluacji na kilkudziesięciu albo kilkuset dokumentach.
Drugie zastrzeżenie dotyczy samego punktu odniesienia. Zgodność liczyliśmy względem modelu OpenAI, a ten też się myli. Dokument „Porozumienie o rozwiązaniu umowy” model OpenAI oznaczył jako aneks, czyli błędnie, a modele w OVH zaklasyfikowały go inaczej. Licznik pokazał rozbieżność, choć błąd był po stronie wzorca. Realna zgodność merytoryczna jest więc wyższa, niż wynika z tabeli.
Który model wypadł najlepiej?
| Model | Typ zgodny | Data zgodna | Pełna zgodność | Średni czas | Cena (€/mln tokenów, wejście/wyjście) |
|---|---|---|---|---|---|
| Model OpenAI (punkt odniesienia) | 10/10 poprawnych odpowiedzi JSON | 2,1 s | dotychczasowy dostawca | ||
| Llama 3.3 70B Instruct | 8/10 | 8/10 | 6/10 | 5,8 s | 0,67 / 0,67 |
| gpt-oss-20b | 8/10 | 8/10 | 5/10 | 4,2 s | 0,04 / 0,15 |
| Mistral Small 24B | 6/10 | 9/10 | 5/10 | 6,8 s | taniej niż Llama |
Llama 3.3 70B najczęściej wskazywała te same strony umowy i te same daty co model OpenAI. Jest wersją Instruct, obsługuje wywoływanie funkcji i ma okno kontekstu 131 tys. tokenów, więc mieści długie umowy w jednym zapytaniu.
gpt-oss-20b dała 8/10 dla typów i dat, czyli tyle samo co Llama, i odpowiadała szybciej. Ma jedną słabość: jest mniej sprawdzona na polskich tekstach, a w małej próbie to nie wychodzi. Mistral Small trafił 9 dat na 10, najwięcej ze wszystkich, ale tylko 6 typów dokumentów i był najwolniejszy.
Żaden model z OVH nie dorównał szybkością modelowi OpenAI. Przy dokumentach przetwarzanych w tle różnica między 2 a 6 sekundami nie ma znaczenia. W czacie, gdzie użytkownik czeka na odpowiedź, już tak.
Dlaczego Qwen3.5 odpadł w teście?
Qwen3.5-9B to model z trybem rozumowania. Najpierw zapisuje tok myślenia w polu reasoning, a pole content zostaje puste do końca tego etapu. Kod klienta czytał tylko content, więc dostawał pustą odpowiedź albo przekroczenie czasu. Wywoływanie funkcji działało, ekstrakcja JSON, czyli to, do czego model był potrzebny, nie.
To samo dotyczy większych wariantów Qwen3.x z rozumowaniem. Wniosek dla każdego, kto podmienia model przez API zgodne z OpenAI: modelu oznaczonego jako reasoning nie wstawiaj w miejsce zwykłego bez zmiany kodu, który czyta odpowiedź. Bezpieczniej wybrać wersję Instruct.
Przy okazji wyszła jeszcze jedna różnica w parametrach. Nowsze modele OpenAI wymagają parametru max_completion_tokens zamiast max_tokens, a OVH przyjmuje oba. Przy przełączaniu w drugą stronę trzeba o tym pamiętać.
Ile kosztuje model LLM w OVH AI Endpoints?
Llama 3.3 70B kosztuje 0,67 € za milion tokenów, tyle samo na wejściu i wyjściu. gpt-oss-20b kosztuje 0,04 € za milion tokenów wejściowych i 0,15 € za milion wyjściowych. Przy ekstrakcji metadanych większość tokenów to wejście, czyli treść dokumentu, więc różnica wynosi około 17 razy na korzyść gpt-oss-20b. Mistral Small jest tańszy od Llamy, ale w tym zestawieniu nie dawał nic, czego nie dawały dwa pozostałe.
Darmowy poziom usługi ma limit 400 zapytań na minutę, co odczytaliśmy z nagłówków odpowiedzi API. Klient przetwarza około 200 stron dziennie, więc limit nie powinien przeszkadzać, ale przed przełączeniem produkcji zaplanowaliśmy osobny test zachowania przy błędach 429.
Czy dane w OVH AI Endpoints zostają w UE?
Nie poprzestaliśmy na deklaracji z cennika. Sprawdziliśmy, dokąd faktycznie trafia ruch: adres API rozwiązuje się na centrum danych OVH w Gravelines we Francji. Serwer aplikacji klienta stoi w Niemczech, więc cała trasa dokumentu przebiega w UE. To pomiar, a nie zapewnienie dostawcy.
Pozostałe kwestie opierają się na deklaracjach OVH:
- dane z zapytań nie są używane do trenowania ani ulepszania modeli,
- OVH nie przechowuje promptów, zapisuje tylko dane potrzebne do rozliczeń,
- usługa działa w europejskich centrach danych OVH, a platforma ma certyfikaty ISO 27001 i SOC.
Dwie rzeczy zostały do domknięcia po stronie prawnej. Na stronie OVH przy jednym z planów pojawia się dopisek o działaniu poza UE, więc przy zmianie planu trzeba ponownie sprawdzić, gdzie trafia ruch. Druga sprawa to umowa powierzenia przetwarzania danych z OVH, którą klient zawiera sam. Mimo to przełączenie i tak poprawiło sytuację: dokumenty przestały trafiać do USA.
Szerzej o tym, jak RODO i AI Act łączą się przy takich wdrożeniach, piszemy w tekście AI Act w praktyce.
Jak przełączyć model bez wdrażania nowej wersji?
System klienta trzyma konfigurację modelu w Redisie: dostawcę, klucz, adres API, nazwę modelu i osobno model do obrazów. Przełączenie na OVH polegało na podmianie tego wpisu. Nie było budowania obrazu ani restartu aplikacji, a powrót do poprzedniego dostawcy to przywrócenie starego wpisu.
Jeśli budujesz system na modelu językowym od zera, zostaw sobie taką furtkę. Modele i ceny zmieniają się co kilka miesięcy, a przepisanie integracji przy każdej zmianie kosztuje więcej niż jeden klucz w konfiguracji. Do obrazów OVH udostępnia Qwen2.5-VL-72B i ten model mamy przygotowany w tej samej konfiguracji, choć klient jeszcze nie włączył przetwarzania obrazów.
Który model wybrać do dokumentów po polsku?
Wybraliśmy Llama 3.3 70B i od 17 sierpnia 2026 r. system produkcyjny i środowisko lokalne korzystają z niej przez OVH. Za tym wyborem stała zgodność z dotychczasowymi wynikami i to, że model działa z istniejącym kodem bez zmian.
gpt-oss-20b zostaje opcją, gdy liczy się koszt, a większa próba potwierdzi jakość na polskich dokumentach. Przy kilkuset stronach dziennie różnica w rachunku jest niewielka, przy dziesiątkach tysięcy zaczyna mieć znaczenie. Jeśli dokumenty nie mogą opuścić firmy nawet do centrum danych w UE, zostają modele uruchomione lokalnie, które opisujemy w ofercie lokalnych modeli AI.
Zanim wybierzesz model, sprawdź go na własnych dokumentach. Pomożemy przygotować zestaw testowy, porównać modele hostowane w UE i lokalne oraz przełączyć system tak, żeby kolejna zmiana dostawcy była kwestią konfiguracji. Zobacz, jak wdrażamy AI z kontrolą nad danymi →
