---
title: "LLM w UE: Llama 3.3, gpt-oss i Mistral w OVH | ASAPDevs"
description: "Porównaliśmy Llama 3.3 70B, gpt-oss-20b i Mistral Small w OVH AI Endpoints na 10 dokumentach: zgodność, czas, cena za token i lokalizacja danych w UE."
url: https://asapdevs.it/blog/llm-w-ue-porownanie-llama-gpt-oss-mistral
last_updated: 2026-10-05
---

# LLM hostowany w UE: Llama 3.3 70B, gpt-oss-20b i Mistral Small w OVH AI Endpoints

Test na 10 prawdziwych dokumentach: który model hostowany we Francji najbliżej odtwarza wyniki modelu OpenAI, ile kosztuje i dlaczego model z rozumowaniem zwracał pustą odpowiedź.

**W naszym teście na 10 dokumentach Llama 3.3 70B hostowana w OVH AI Endpoints była najbliżej dotychczasowego modelu OpenAI, a gpt-oss-20b dała prawie te same wyniki przy koszcie około 17 razy niższym.** Mistral Small najlepiej trafiał daty, ale najgorzej typy dokumentów, a model z trybem rozumowania odpadł, zanim cokolwiek policzyliśmy. Poniżej opisujemy, po co klient szukał modelu w UE, jak wyglądał test i czego nie da się z niego wyczytać, ile to kosztuje, co sprawdziliśmy w kwestii lokalizacji danych i jak przełączyliśmy system bez nowego wdrożenia.

## Po co szukać modelu językowego hostowanego w UE?

Projekt klienta to system przetwarzania dokumentów w firmie produkcyjnej. Aplikacja czyta umowy, aneksy i pisma, a model językowy wyciąga z nich metadane: typ dokumentu, datę, strony umowy. Do tej pory robił to model OpenAI, więc treść dokumentów wychodziła poza Unię Europejską. To łamało wymagania klienta dotyczące danych, które miały zostać w UE.

Mieliśmy dwie drogi: model na serwerze GPU klienta albo model hostowany w UE z dostępem przez API. Projekt nie miał własnego serwera GPU, więc wybraliśmy drugą. OVH AI Endpoints udostępnia otwarte modele przez API zgodne z OpenAI, co oznacza, że w kodzie zmienia się adres, klucz i nazwa modelu, a nie cała integracja.

**Chcesz przenieść AI z USA do UE?** Porównamy modele na Twoich dokumentach, a nie na benchmarku, i przełączymy system na model hostowany w UE albo na Twoim serwerze. Opisz, co dziś robi model i jakie dane przez niego przechodzą. [Lokalne modele AI →](https://asapdevs.it/offers/lokalne-modele-ai)

## Jak porównaliśmy Llama 3.3, gpt-oss i Mistral Small?

Wzięliśmy 10 prawdziwych dokumentów z produkcji i puściliśmy je przez to samo zadanie: zwróć metadane w formacie JSON. Punktem odniesienia był model OpenAI, który obsługiwał system w tamtym momencie. Dla każdego modelu liczyliśmy trzy rzeczy:

-   czy typ dokumentu zgadza się z wynikiem modelu OpenAI,
-   czy zgadza się data,
-   czy cały wynik jest zgodny, czyli typ, data i pozostałe pola naraz.

Mierzyliśmy też średni czas odpowiedzi. Uczciwie: 10 dokumentów to mała próba. Różnica jednego dokumentu to 10 punktów procentowych, więc wynik 6/10 kontra 5/10 nie dowodzi, że jeden model jest lepszy od drugiego. Test dobrze nadaje się do odsiania modeli, które nie działają z istniejącym kodem, i do zgrubnego ustawienia kolejności. Nie zastępuje ewaluacji na kilkudziesięciu albo kilkuset dokumentach.

Drugie zastrzeżenie dotyczy samego punktu odniesienia. Zgodność liczyliśmy względem modelu OpenAI, a ten też się myli. Dokument „Porozumienie o rozwiązaniu umowy” model OpenAI oznaczył jako aneks, czyli błędnie, a modele w OVH zaklasyfikowały go inaczej. Licznik pokazał rozbieżność, choć błąd był po stronie wzorca. Realna zgodność merytoryczna jest więc wyższa, niż wynika z tabeli.

## Który model wypadł najlepiej?

| Model | Typ zgodny | Data zgodna | Pełna zgodność | Średni czas | Cena (€/mln tokenów, wejście/wyjście) |
| --- | --- | --- | --- | --- | --- |
| Model OpenAI (punkt odniesienia) | 10/10 poprawnych odpowiedzi JSON | 2,1 s | dotychczasowy dostawca |
| Llama 3.3 70B Instruct | 8/10 | 8/10 | 6/10 | 5,8 s | 0,67 / 0,67 |
| gpt-oss-20b | 8/10 | 8/10 | 5/10 | 4,2 s | 0,04 / 0,15 |
| Mistral Small 24B | 6/10 | 9/10 | 5/10 | 6,8 s | taniej niż Llama |

Llama 3.3 70B najczęściej wskazywała te same strony umowy i te same daty co model OpenAI. Jest wersją Instruct, obsługuje wywoływanie funkcji i ma okno kontekstu 131 tys. tokenów, więc mieści długie umowy w jednym zapytaniu.

gpt-oss-20b dała 8/10 dla typów i dat, czyli tyle samo co Llama, i odpowiadała szybciej. Ma jedną słabość: jest mniej sprawdzona na polskich tekstach, a w małej próbie to nie wychodzi. Mistral Small trafił 9 dat na 10, najwięcej ze wszystkich, ale tylko 6 typów dokumentów i był najwolniejszy.

Żaden model z OVH nie dorównał szybkością modelowi OpenAI. Przy dokumentach przetwarzanych w tle różnica między 2 a 6 sekundami nie ma znaczenia. W czacie, gdzie użytkownik czeka na odpowiedź, już tak.

## Dlaczego Qwen3.5 odpadł w teście?

Qwen3.5-9B to model z trybem rozumowania. Najpierw zapisuje tok myślenia w polu `reasoning`, a pole `content` zostaje puste do końca tego etapu. Kod klienta czytał tylko `content`, więc dostawał pustą odpowiedź albo przekroczenie czasu. Wywoływanie funkcji działało, ekstrakcja JSON, czyli to, do czego model był potrzebny, nie.

To samo dotyczy większych wariantów Qwen3.x z rozumowaniem. Wniosek dla każdego, kto podmienia model przez API zgodne z OpenAI: modelu oznaczonego jako reasoning nie wstawiaj w miejsce zwykłego bez zmiany kodu, który czyta odpowiedź. Bezpieczniej wybrać wersję Instruct.

Przy okazji wyszła jeszcze jedna różnica w parametrach. Nowsze modele OpenAI wymagają parametru `max_completion_tokens` zamiast `max_tokens`, a OVH przyjmuje oba. Przy przełączaniu w drugą stronę trzeba o tym pamiętać.

## Ile kosztuje model LLM w OVH AI Endpoints?

Llama 3.3 70B kosztuje 0,67 € za milion tokenów, tyle samo na wejściu i wyjściu. gpt-oss-20b kosztuje 0,04 € za milion tokenów wejściowych i 0,15 € za milion wyjściowych. Przy ekstrakcji metadanych większość tokenów to wejście, czyli treść dokumentu, więc różnica wynosi około 17 razy na korzyść gpt-oss-20b. Mistral Small jest tańszy od Llamy, ale w tym zestawieniu nie dawał nic, czego nie dawały dwa pozostałe.

Darmowy poziom usługi ma limit 400 zapytań na minutę, co odczytaliśmy z nagłówków odpowiedzi API. Klient przetwarza około 200 stron dziennie, więc limit nie powinien przeszkadzać, ale przed przełączeniem produkcji zaplanowaliśmy osobny test zachowania przy błędach 429.

## Czy dane w OVH AI Endpoints zostają w UE?

Nie poprzestaliśmy na deklaracji z cennika. Sprawdziliśmy, dokąd faktycznie trafia ruch: adres API rozwiązuje się na centrum danych OVH w Gravelines we Francji. Serwer aplikacji klienta stoi w Niemczech, więc cała trasa dokumentu przebiega w UE. To pomiar, a nie zapewnienie dostawcy.

Pozostałe kwestie opierają się na deklaracjach OVH:

-   dane z zapytań nie są używane do trenowania ani ulepszania modeli,
-   OVH nie przechowuje promptów, zapisuje tylko dane potrzebne do rozliczeń,
-   usługa działa w europejskich centrach danych OVH, a platforma ma certyfikaty ISO 27001 i SOC.

Dwie rzeczy zostały do domknięcia po stronie prawnej. Na stronie OVH przy jednym z planów pojawia się dopisek o działaniu poza UE, więc przy zmianie planu trzeba ponownie sprawdzić, gdzie trafia ruch. Druga sprawa to umowa powierzenia przetwarzania danych z OVH, którą klient zawiera sam. Mimo to przełączenie i tak poprawiło sytuację: dokumenty przestały trafiać do USA.

Szerzej o tym, jak RODO i AI Act łączą się przy takich wdrożeniach, piszemy w tekście [AI Act w praktyce](https://asapdevs.it/blog/ai-act-w-praktyce).

## Jak przełączyć model bez wdrażania nowej wersji?

System klienta trzyma konfigurację modelu w Redisie: dostawcę, klucz, adres API, nazwę modelu i osobno model do obrazów. Przełączenie na OVH polegało na podmianie tego wpisu. Nie było budowania obrazu ani restartu aplikacji, a powrót do poprzedniego dostawcy to przywrócenie starego wpisu.

Jeśli budujesz system na modelu językowym od zera, zostaw sobie taką furtkę. Modele i ceny zmieniają się co kilka miesięcy, a przepisanie integracji przy każdej zmianie kosztuje więcej niż jeden klucz w konfiguracji. Do obrazów OVH udostępnia Qwen2.5-VL-72B i ten model mamy przygotowany w tej samej konfiguracji, choć klient jeszcze nie włączył przetwarzania obrazów.

## Który model wybrać do dokumentów po polsku?

Wybraliśmy Llama 3.3 70B i od 17 sierpnia 2026 r. system produkcyjny i środowisko lokalne korzystają z niej przez OVH. Za tym wyborem stała zgodność z dotychczasowymi wynikami i to, że model działa z istniejącym kodem bez zmian.

gpt-oss-20b zostaje opcją, gdy liczy się koszt, a większa próba potwierdzi jakość na polskich dokumentach. Przy kilkuset stronach dziennie różnica w rachunku jest niewielka, przy dziesiątkach tysięcy zaczyna mieć znaczenie. Jeśli dokumenty nie mogą opuścić firmy nawet do centrum danych w UE, zostają modele uruchomione lokalnie, które opisujemy w ofercie [lokalnych modeli AI](https://asapdevs.it/offers/lokalne-modele-ai).

Zanim wybierzesz model, sprawdź go na własnych dokumentach. Pomożemy przygotować zestaw testowy, porównać modele hostowane w UE i lokalne oraz przełączyć system tak, żeby kolejna zmiana dostawcy była kwestią konfiguracji. [Zobacz, jak wdrażamy AI z kontrolą nad danymi →](https://asapdevs.it/offers/ai-branze-regulowane)

Źródła: [OVHcloud AI Endpoints](https://www.ovhcloud.com/en/public-cloud/ai-endpoints/); wyniki testu: pomiary własne ASAPDevs, sierpień 2026, 10 dokumentów.

![Kamil Perzowski](https://asapdevs.it/assets/img/kamil-asapdevs-112.webp)

Kamil Perzowski

CEO i co-founder ASAPDevs. Programuje i utrzymuje sklepy, aplikacje webowe i serwery klientów. [LinkedIn](https://www.linkedin.com/in/kamil-perzowski/) · [Lokalne modele AI](https://asapdevs.it/offers/lokalne-modele-ai#kontakt)

Masz ten sam problem?

## Chcesz przenieść AI z USA do UE?

![Kamil Perzowski, ASAPDevs](https://asapdevs.it/assets/img/kamil-asapdevs-112.webp)

Kamil Perzowski

CEO & Co-founder, ASAPDevs

Porównamy modele na Twoich dokumentach, a nie na benchmarku, i przełączymy system na model hostowany w UE albo na Twoim serwerze. Opisz, co dziś robi model i jakie dane przez niego przechodzą.

★★★★★

> Perfekcyjnie zrobione zlecenie ! Polecam !!!!

Przemysław G., opinia w Google

★★★★★

> Polecam ! Wszystko perfekcyjnie !

Mateusz W., opinia w Google

FAQ

## Pytania i odpowiedzi

### Czy Llama 3.3 70B hostowana w OVH wystarczy zamiast modelu OpenAI?

W naszym teście ekstrakcji metadanych z 10 dokumentów była najbliżej modelu OpenAI: 8/10 zgodnych typów, 8/10 zgodnych dat, 6/10 pełnej zgodności. Odpowiada wolniej (5,8 s zamiast 2,1 s), ale dane zostają we Francji. Do zadań, gdzie liczy się jakość po polsku, wybralibyśmy ją ponownie.

### Ile kosztuje gpt-oss-20b w porównaniu z Llama 3.3 70B?

W cenniku OVH gpt-oss-20b kosztuje 0,04 € za milion tokenów wejściowych i 0,15 € za milion wyjściowych, Llama 3.3 70B 0,67 € w obu kierunkach. Przy tokenach wejściowych to około 17 razy taniej.

### Dlaczego model z trybem rozumowania zwracał pustą odpowiedź?

Modele typu reasoning, np. Qwen3.5-9B, najpierw piszą tok rozumowania w osobnym polu, a pole z odpowiedzią wypełniają dopiero na końcu. Kod, który czyta tylko zwykłą odpowiedź, dostaje pusty tekst albo timeout. Taki model trzeba obsłużyć osobno albo wybrać wersję Instruct.

### Czy OVH przechowuje prompty?

Według deklaracji OVH nie: firma zapowiada brak retencji danych poza tym, co potrzebne do rozliczeń, i nie używa ich do trenowania modeli. To deklaracja dostawcy, a nie nasz pomiar. Sprawdziliśmy natomiast, że ruch trafia do centrum danych we Francji.

### Czy 10 dokumentów to wystarczająca próba do wyboru modelu?

Do wyeliminowania modeli, które w ogóle nie działają z danym kodem, tak. Do różnicy jednego dokumentu między dwoma modelami nie. Przed pełnym wdrożeniem puść kilkadziesiąt dokumentów i sprawdzić limity zapytań przy realnym ruchu.

## Przeczytaj też

### [Lokalne modele AI →](https://asapdevs.it/offers/lokalne-modele-ai)

Llama, Qwen, Bielik i PLLuM na Twoim serwerze albo w UE.

### [AI w branżach regulowanych →](https://asapdevs.it/offers/ai-branze-regulowane)

AI z kontrolą nad danymi, logami i hostingiem.

### [Agenci AI →](https://asapdevs.it/offers/agenci-ai)

Agenci z akceptacją człowieka, logami i limitami kosztów.

### [Bielik i PLLuM lokalnie →](https://asapdevs.it/blog/bielik-pllum-polski-model-ai-lokalnie)

Polskie modele językowe na własnym serwerze.
