Chcesz sprawdzić model AI na swoich dokumentach?Porozmawiajmy o wdrożeniu
← Blog
AI

Bielik i PLLuM: jak uruchomić polski model AI lokalnie w firmie

Czym są Bielik i PLLuM, na jakim sprzęcie działają i jak sprawdzić, czy polski model poradzi sobie z Twoimi dokumentami, zanim wydasz pieniądze na serwer.

Coraz więcej firm i urzędów chce korzystać z AI, ale nie może wysyłać dokumentów do zewnętrznej chmury. Chodzi o dane pacjentów, tajemnicę przedsiębiorstwa albo dane mieszkańców. Rozwiązaniem jest model językowy uruchomiony lokalnie, a w polskich realiach pierwsze nazwy, które padają, to Bielik i PLLuM. Wyjaśniamy, czym są, na czym działają i jak sprawdzić, czy poradzą sobie z Twoimi dokumentami.

Czym są Bielik i PLLuM?

Bielik

Bielik to polski model językowy rozwijany przez otwarty projekt SpeakLeash we współpracy z ACK Cyfronet AGH. Najbardziej znana jest wersja z 11 miliardami parametrów, zbudowana na bazie modelu Mistral 7B i dotrenowana na dużym zbiorze polskich tekstów. Kolejne wersje oraz ich odchudzone (skwantyzowane) warianty są dostępne w serwisie Hugging Face.

PLLuM

PLLuM (Polish Large Language Model) powstał w konsorcjum instytucji naukowych, któremu przewodzi Politechnika Wrocławska. Współtworzyły go m.in. NASK, Instytut Podstaw Informatyki PAN, Ośrodek Przetwarzania Informacji, Uniwersytet Łódzki i Instytut Slawistyki PAN. Model jest dostępny w kilku rozmiarach, od 8 do 70 miliardów parametrów, i udostępniony do zastosowań naukowych, w administracji i w biznesie.

Licencje różnią się między wersjami obu modeli. Zanim zbudujesz na nich produkt, sprawdź licencję konkretnego wariantu na jego stronie w Hugging Face.

Dlaczego model lokalny, a nie ChatGPT?

  • Dane zostają w firmie. Dokumenty przetwarza serwer, który kontrolujesz, a nie usługa zewnętrznego dostawcy.
  • Łatwiej spełnić wymagania. RODO, tajemnica zawodowa czy wymóg, żeby dane nie opuszczały UE, są prostsze do udowodnienia, gdy wiesz, gdzie fizycznie działa model.
  • Przewidywalne koszty. Płacisz za sprzęt albo hosting, a nie za każde zapytanie.
  • Możliwość douczenia. Model open-weights można dostroić do własnych dokumentów i słownictwa.

Są też minusy. Lokalny model trzeba utrzymywać, a najmocniejsze modele komercyjne w wielu zadaniach nadal są lepsze. Dlatego często łączymy oba podejścia: dane wrażliwe przetwarza model lokalny, a zadania bez danych osobowych mogą iść do API.

Jaki sprzęt jest potrzebny?

O wymaganiach decyduje głównie rozmiar modelu i to, czy używasz wersji skwantyzowanej, czyli zapisanej z mniejszą precyzją. Orientacyjnie:

Rozmiar modeluPrzykładyNa czym ruszy
7–12 mld parametrówBielik 11B, PLLuM 8B, Llama 3.1 8BKarta graficzna z kilkunastoma GB pamięci (wersja 4-bitowa). Do prób wystarczy mocniejszy komputer.
ok. 70 mld parametrówPLLuM 70B, Llama 3.3 70BSerwer z kilkudziesięcioma GB pamięci GPU albo hosting GPU w UE.

Do uruchomienia modelu służą narzędzia takie jak Ollama czy llama.cpp, wygodne do prób na jednym komputerze, oraz vLLM, które lepiej sprawdza się na serwerze obsługującym wielu użytkowników naraz.

Jak zacząć: od testu, nie od zakupu serwera

  1. Wybierz jedno zadanie. Np. odpowiadanie na pytania z regulaminów, streszczanie pism albo wyciąganie danych z formularzy.
  2. Zbierz próbkę dokumentów. Kilkadziesiąt prawdziwych przykładów i odpowiedzi, które uznasz za poprawne.
  3. Porównaj kilka modeli. Ten sam zestaw zadań dla Bielika, PLLuM, Llamy czy Qwena. Liczy się wynik na Twoich danych.
  4. Dopiero potem dobierz sprzęt. Gdy wiesz, który model wygrywa, wiesz też, ile pamięci GPU potrzebujesz.

Tak pracujemy przy naszych wdrożeniach. W jednym z projektów porównaliśmy trzy modele na tych samych dziesięciu prawdziwych dokumentach: Llama 3.3 70B poradziła sobie z 6 z nich, Mistral Small 24B i gpt-oss-20b z 5. Różnice, których nie widać w ogólnych rankingach, wychodzą dopiero na konkretnych danych.

Sam model to nie wszystko

Model językowy to tylko jeden element. Żeby AI odpowiadało na podstawie Twoich dokumentów, potrzebujesz jeszcze wyszukiwarki, która znajdzie właściwe fragmenty (tzw. RAG), odczytu skanów (OCR), kontroli dostępu i panelu dla użytkowników. Przy dokumentach krytycznych dochodzą twarde reguły sprawdzające, zapisane jako kod, bo modele językowe czasem się mylą. Opisujemy to na przykładach w naszej ofercie AI na lokalnych modelach.

A urzędy?

Samorządy mają te same potrzeby co firmy, tylko wymagania są jeszcze ostrzejsze: dane mieszkańców, RODO, AI Act i NIS2. Model uruchomiony na serwerze urzędu albo w kontrolowanym hostingu w Polsce pozwala korzystać z AI bez wysyłania dokumentów na zewnątrz. Z myślą o urzędach zbudowaliśmy SamorzadAI.

Podsumowanie

Bielik i PLLuM to dobry punkt startu dla każdego, kto chce korzystać z AI po polsku, nie wysyłając danych poza firmę. Nie zakładaj jednak z góry, że polski model będzie najlepszy. Zacznij od testu na własnych dokumentach, porównaj kilka modeli i dopiero wtedy kupuj sprzęt. Jeśli chcesz, przeprowadzimy taki test z Tobą w ramach wdrożenia AI na lokalnych modelach.

Kamil Perzowski
Kamil Perzowski
CEO i co-founder ASAPDevs. Programuje i utrzymuje sklepy, aplikacje webowe i serwery klientów. LinkedIn · Porozmawiajmy o wdrożeniu
Masz ten sam problem?

Chcesz sprawdzić model AI na swoich dokumentach?

Kamil Perzowski, ASAPDevs
Kamil Perzowski
CEO & Co-founder, ASAPDevs
Wdrażamy AI na modelach działających na Twoim serwerze albo w UE: Bielik, PLLuM, Llama, Qwen i inne. Zaczynamy od testu na próbce Twoich dokumentów.

Wysyłając formularz, przekazujesz nam dane, żebyśmy mogli odpowiedzieć. Szczegóły w polityce prywatności.

FAQ

Pytania i odpowiedzi

Czym różni się Bielik od PLLuM?

+
Bielik powstał w otwartym projekcie SpeakLeash we współpracy z ACK Cyfronet AGH i jest najbardziej znany w wersji z 11 miliardami parametrów. PLLuM zbudowało konsorcjum instytucji naukowych pod kierunkiem Politechniki Wrocławskiej, a model jest dostępny w kilku rozmiarach, od 8 do 70 miliardów parametrów. Oba trenowano z naciskiem na język polski.

Czy Bielika i PLLuM można używać komercyjnie?

+
Twórcy obu modeli udostępniają je także do zastosowań biznesowych, ale licencje różnią się między wersjami. Przed wdrożeniem sprawdź licencję konkretnego modelu na jego stronie w Hugging Face.

Jaki komputer jest potrzebny do uruchomienia Bielika lokalnie?

+
Model z 11 miliardami parametrów w wersji skwantyzowanej do 4 bitów zmieści się na karcie graficznej z kilkunastoma GB pamięci, a do prób wystarczy mocniejszy komputer z taką kartą. Duże modele, np. 70 miliardów parametrów, potrzebują serwera z kilkudziesięcioma GB pamięci GPU albo hostingu GPU.

Czy polski model jest lepszy od Llamy albo Qwena?

+
Nie ma na to jednej odpowiedzi. Polskie modele dobrze radzą sobie z polszczyzną, ale w naszych dotychczasowych wdrożeniach na dokumentach klientów najlepiej wypadały Llama i Qwen. Dlatego model zawsze wybieramy testem na prawdziwych dokumentach, a nie na podstawie rankingu.

Czy dane trafią do internetu, jeśli uruchomię model lokalnie?

+
Nie, jeśli cały system działa na Twoim serwerze albo na serwerze w UE, który kontrolujesz. Model działa wtedy bez połączenia z zewnętrznymi usługami, a dokumenty nie opuszczają firmy.

Przeczytaj też