Polski model AI wygrywa z dziesięciokrotnie większymi. Państwowy instytut oddaje go wszystkim za darmo
AI Lab Ośrodka Przetwarzania Informacji udostępnił jako open source rodzinę modeli PolDense — wyspecjalizowanych w wyszukiwaniu informacji po polsku. Największy z nich zajął pierwsze miejsce w benchmarku PIRB, wyprzedzając wielojęzyczne modele zagranicznych koncernów mające kilkukrotnie więcej parametrów. Twórcy nie obiecują polskiego ChatGPT — i uczciwie mówią, że nim nie są. Obiecują coś przyziemniejszego, a dla firm i administracji może ważniejszego: tańszy, szybszy i suwerenny fundament pod systemy, które przeszukują własne bazy dokumentów — czyli pod nadchodzącą „rewolucję agentową”.
To nie ChatGPT — i dobrze
Rodzina PolDense to sześć modeli o rozmiarach od 17 mln do 1 mld parametrów, opartych na architekturze ModernBERT, zdolnych analizować teksty do 8192 tokenów. Ich zadanie jest wąskie i konkretne: zamieniać pytania i dokumenty na reprezentacje wektorowe, dzięki którym system znajduje treści po znaczeniu, a nie po dopasowaniu słów kluczowych. To tak zwane dense retrievery — cichy, ale krytyczny element systemów RAG, w których duży model językowy odpowiada na podstawie dokumentów wyszukanych w firmowych czy urzędowych bazach, a nie tylko własnej pamięci.
Trzeba być świadomym, że nie są one porównywalne z modelami typu ChatGPT, Claude czy chińskie Qwen i DeepSeek, ponieważ nie są to modele generatywne
— zastrzega w rozmowie z agencją Newseria dr inż. Marek Kozłowski, kierownik AI Lab w OPI-PIB. I dodaje, dlaczego ta „nudniejsza” kategoria jest strategiczna: — Żeby duże modele językowe przetwarzały właściwe dane, należy je wyszukać, i po to właśnie są modele PolDense — aby skutecznie wyszukiwać informacje w naszych lokalnych zbiorach danych i potem przekazywać je do dużych modeli językowych.
Pierwsze miejsce w benchmarku
Największy model, PolDense 1B, uzyskał 64,11 pkt w Polish Information Retrieval Benchmark (PIRB), zajmując pierwsze miejsce i wyprzedzając modele wielojęzyczne kilkakrotnie większe. Dla rzetelności odnotujmy: PIRB to benchmark opracowany również w OPI — przez zespół Sławomira Dadasa — więc instytut wygrywa w rankingu, który sam stworzył. Kontekst łagodzący jest jednak istotny: to publiczny, recenzowany naukowo (LREC-COLING 2024) zestaw 41 zadań, na którym testowane są dziesiątki modeli polskich i międzynarodowych, a tabela wyników jest jawna — każdy może sprawdzić i podważyć. W niszy polskojęzycznego wyszukiwania to po prostu główna miara, jaką dysponujemy.
Praktyczny sens wyniku tłumaczy Kozłowski rachunkiem kosztów:
Jeśli mamy model dziesięciokrotnie mniejszy od modeli międzynarodowych, to jest dziesięciokrotnie tańszy w utrzymaniu, zajmuje mniej pamięci i jest szybszy na naszej infrastrukturze. Daje nam więc dwojakie zyski: wyższą lub porównywalną skuteczność i do tego jeszcze wielokrotnie niższe koszty utrzymania, dodatkowo niezależność technologiczną i suwerenność, która jest kwestią najtrudniej wycenialną
— podkreśla szef AI Lab. Najmniejsze warianty rodziny działają nawet bez kart graficznych, na zwykłych procesorach — co dla mniejszych firm i urzędów oznacza wejście w RAG bez inwestycji w kosztowną infrastrukturę.
Suwerenność w praktyce, nie w deklaracjach
Modele trafiły na platformę Hugging Face jako open source — mogą z nich korzystać naukowcy, administracja i przedsiębiorcy. To rzadki w Polsce przykład technologicznej suwerenności rozumianej praktycznie: nie jako hasło o „polskim ChatGPT”, lecz jako konkretny, wąski komponent, w którym krajowy ośrodek realnie wygrywa z zagranicą — i oddaje wynik za darmo, zamiast chować go w szufladzie. Dotychczas, jak przyznaje Kozłowski, wdrożenia wyszukiwania opierały się na modelach chińskich lub amerykańskich; teraz w tej jednej warstwie jest polska alternatywa.
Tło rynkowe pokazuje, ile jest do nadrobienia: według Eurostatu w 2025 roku sztuczną inteligencję wykorzystywało 8,4 proc. polskich firm wobec 20 proc. średniej unijnej. Zarazem wśród dużych przedsiębiorstw ruch już się zaczął — w badaniu PwC 44 proc. firm zatrudniających ponad 250 osób korzystało z agentów AI, a kolejne 14 proc. planowało wdrożenie. Jeśli „rewolucja agentowa”, o której mówi Kozłowski, faktycznie nadejdzie w dwa–trzy lata, to o jej kosztach i bezpieczeństwie zdecyduje właśnie warstwa wyszukiwania — ta, w której od lipca Polska ma własny, darmowy klocek.
Źródło: Newseria, OPI-PIB, PIRB (Dadas i in., LREC-COLING 2024)









