
Powstała nowa rodzina polskich modeli językowych do wyszukiwania informacji
Działający w ramach Ośrodka Przetwarzania Informacji (OPI) AI Lab opracował nową rodzinę modeli językowych PolDense przeznaczonych do wyszukiwania informacji. Jak informuje placówka, w publicznym rankingu PIRB model PolDense zajmuje pierwsze miejsce pod względem skuteczności działania.
Modele PolDense powstały w celu pracy na systemach pracujących z dużymi wolumenami danych nieustrukturyzowanych. W szczególności w wyszukiwarkach, chatbotach, asystentach AI oraz aplikacjach wykorzystujących popularną obecnie architekturę RAG (Retrieval Augmented Generation).
– Udostępnienie modeli PolDense to kolejny krok w budowaniu polskich kompetencji w obszarze sztucznej inteligencji. Tworzymy otwarte technologie, które mogą być wykorzystywane przez naukowców, administrację publiczną i przedsiębiorców do budowy nowoczesnych, efektywnych i bezpiecznych narzędzi AI. Warto podkreślić, że jeden z nowych modeli OPI jest na pierwszym miejscu wg Polish Information Retrieval Benchmark (PIRB). Wyprzedza wielojęzyczne modele typu llama czy bge – podkreśla dr hab. inż. Jarosław Protasiewicz, dyrektor Ośrodka Przetwarzania Informacji – Państwowego Instytutu Badawczego.
Rodzina PolDense obejmuje sześć modeli opartych na architekturze ModernBERT i technologii ettin-encoders. Modele posiadają od 17 milionów do 1 miliarda parametrów. Pozwala to dobrać rozwiązanie zarówno do wdrożeń wymagających najwyższej jakości, jak i do środowisk o ograniczonych zasobach sprzętowych. Modele potrafią analizować teksty o długości nawet 8192 tokenów. Dzięki temu lepiej zachowują kontekst długich dokumentów oraz skuteczniej identyfikują najbardziej trafne informacje.
Globalne modele wielojęzyczne w tyle
Największy model z rodziny – PolDense 1B – osiągnął wynik 64,11 punktu w benchmarku PIRB. Wyprzedził znacznie większe modele wielojęzyczne, takie jak Llama-Embed-Nemotron-8B (63,73) oraz BGE-Multilingual-Gemma2-9B (63,26).
Modele o wielkości 400 mln i 150 mln parametrów oferują bardzo konkurencyjne wyniki względem rozwiązań posiadających kilka miliardów parametrów. Natomiast najmniejsze warianty – 68 mln, 32 mln i 17 mln parametrów – zostały zaprojektowane z myślą o wdrożeniach na procesorach CPU, urządzeniach mobilnych oraz środowiskach edge computing.
Modele PolDense zostały udostępnione przez Ośrodek Przetwarzania Informacji jako rozwiązania open source. Dzięki temu mogą być wykorzystywane do budowy własnych mechanizmów wyszukiwania, systemów RAG i narzędzi wspierających pracę z bazami dokumentów. Zastosowanie modeli PolDense pozwala nie tylko poprawić jakość wyszukiwania informacji, lecz także obniżyć koszty wdrożeń. Poprzez wykorzystanie mniejszych i bardziej efektywnych obliczeniowo modeli bez utraty wysokiej skuteczności działania.
Szerokie potencjalne zastosowania
Dr inż. Marek Kozłowski, kierownik AI Lab w Ośrodku Przetwarzania Informacji, podkreśla znaczenie modeli opracowanych w OPI dla różnego rodzaju użytkowników.
– PolDense pokazuje, że można tworzyć modele wyspecjalizowane dla języka polskiego, które nie tylko konkurują z największymi rozwiązaniami światowymi, ale w wielu specyficznych zadaniach osiągają od nich lepsze wyniki. Naszym celem było opracowanie rodziny modeli odpowiadającej na potrzeby bardzo różnych zastosowań – od dużych systemów korporacyjnych, po lekkie wdrożenia działające lokalnie. Wszystkie modele udostępniamy za darmo na platformie Hugging Face, aby wspierać rozwój polskiego ekosystemu AI – podsumowuje Kozłowski.
Następne europejskie języki w kolejce
W kolejnych miesiącach AI Lab OPI planuje udostępnienie modelu EuroDense, który wspiera wyszukiwanie informacji w dziewięciu językach europejskich.
Modele PolDense opracowano w ramach projektu Large Language Models for the European Union (LLMs4EU). Realizuje go konsorcjum Alliance for Language Technologies – ALT-EDIC. Celem projektu jest rozwój i udostępnianie modeli, narzędzi oraz usług opartych na sztucznej inteligencji dla pięciu kluczowych sektorów: nauki, usług publicznych, turystyki, telekomunikacji oraz energetyki. Projekt ma zachęcać do wykorzystywania europejskich technologii AI przez instytucje publiczne oraz małe i średnie przedsiębiorstwa. LLMs4EU jest współfinansowany ze środków UE w ramach programu Digital Europe Programme oraz Ministerstwa Cyfryzacji. Modele PolDense dostępne są za darmo na platformie Hugging Face.
Przeczytaj także: Rośnie zainteresowanie polskimi modelami językowymi. Bielik wkrótce będzie „mówić” w 50 językach
Źródło: naukawpolsce.pap.pl
Last Updated on 20 lipca, 2026 by Krzysztof Kotlarski
