Odsiew
328 mln dokumentów
Przetworzono 328 007 101 dokumentów. Usunięto 53 819 391 duplikatów, czyli około 53,8 mln dokumentów i 33,1 mld tokenów. Odrzucono też 30 dokumentów FineWeb-2 zawierających literalny znacznik końca tekstu.
Dokumentacja projektu
Jak powstała Saga 3B — polski model bazowy z rodziny Skald, wytrenowany od podstaw na superkomputerze JUPITER.
Stan według raportu
Pełny trening Sagi 3B został zakończony.
Receptura, ustawienia i ocena według karty modelu (README.md) oraz receptura-podsumowanie.json, odczytanych 19 września 2026. To opis modelu bazowego przewidującego dalszy ciąg tekstu. Odnośniki do plików źródłowych wymagają dostępu do prywatnego repozytorium.
Odtworzenie wyniku, wybór słownika, porównanie składu danych i pełny trening Sagi 3B są zakończone. Douczanie bazy na nowym korpusie jest zakończone; w projekcie Development trwają prace nad modelem 15,45 mld parametrów zbudowanym z Sagi 3B, a jego zasadniczy trening w przydziale Fast Lane czeka na daty od JSC. Wagi zostają prywatne. Statusy odświeżają się z opublikowanego raportu.
Odtworzenie wyniku i pomiary skalowania są zakończone.
Strata walidacyjna w próbie na JUPITERZE: 2,9847; lokalna linia odniesienia: 2,9867. Różnica −0,0020. Czas próby: 13 min 11 s.
Największa zmierzona skala w raporcie: 64 układy; sprawność względem konfiguracji bazowej: 89,5 %; tempo: 9,0 mln tok./s. To pomiary naszych prób treningowych.
Wybrano słownik 64k ze średnim wynikiem 1,4299 bitów na znak.
Saga używa własnego słownika BPE na poziomie bajtów, wyuczonego na polskim tekście: 65 536 tokenów. Bity na znak pozwalają porównywać modele z różnymi słownikami.
Porównanie składu korpusu jest zakończone.
Udziały pięciu pul wybrano po sześciu mniejszych treningach porównawczych, ocenionych na osobnym egzaminie. Skład gotowego pliku treningowego opisuje receptura poniżej.
Pełny trening Sagi 3B został zakończony.
Trening zakończył się 14 września 2026, po 186 688 aktualizacjach w sześciu zadaniach na 64 układach GH200. Przetworzył 195 756 556 288 tokenów, czyli około 195,8 mld.
Pola planu zapisane w raporcie: 186 688 aktualizacji, 195,8 mld tokenów oraz szacunek 68 h na 64 układach. Szacunek czasu nie jest pomiarem czasu ukończonego treningu.
Osobna próba techniczna: 13 883 tok./s/GPU, MFU 50,2 % i 76,1 GiB pamięci na układ. Średnie wartości pełnego treningu podajemy w sekcji ustawień.
W toku w projekcie Development: douczanie bazy Sagi 3B jest zakończone, trwają prace nad modelem 15,45 mld parametrów zbudowanym z tej bazy.
Projekt Development (EHPC-DEV-2026D09-196) działa od 18 września 2026: najpierw pomiary treningu na wielu węzłach, potem dwa etapy douczania bazy (22 września, 21,3 mld tokenów). Strata walidacyjna na niezmienionym zbiorze spadła z 2,5105 do 2,4840. Kolejny etap, na niewykorzystanej reszcie dotychczasowego korpusu, przerwano 23 września po około 9 mld tokenów, bo strata stała w miejscu. Dalsze douczanie wymaga więc nowego materiału.
Nowy korpus (gotowy 25 września): z 167,9 mln dokumentów pięciu pul po deduplikacji zostało 151,1 mln, co po tokenizacji słownikiem 64k daje 105,4 mld tokenów. Pełny skan pod kątem tekstów egzaminu pokazał pokrycie poniżej 1 % w każdej z trzech części egzaminu, niższe niż w korpusie Sagi. Douczanie szło etapami po 20 mld tokenów, z około 92 % nowego materiału przy wymaganych co najmniej 60 %. Etapy 3.1–3.3 obniżyły stratę walidacyjną z 2,4841 do 2,4704, a zjazd stopy uczenia z końca etapu 3.3 — do 2,4667, najniższej wartości bazy Saga 3B w projekcie. Etapy 3.4 i 3.6 w ustawieniu FSDP nie obniżyły straty; mieszanka etapu 3.5 posłużyła do prób rozrostu.
Od 27 września projekt Development służy przygotowaniu rozrostu. Przepis sprawdzaliśmy najpierw na małych modelach tej samej architektury. Podwojenie liczby warstw naraz okazało się w skali 5,8 mld niestabilne. Stabilne były dwa sposoby, które zachowują funkcję modelu: dodanie po co trzeciej warstwie jej kopii z zerowym wyjściem oraz dokładne podwojenie szerokości. Tak 29 września powstał model 15,45 mld parametrów (48 warstw × 5120), zbudowany wprost z bazy 3B. Po 6,3 mld tokenów treningu, zakończonego obniżeniem tempa uczenia, jego strata walidacyjna wynosi 2,4944 wobec 2,4667 bazy. Test na małych modelach z 1 października tłumaczy ten wynik: model po takim rozroście zrównuje się z kontrolą dopiero po około 12–15 % tokenów, na których uczono bazę, a potem ją wyprzedza. Po 58 % jego strata była o 0,17 niższa niż kontroli, a przy wyższym tempie uczenia przewaga była większa.
Przydział Fast Lane przyznany na zasadniczy trening modelu 15,45 mld parametrów, zbudowanego z Sagi 3B. Daty wskaże JSC.
Przydział EHPC-AIF-2026FL01-1001: 50 000 GPU-godzin na 3 miesiące, przyznany 25 września 2026. Plan z wniosku: najpierw zwiększenie liczby warstw z 36 do 72 (około 5,8 mld parametrów), potem szerokości modelu (około 15 mld). Przed każdym krokiem próba z kryterium zapisanym przed startem; jeśli krok pogorszy ocenę, zostaje mniejszy, działający model. Model 15,45 mld powstał inaczej, niż zakładał wniosek: z 48 warstw i podwojonej szerokości, bo podwojenie liczby warstw naraz było niestabilne (zob. fazę E). W przydziale Fast Lane przypada jego zasadniczy trening.
Wagi Sagi 3B zostają w repozytorium prywatnym. Do opublikowania jest raport z metody i receptury.
Oceniono końcowy punkt kontrolny. Repozytorium modelu — dostęp ograniczony ↗
Gotowy korpus łączy pięć pul polskiego tekstu po globalnym odsiewie duplikatów. Udziały dotyczą tokenów w pliku treningowym.
Tokenów w pliku treningowym.
Osobny plik walidacyjny: 10 mln tokenów.
| Pula i źródła | Udział tokenów | Tokeny w pliku | Przejścia przez pulę |
|---|---|---|---|
| Sieć: FineWeb-2 + HPLT 2.0 cleaned | 89,6 % | 194,17 mld | ≈1,04 |
| FinePDFs, dodatkowy filtr jakości | 8,9 % | 19,29 mld | 1 |
| Wikipedia | 1,1 % | 2,34 mld | 4 |
| Wikiźródła | 0,4 % | 0,78 mld | 4 |
| Wolne Lektury | 0,1 % | 0,21 mld | 4 |
Udziały zaokrąglono osobno do 0,1 punktu procentowego, dlatego ich suma wynosi 100,1 %. Przejścia opisują liczbę kopii w pliku treningowym, nie gwarantowaną ekspozycję każdego tokenu podczas treningu. Dokładne wartości: receptura-podsumowanie.json.
Odsiew
Przetworzono 328 007 101 dokumentów. Usunięto 53 819 391 duplikatów, czyli około 53,8 mln dokumentów i 33,1 mld tokenów. Odrzucono też 30 dokumentów FineWeb-2 zawierających literalny znacznik końca tekstu.
Podział danych
Całe unikalne dokumenty rezerwowano do walidacji przed mieszaniem pul. Niewykorzystane końcówki tych dokumentów nie trafiały do treningu. Plik walidacyjny ma 10 mln tokenów.
Kandydatów wskazywał 64-bitowy skrót, a zgodność potwierdzano na znormalizowanym zdekodowanym tekście. Pierwszeństwo miało źródło wcześniejsze w definicji mieszanki. Odsiew obejmował także powtórzenia między źródłami.
Wykorzystano polskie podzbiory FineWeb-2, HPLT 2.0 cleaned i FinePDFs; Wikipedię z 1 listopada 2023; Wikiźródła z 1 września 2026; oraz korpus Wolnych Lektur. Źródła i ich warunki korzystania opisano w karcie modelu.
Ustawienia ukończonego treningu i średnie pomiary pochodzą z karty modelu bazowego.
Model
Transformer typu decoder-only w układzie GPT-2: 36 warstw, 20 głów, szerokość 2560. Kontekst: 2048 tokenów. LayerNorm bez biasu, GELU, wyuczone pozycje i współdzielone osadzenia wejścia oraz wyjścia.
Zasoby i przebieg
16 węzłów JUPITER Booster, sześć zadań. Trening zakończył się 14 września 2026 na aktualizacji 186 688. Kod oparty na nanoGPT, mieszana precyzja bf16, torch.compile i DDP.
Każda aktualizacja obejmowała 1 048 576 tokenów w sekwencjach po 2048 tokenów. Optymalizator AdamW: β₂ = 0,95, weight decay 0,1 i ograniczenie normy gradientu do 1,0.
Rozgrzewka przez 3000 aktualizacji, następnie stała stopa 3e-4 i liniowe zejście do 3e-5 przez ostatnie 15 % treningu.
Średnie tempo: 12 329 tok./s na układ; średnie MFU: 46,6 %. Średnia strata treningowa spadła z 5,32 na początku do 2,08 w ostatnim oknie 2000 aktualizacji.
Źródło: karta modelu — Training.
Oceniono końcowy punkt kontrolny po 186 688 aktualizacjach. Niższa perpleksja i niższa liczba bitów na znak oznaczają lepsze przewidywanie tekstu na danym zbiorze.
| Zbiór | Perpleksja | Bity na znak | Wspólne okna 13-tokenowe |
|---|---|---|---|
| Wycinek walidacji: 1 048 576 tokenów | 12,06 | — | — |
| Encyklopedia po dacie odcięcia danych | 10,29 | 0,726 | 0,80 % |
| Tekst sieciowy po dacie odcięcia | 11,21 | 0,655 | 0,41 % |
| Proza po dacie odcięcia | 15,45 | 1,014 | 0,05 % |
Bazowa wersja Sagi 3B przewiduje dalszy ciąg tekstu. Nie jest dostrojona do wykonywania poleceń ani do rozmowy. Wyniki tabeli dotyczą tego modelu bazowego.
Lokalny Canto 33M z sierpnia 2026 pozostaje punktem odniesienia dla procesu treningowego. Jego wyniki nie opisują Sagi 3B. Próby skalowania i pełny trening mają osobne pomiary; podane tempa dotyczą naszego kodu i konfiguracji, a nie oceny całego JUPITERA ani jego gospodarza.
Źródło: karta modelu — Evaluation.
Repozytorium modelu Saga 3B na Hugging Face pozostaje prywatne. Jawne są receptura korpusu, pomiary i dziennik prac, a nie wagi.
Wagi Sagi 3B zostają w repozytorium prywatnym. Do opublikowania jest raport z metody i receptury.
decisioninterface/saga-3b — dostęp ograniczony ↗
Pakiet zawiera 55 plików wag float32 safetensors w formacie Transformers GPT-2. Karta opisuje bezstratną konwersję eksportu treningowego oraz porównanie logitów i kontynuacji tekstu.
Licencja wag wskazana w karcie modelu: Apache 2.0. Repozytorium pozostaje prywatne. Licencja wag nie zastępuje warunków korzystania ze źródeł danych. Szczegóły: karta modelu i skrócona receptura.
Epos pozostaje planem dużego modelu MoE na przyszłość, poza bieżącym przydziałem.
Przydział EHPC-AIF-2026PG01-1218, EuroHPC AI Factory — Playground, obejmuje 5000 GPU-godzin. Pełny trening Sagi 3B wykonano w tym przydziale na JUPITER Booster w Jülich Supercomputing Centre, z układami NVIDIA GH200.
Przydział EHPC-DEV-2026D09-196 (EuroHPC Development Access), przyznany 10 września 2026, obejmuje 14 000 GPU-godzin, czyli 3500 węzłogodzin, na 12 miesięcy od daty wskazanej przez JSC. Jest rozliczany osobno i służy rozwojowi treningu na wielu węzłach.
Przydział EHPC-AIF-2026FL01-1001 (EuroHPC AI Factory — Fast Lane), przyznany 25 września 2026, obejmuje 50 000 GPU-godzin na JUPITER Booster na 3 miesiące. Daty rozpoczęcia i zakończenia wskaże JSC; przedłużeń nie ma. Przydział jest rozliczany osobno i służy rozrostowi Sagi 3B do modelu o około 15 mld parametrów.
We acknowledge EuroHPC JU for awarding the project ID EHPC-AIF-2026PG01-1218 access to JUPITER Booster hosted by Jülich Supercomputing Centre (JSC), Germany.
Na zasobach EuroHPC (JUPITER Booster) wykonano: faza A: przebiegi wielowezlowe i pomiary skalowania; faza B: przebiegi potwierdzajace wybor slownika. Poza przydzialem EuroHPC powstaly: trening slownikow i pomiar plodnosci, rozwoj filtrow korpusu, lokalna linia odniesienia oraz kod pakujacy i raportujacy.