SKALDBETA

Dokumentacja projektu

Dane, trening
i metoda

Jak powstała Saga 3B — polski model bazowy z rodziny Skald, wytrenowany od podstaw na superkomputerze JUPITER.

Stan według raportu

Zapis redakcyjny: 19 września 2026 · 18:17:19 Europe/Warsaw. Odczyt aktualnego opublikowanego raportu wymaga JavaScript.

Odczyt historii zadań: 19 września 2026, 18:17:19 (Warszawa). Pomiary z dokumentu FAKTY: 19 września 2026, 18:17:09 (Warszawa).

Pełny trening Sagi 3B został zakończony.

Receptura, ustawienia i ocena według karty modelu (README.md) oraz receptura-podsumowanie.json, odczytanych 19 września 2026. To opis modelu bazowego przewidującego dalszy ciąg tekstu. Odnośniki do plików źródłowych wymagają dostępu do prywatnego repozytorium.

Fazy prac

Odtworzenie wyniku, wybór słownika, porównanie składu danych i pełny trening Sagi 3B są zakończone. Douczanie bazy na nowym korpusie jest zakończone; w projekcie Development trwają prace nad modelem 15,45 mld parametrów zbudowanym z Sagi 3B, a jego zasadniczy trening w przydziale Fast Lane czeka na daty od JSC. Wagi zostają prywatne. Statusy odświeżają się z opublikowanego raportu.

  1. Zrobione

    Faza A · Odtworzenie i skalowanie

    Odtworzenie wyniku i pomiary skalowania są zakończone.

    Strata walidacyjna w próbie na JUPITERZE: 2,9847; lokalna linia odniesienia: 2,9867. Różnica −0,0020. Czas próby: 13 min 11 s.

    Największa zmierzona skala w raporcie: 64 układy; sprawność względem konfiguracji bazowej: 89,5 %; tempo: 9,0 mln tok./s. To pomiary naszych prób treningowych.

  2. Zrobione

    Faza B · Wybór słownika

    Wybrano słownik 64k ze średnim wynikiem 1,4299 bitów na znak.

    Saga używa własnego słownika BPE na poziomie bajtów, wyuczonego na polskim tekście: 65 536 tokenów. Bity na znak pozwalają porównywać modele z różnymi słownikami.

  3. Zrobione

    Faza C · Skład korpusu

    Porównanie składu korpusu jest zakończone.

    Udziały pięciu pul wybrano po sześciu mniejszych treningach porównawczych, ocenionych na osobnym egzaminie. Skład gotowego pliku treningowego opisuje receptura poniżej.

  4. Zrobione

    Faza D · Trening Saga 3B

    Pełny trening Sagi 3B został zakończony.

    Trening zakończył się 14 września 2026, po 186 688 aktualizacjach w sześciu zadaniach na 64 układach GH200. Przetworzył 195 756 556 288 tokenów, czyli około 195,8 mld.

    Wartości raportu i osobna próba techniczna

    Pola planu zapisane w raporcie: 186 688 aktualizacji, 195,8 mld tokenów oraz szacunek 68 h na 64 układach. Szacunek czasu nie jest pomiarem czasu ukończonego treningu.

    Osobna próba techniczna: 13 883 tok./s/GPU, MFU 50,2 % i 76,1 GiB pamięci na układ. Średnie wartości pełnego treningu podajemy w sekcji ustawień.

  5. W toku

    Faza E · Douczanie i nowy korpus

    W toku w projekcie Development: douczanie bazy Sagi 3B jest zakończone, trwają prace nad modelem 15,45 mld parametrów zbudowanym z tej bazy.

    Projekt Development (EHPC-DEV-2026D09-196) działa od 18 września 2026: najpierw pomiary treningu na wielu węzłach, potem dwa etapy douczania bazy (22 września, 21,3 mld tokenów). Strata walidacyjna na niezmienionym zbiorze spadła z 2,5105 do 2,4840. Kolejny etap, na niewykorzystanej reszcie dotychczasowego korpusu, przerwano 23 września po około 9 mld tokenów, bo strata stała w miejscu. Dalsze douczanie wymaga więc nowego materiału.

    Nowy korpus (gotowy 25 września): z 167,9 mln dokumentów pięciu pul po deduplikacji zostało 151,1 mln, co po tokenizacji słownikiem 64k daje 105,4 mld tokenów. Pełny skan pod kątem tekstów egzaminu pokazał pokrycie poniżej 1 % w każdej z trzech części egzaminu, niższe niż w korpusie Sagi. Douczanie szło etapami po 20 mld tokenów, z około 92 % nowego materiału przy wymaganych co najmniej 60 %. Etapy 3.1–3.3 obniżyły stratę walidacyjną z 2,4841 do 2,4704, a zjazd stopy uczenia z końca etapu 3.3 — do 2,4667, najniższej wartości bazy Saga 3B w projekcie. Etapy 3.4 i 3.6 w ustawieniu FSDP nie obniżyły straty; mieszanka etapu 3.5 posłużyła do prób rozrostu.

    Od 27 września projekt Development służy przygotowaniu rozrostu. Przepis sprawdzaliśmy najpierw na małych modelach tej samej architektury. Podwojenie liczby warstw naraz okazało się w skali 5,8 mld niestabilne. Stabilne były dwa sposoby, które zachowują funkcję modelu: dodanie po co trzeciej warstwie jej kopii z zerowym wyjściem oraz dokładne podwojenie szerokości. Tak 29 września powstał model 15,45 mld parametrów (48 warstw × 5120), zbudowany wprost z bazy 3B. Po 6,3 mld tokenów treningu, zakończonego obniżeniem tempa uczenia, jego strata walidacyjna wynosi 2,4944 wobec 2,4667 bazy. Test na małych modelach z 1 października tłumaczy ten wynik: model po takim rozroście zrównuje się z kontrolą dopiero po około 12–15 % tokenów, na których uczono bazę, a potem ją wyprzedza. Po 58 % jego strata była o 0,17 niższa niż kontroli, a przy wyższym tempie uczenia przewaga była większa.

  6. Przed nami

    Faza F · Rozrost Sagi

    Przydział Fast Lane przyznany na zasadniczy trening modelu 15,45 mld parametrów, zbudowanego z Sagi 3B. Daty wskaże JSC.

    Przydział EHPC-AIF-2026FL01-1001: 50 000 GPU-godzin na 3 miesiące, przyznany 25 września 2026. Plan z wniosku: najpierw zwiększenie liczby warstw z 36 do 72 (około 5,8 mld parametrów), potem szerokości modelu (około 15 mld). Przed każdym krokiem próba z kryterium zapisanym przed startem; jeśli krok pogorszy ocenę, zostaje mniejszy, działający model. Model 15,45 mld powstał inaczej, niż zakładał wniosek: z 48 warstw i podwojonej szerokości, bo podwojenie liczby warstw naraz było niestabilne (zob. fazę E). W przydziale Fast Lane przypada jego zasadniczy trening.

  7. Przed nami

    Faza G · Ocena i publikacja

    Wagi Sagi 3B zostają w repozytorium prywatnym. Do opublikowania jest raport z metody i receptury.

    Oceniono końcowy punkt kontrolny. Repozytorium modelu — dostęp ograniczony ↗

Receptura korpusu

Gotowy korpus łączy pięć pul polskiego tekstu po globalnym odsiewie duplikatów. Udziały dotyczą tokenów w pliku treningowym.

216,8 mld

Tokenów w pliku treningowym.
Osobny plik walidacyjny: 10 mln tokenów.

Skład pliku treningowego według gotowej receptury
Pula i źródłaUdział tokenówTokeny w plikuPrzejścia przez pulę
Sieć: FineWeb-2 + HPLT 2.0 cleaned89,6 %194,17 mld≈1,04
FinePDFs, dodatkowy filtr jakości8,9 %19,29 mld1
Wikipedia1,1 %2,34 mld4
Wikiźródła0,4 %0,78 mld4
Wolne Lektury0,1 %0,21 mld4

Udziały zaokrąglono osobno do 0,1 punktu procentowego, dlatego ich suma wynosi 100,1 %. Przejścia opisują liczbę kopii w pliku treningowym, nie gwarantowaną ekspozycję każdego tokenu podczas treningu. Dokładne wartości: receptura-podsumowanie.json.

Odsiew

328 mln dokumentów

Przetworzono 328 007 101 dokumentów. Usunięto 53 819 391 duplikatów, czyli około 53,8 mln dokumentów i 33,1 mld tokenów. Odrzucono też 30 dokumentów FineWeb-2 zawierających literalny znacznik końca tekstu.

Podział danych

Walidacja przed mieszaniem

Całe unikalne dokumenty rezerwowano do walidacji przed mieszaniem pul. Niewykorzystane końcówki tych dokumentów nie trafiały do treningu. Plik walidacyjny ma 10 mln tokenów.

Jak usuwano duplikaty

Kandydatów wskazywał 64-bitowy skrót, a zgodność potwierdzano na znormalizowanym zdekodowanym tekście. Pierwszeństwo miało źródło wcześniejsze w definicji mieszanki. Odsiew obejmował także powtórzenia między źródłami.

Pochodzenie i warunki danych

Wykorzystano polskie podzbiory FineWeb-2, HPLT 2.0 cleaned i FinePDFs; Wikipedię z 1 listopada 2023; Wikiźródła z 1 września 2026; oraz korpus Wolnych Lektur. Źródła i ich warunki korzystania opisano w karcie modelu.

Ustawienia treningu

Ustawienia ukończonego treningu i średnie pomiary pochodzą z karty modelu bazowego.

Model

Około 3 mld parametrów

Transformer typu decoder-only w układzie GPT-2: 36 warstw, 20 głów, szerokość 2560. Kontekst: 2048 tokenów. LayerNorm bez biasu, GELU, wyuczone pozycje i współdzielone osadzenia wejścia oraz wyjścia.

Zasoby i przebieg

64 układy GH200

16 węzłów JUPITER Booster, sześć zadań. Trening zakończył się 14 września 2026 na aktualizacji 186 688. Kod oparty na nanoGPT, mieszana precyzja bf16, torch.compile i DDP.

Partia i optymalizacja

Każda aktualizacja obejmowała 1 048 576 tokenów w sekwencjach po 2048 tokenów. Optymalizator AdamW: β₂ = 0,95, weight decay 0,1 i ograniczenie normy gradientu do 1,0.

Harmonogram stopy uczenia

Rozgrzewka przez 3000 aktualizacji, następnie stała stopa 3e-4 i liniowe zejście do 3e-5 przez ostatnie 15 % treningu.

Pomiary pełnego treningu

Średnie tempo: 12 329 tok./s na układ; średnie MFU: 46,6 %. Średnia strata treningowa spadła z 5,32 na początku do 2,08 w ostatnim oknie 2000 aktualizacji.

Źródło: karta modelu — Training.

Ocena i ograniczenia

Oceniono końcowy punkt kontrolny po 186 688 aktualizacjach. Niższa perpleksja i niższa liczba bitów na znak oznaczają lepsze przewidywanie tekstu na danym zbiorze.

Ocena modelu bazowego według karty modelu
ZbiórPerpleksjaBity na znakWspólne okna 13-tokenowe
Wycinek walidacji: 1 048 576 tokenów12,06——
Encyklopedia po dacie odcięcia danych10,290,7260,80 %
Tekst sieciowy po dacie odcięcia11,210,6550,41 %
Proza po dacie odcięcia15,451,0140,05 %

Model bazowy

Bazowa wersja Sagi 3B przewiduje dalszy ciąg tekstu. Nie jest dostrojona do wykonywania poleceń ani do rozmowy. Wyniki tabeli dotyczą tego modelu bazowego.

Historia i próby techniczne

Lokalny Canto 33M z sierpnia 2026 pozostaje punktem odniesienia dla procesu treningowego. Jego wyniki nie opisują Sagi 3B. Próby skalowania i pełny trening mają osobne pomiary; podane tempa dotyczą naszego kodu i konfiguracji, a nie oceny całego JUPITERA ani jego gospodarza.

Źródło: karta modelu — Evaluation.

Publikacja

Repozytorium modelu Saga 3B na Hugging Face pozostaje prywatne. Jawne są receptura korpusu, pomiary i dziennik prac, a nie wagi.

Wagi Sagi 3B zostają w repozytorium prywatnym. Do opublikowania jest raport z metody i receptury.

decisioninterface/saga-3b — dostęp ograniczony ↗

Pakiet zawiera 55 plików wag float32 safetensors w formacie Transformers GPT-2. Karta opisuje bezstratną konwersję eksportu treningowego oraz porównanie logitów i kontynuacji tekstu.

Licencja wag wskazana w karcie modelu: Apache 2.0. Repozytorium pozostaje prywatne. Licencja wag nie zastępuje warunków korzystania ze źródeł danych. Szczegóły: karta modelu i skrócona receptura.

Epos pozostaje planem dużego modelu MoE na przyszłość, poza bieżącym przydziałem.

Zasoby i podziękowanie

Przydział EHPC-AIF-2026PG01-1218, EuroHPC AI Factory — Playground, obejmuje 5000 GPU-godzin. Pełny trening Sagi 3B wykonano w tym przydziale na JUPITER Booster w Jülich Supercomputing Centre, z układami NVIDIA GH200.

Przydział EHPC-DEV-2026D09-196 (EuroHPC Development Access), przyznany 10 września 2026, obejmuje 14 000 GPU-godzin, czyli 3500 węzłogodzin, na 12 miesięcy od daty wskazanej przez JSC. Jest rozliczany osobno i służy rozwojowi treningu na wielu węzłach.

Przydział EHPC-AIF-2026FL01-1001 (EuroHPC AI Factory — Fast Lane), przyznany 25 września 2026, obejmuje 50 000 GPU-godzin na JUPITER Booster na 3 miesiące. Daty rozpoczęcia i zakończenia wskaże JSC; przedłużeń nie ma. Przydział jest rozliczany osobno i służy rozrostowi Sagi 3B do modelu o około 15 mld parametrów.

We acknowledge EuroHPC JU for awarding the project ID EHPC-AIF-2026PG01-1218 access to JUPITER Booster hosted by Jülich Supercomputing Centre (JSC), Germany.

Na zasobach EuroHPC (JUPITER Booster) wykonano: faza A: przebiegi wielowezlowe i pomiary skalowania; faza B: przebiegi potwierdzajace wybor slownika. Poza przydzialem EuroHPC powstaly: trening slownikow i pomiar plodnosci, rozwoj filtrow korpusu, lokalna linia odniesienia oraz kod pakujacy i raportujacy.