NOWETrzeci przydział EuroHPC · Fast Lane · 50 000 GPU-godzin

Budujemy Sagę.

Saga 3B — polski model językowy wytrenowany od podstaw na superkomputerze JUPITER, z własnym słownikiem i własnym korpusem. Ta strona jest jego dziennikiem: wszystkie przebiegi i pomiary, również nieudane.

Infrastruktura i przydziały
EuroHPC JUJülich Supercomputing CentreJUPITER BoosterNVIDIA GH200Decision Interface
01 — Liczby

Skala, którą da się sprawdzić

Pomiary opisują tempo naszego treningu i jego konfigurację na JUPITER Booster — nie wydajność całego JUPITERA.
Faza A2 · sprawność skalowania przy 64 GPU
89,5%

Łączne tempo 9,0 mln tok./s na 64 układach — wobec skalowania idealnego liczonego od pierwszego punktu serii (4 GPU).

Idealnie
10,1 mln
Pomiar
9,0 mln
Pokaż wszystkie punkty pomiarowe →
Model docelowy
3 mld

parametrów · Saga 3B

Sprawdzona skala
64

GPU GH200 w jednym treningu

Plan treningu
216,8 mld

tokenów ekspozycji · Saga 3B

Planowany czas
68 h

na 64 układach · 206 800 kroków

A1 · Odtworzenie wyniku
2,9847

Strata walidacyjna na JUPITERZE wobec 2,9867 lokalnej linii odniesienia.

Różnica −0,002013 min 11 s
Próba · model 3B
13 883 tok./s na układ

80 kroków pełnej konfiguracji Saga 3B. Pomiar tempa i pamięci, osobny od pełnego treningu.

MFU 50,2 %76,1 GiB / kartę
Drugi przydział EuroHPC
14 000 GPU-h

Development Access EHPC-DEV-2026D09-196: 3 500 węzłogodzin na 12 miesięcy. Przyznany 10 września 2026 r., pierwsze zadanie 18 września. Liczony osobno od przydziału Playground; służy rozwojowi treningu na wielu węzłach.

Trzeci przydział EuroHPC · Fast Lane
50 000 GPU-h

AI Factory Fast Lane EHPC-AIF-2026FL01-1001 na JUPITER Booster, na 3 miesiące. Przeznaczony na rozrost Sagi 3B do modelu o około 15 mld parametrów w dwóch krokach; przed każdym krokiem próba z kryterium zapisanym przed startem. Liczony osobno od przydziałów Playground i Development.

Przyznany 25 września 2026 r.Daty rozpoczęcia i zakończenia wskaże JSC · bez przedłużeń

Skalowanie naszego treningu

Faza A2

Łączna liczba tokenów na sekundę · mln tok./s

Wczytywanie pomiarów…

Pomiar Idealne skalowanie względem 4 GPU
Pokaż wszystkie punkty pomiarowe
GPUWęzłyTok./sSprawność
Odczyt punktu

Porównanie tempa przy różnej liczbie układów. Punktem odniesienia jest pierwszy punkt serii: 4 GPU.

Wybierz punkt na wykresie, aby zobaczyć odczyt.

02 — Stan projektu

Gdzie jesteśmy

Stan według raportu

Odtworzenie wyniku i skalowanie: zrobione. W raporcie wskazano słownik 64k dla Sagi. Porównanie składu korpusu: zrobione. Pełny trening Saga 3B został zakończony według raportu. W projekcie Development trwają prace nad modelem 15,45 mld parametrów, zbudowanym z Sagi 3B. Jego zasadniczy trening w przydziale Fast Lane czeka na daty od JSC.

Zapis redakcyjny z 7 września 2026, 19:24:40 (Warszawa). Aktualny odczyt wymaga JavaScript.

Odczyt historii zadań: 7 września 2026, 19:24:40 (Warszawa). Pomiary i plan pochodzą z dokumentu FAKTY z 7 września 2026, 17:46:39 (Warszawa).

  1. AZrobione

    Odtworzenie i skalowanie

    Odtworzenie wyniku i skalowanie: zrobione.

  2. BZrobione

    Wybór słownika

    W raporcie wskazano słownik 64k dla Sagi.

  3. CZrobione

    Skład korpusu

    Porównanie składu korpusu: zrobione.

  4. DZrobione

    Trening Saga 3B

    Pełny trening Saga 3B został zakończony według raportu.

  5. EW toku

    Douczanie i nowy korpus

    W toku w projekcie Development: douczanie bazy Sagi 3B jest zakończone, trwają prace nad modelem 15,45 mld parametrów zbudowanym z tej bazy.

  6. FPrzed nami

    Rozrost Sagi

    Przydział Fast Lane przyznany na zasadniczy trening modelu 15,45 mld parametrów, zbudowanego z Sagi 3B. Daty wskaże JSC.

  7. GPrzed nami

    Publikacja

    Wagi Sagi 3B zostają w repozytorium prywatnym. Do opublikowania jest raport z metody i receptury.

Daty opisują ostatni zapis stanu. To nie jest bezpośredni odczyt kolejki klastra.Przejdź do zadań
03 — Modele i słownik

Od punktu odniesienia do celu

Linia odniesienia z sierpnia, wybrany słownik i Saga 3B trenowana na JUPITERZE.
Faza B · wybór słownikaZrobione

Słownik wskazany.
64k dla Sagi.

Bity na znak · mniej = lepiej
SłownikEncykl.SiećProzaŚrednia
32k1,28041,11171,99231,4615
48k1,27711,09931,91851,4316
64k · wybrany1,26281,09251,93431,4299

Porównujemy bity na znak: mniej oznacza lepszy wynik w tym eksperymencie. To wynik wyboru słownika, nie ocena jakości gotowego modelu.

Ocena dziedzinowa · wynik orientacyjny

Egzamin z tekstów spoza treningu

Stare zbiory oceny miały wspólne fragmenty z danymi treningowymi, więc zbudowaliśmy nowy egzamin wyłącznie z tekstów powstałych po dacie odcięcia. Wyniki 33M zachowujemy jako zapis historyczny.

Przeczytaj zastrzeżenia
Encyklopedia12,3
Tekst sieciowy26,3

Perpleksja · niżej oznacza lepiej.
Bez niezależnego potwierdzenia jakości.

Linia odniesieniaSierpień 2026 · sprzęt lokalny

Canto 33M

Wczytywanie zapisanej krzywej…

2,9867minimum straty walidacyjnej
11 000wykonanych kroków

Pełny zapis krzywej. Wybierz punkt lub użyj strzałek na wykresie.

Docelowy modelBrak potwierdzenia

Saga 3B

Trening nie został jeszcze uruchomiony. Trwa przygotowanie korpusu.

Krzywa pełnego treningu

Krzywa powstanie po uruchomieniu treningu. Dziś nie ma z czego jej narysować.

216,8 mldtokenów do przetworzenia · plan
68 hplanowany czas na 64 układach

206 800 kroków w planie. To budżet treningu, nie liczba unikalnych tokenów korpusu.

Wyjście modelu 33MZapisane próbki bez korekty

Każdy zapis pochodzi z lokalnego modelu referencyjnego. Treść może być błędna lub niespójna.

Wczytywanie zapisanych próbek…
04 — Dane i receptura

Trzy źródła, mierzony skład

Łączymy polskie teksty z trzech źródeł, odsiewamy duplikaty między nimi, a wpływ składu sprawdzamy w osobnych przebiegach.Plan receptury ↗
FineWeb-2sieć, polski
HPLT v2sieć, drugie sito
FinePDFstekst z plików PDF
Krok 1Odsiew duplikatówmiędzy źródłami
Krok 2 · faza CPorównanie wariantówsześć treningów
Plan ekspozycji
216,8 mld tokenów

Przetwarzanie w kolejnych krokach treningu — nie rozmiar unikalnego zbioru. Receptura korpusu będzie jawna.

05 — Rejestr przebiegów

Wszystkie przebiegi. Także nieudane.

Udane i nieudane zadania w jednym rejestrze, z datą, fazą i czasem.

Domyślnie widać zadania z ostatniego dnia pracy; starsze dni są zwinięte i rozwijają się po kliknięciu nagłówka dnia. Wyszukiwanie i filtry pokazują wszystkie pasujące zadania. „W toku” obejmuje też kolejkę, „Nieudane” — anulowane zadania. Brak daty lub czasu trafia na koniec sortowania. CSV zachowuje wybrany odczyt; link otwiera filtry na opublikowanym raporcie.

Zadania z ostatniego raportu klastra
ZadanieFazaRozpoczętoWęzłyCzasStan w raporcieWynikRaport
Wczytywanie rejestru…

Archiwalny rejestr lokalny · sierpień 2026

Zachowane wyniki i przerwane próby sprzed pracy na JUPITERZE. Dawny plan Saga zastąpił plan fazy D opisany powyżej.

PrzebiegModel i metodaBudżetCzas z dziennikówStan archiwalny
01Canto · od zera700 kroków0,9 hZamknięty
02Canto · wznowienie5 000 kroków0,9 hPrzerwany
03Canto · od zera5 000 kroków9,3 hZamknięty
04Canto 33M · od zera11 000 kroków8,3 hZamknięty
05Archiwalny eksperyment LoRA600 kroków11 minZapis historyczny

Czasy historyczne są sumami z dzienników; nie obejmują przerw między wznowieniami. Dawna nazwa „Epos” w eksperymencie LoRA jest historyczna; obecnie Epos oznacza przyszły model MoE poza tym przydziałem. Pełne archiwum dawnej strony zachowano przy przebudowie.

06 — Metoda

Otwarty dziennik. Jawna receptura, jawne pomiary, jawne błędy.

Wagi

Prywatne

Wagi Sagi 3B zostają w repozytorium prywatnym. Do opublikowania jest raport z metody i receptury.

Korpus

Jawna receptura

Źródła, odsiew i skład korpusu opisane tak, by dało się je odtworzyć.

Miejsce

DI Cloud

Docelowe miejsce modelu w produktach Decision Interface.

Zastrzeżenia metodologiczne

Historyczna ocena 33M jest orientacyjna.

Zbiory oceny opisane 7 września 2026 zawierają fragmenty obecne w danych treningowych lokalnego Canto 33M. Perpleksja i strata są odczytami orientacyjnymi, nie dowodem zdolności modelu na nowych danych.

Zakończony trening to nie ocena rozmowy.

Saga 3B przeszła pełny trening według planu fazy D. Liczby na tej stronie opisują trening i model bazowy. Nie są oceną jakości rozmowy ani przydatności modelu w konkretnych zadaniach. Próba wydajnościowa 3B jest osobnym pomiarem.

Skalowanie dotyczy naszej konfiguracji.

Linia idealna jest obliczana względem pierwszego punktu pomiarowego na 4 GPU. Nie pokazujemy niezmierzonego punktu dla pojedynczej karty.

Historia pozostaje historią.

Krzywa, ocena i próbki 33M pochodzą z lokalnego etapu prac. Daty przy fazach i zadaniach odnoszą się do raportu. Odświeżenie strony nie uruchamia obliczeń.

Porozmawiaj
z Sagą 3B.

Wersja testowa. Dostęp z kodem.

Otwórz rozmowę