Tokenizer i dane
Własny tokenizer BPE, pipeline czyszczenia, podział danych oraz raport jakości.
Fabryka AI · edukacja techniczna · po polsku
Przez 12 tygodni rozwijasz jeden mały polski model: przygotowujesz dane, piszesz architekturę, trenujesz, oceniasz, dostrajasz i wdrażasz. Każdy etap kończy się działającym artefaktem.
# tydzień 6 · własna pętla treningowa
model = GPT(n_layer=6, n_head=6, n_embd=384)
params = 10.6M # policzone, nie zgadnięte
step 4000 · loss 1.83 · „kot siedział na”
step 5000 · loss 1.61 · „parapecie i patrzył”
# loss spada. rozumiesz każdą macierz.
01 · rezultat
Program prowadzi przez cały łańcuch pracy. Rezultatem nie jest sam certyfikat, lecz kod, decyzje, pomiary i model, który potrafisz wyjaśnić.
Własny tokenizer BPE, pipeline czyszczenia, podział danych oraz raport jakości.
Mały GPT napisany i wytrenowany od podstaw, z manifestem konfiguracji i checkpointami.
Held-out loss, próbki generacji i mini-benchmark z opisanym protokołem oraz ograniczeniami.
Dostrojenie, kwantyzacja i lokalne API z pomiarem szybkości oraz kosztu inferencji.
02 · program
Każdy tydzień rozwija ten sam projekt. Kliknij moduł, aby zobaczyć temat i artefakt końcowy.
Byte-level BPE, kompresja i pułapki polskiej morfologii.
Artefakt: własny tokenizer i raport porównawczy.Źródła, licencje, filtrowanie jakości, MinHash/LSH, PII i deterministyczne splity.
Artefakt: pipeline danych z manifestem pochodzenia.Od zliczeń do sieci, embeddingi, backprop i negative log likelihood.
Artefakt: bigram i MLP generujące pierwsze próbki.Self-attention krok po kroku, maska przyczynowa, multi-head i pozycje.
Artefakt: single-head attention bez gotowego modułu.Bloki transformera, pre-norm, RMSNorm, SwiGLU, GQA i świadome decyzje architektoniczne.
Artefakt: model robiący pełny forward pass.Batching, AdamW, harmonogram LR, mixed precision, checkpointing i diagnostyka lossa.
Artefakt: wytrenowany checkpoint i karta przebiegu.Scaling laws, budżet tokenów, multi-GPU i ekonomia treningu.
Artefakt: policzony plan większego eksperymentu.Held-out loss, zadania downstream, benchmarki polskie i ryzyko kontaminacji.
Artefakt: własny mały benchmark z kartą metodologiczną.Dane instrukcyjne, chat templates i adaptacja niskiego rzędu.
Artefakt: porównanie modelu przed i po dostrojeniu.Dane preferencyjne, funkcja celu DPO i typowe błędy alignowania małych modeli.
Artefakt: kontrolowany eksperyment DPO.KV-cache, batching, kwantyzacja, llama.cpp i pomiar tokenów na sekundę.
Artefakt: lokalne API z benchmarkiem wydajności.Projekt end-to-end: dane, trening lub dostrojenie, ewaluacja i wdrożenie.
Artefakt: publiczne demo i dokumentacja decyzji.03 · metoda
Nie obiecujemy wyniku bez pomiaru. Ustalamy rytm, kryteria artefaktu i sposób review — a postęp jest widoczny w kodzie.
Zajęcia porządkują temat, sesja praktyczna uruchamia warsztat, a zadanie kończy się sprawdzalnym plikiem, kodem lub wynikiem.
Liczy się nie tylko to, czy kod działa. Opisujesz założenia, porównujesz warianty i bronisz wniosków na podstawie pomiaru.
Źródła danych, konfiguracje, checkpointy, metryki i ograniczenia pozostają w repo. Da się odtworzyć drogę do wyniku.
04 · ekosystem
LLM od zera jest ścieżką edukacyjną Fabryka AI. Po kursie nie kończy się mapa — można wejść w otwartą pracę Slayera, korzystać z dyscypliny ewaluacyjnej CodeSOTA i współpracować na Discordzie.
Buduje polskie produkty, infrastrukturę i badania AI.
fabryka.ai ↗ 02 · laboratoriumSlayerOtwarte laboratorium modeli, danych i eksperymentów.
slayer.fabryka.ai ↗ 03 · pomiarCodeSOTAŹródła, protokoły i rygor oceny wyników.
codesota.com ↗ 04 · warsztatDiscordCodzienna rozmowa, pytania i współpraca społeczności.
dołącz ↗05 · dla kogo
06 · nabór
Opowiedz, skąd startujesz i co chcesz zbudować. Kacper odpowie osobiście i przed zapisem potwierdzi aktualny termin, format, warunki oraz wymagany nakład pracy.
07 · FAQ
Wystarczą podstawy Pythona i gotowość do pracy z matematyką na poziomie licealnym. PyTorch i transformatory budujemy krok po kroku.
Nie na każdy etap. Warunki dostępu do compute dla aktualnej edycji są potwierdzane przed zapisem — nie zakładamy ich w ciemno na stronie.
Program zakłada zajęcia oraz regularną pracę własną nad kodem. Realny zakres godzin potwierdzamy przy rozmowie, zależnie od punktu startowego.
Repo projektu, tokenizer, konfiguracje, checkpointy, wyniki ewaluacji, dokumentacja decyzji i działający endpoint demonstracyjny.
LLM od zera jest programem edukacyjnym Fabryka AI. Slayer jest otwartym laboratorium, w którym absolwenci mogą dalej rozwijać badania i artefakty.