Fabryka AI · edukacja techniczna · po polsku

Zbuduj model językowy. Od tokenizera po API.

Przez 12 tygodni rozwijasz jeden mały polski model: przygotowujesz dane, piszesz architekturę, trenujesz, oceniasz, dostrajasz i wdrażasz. Każdy etap kończy się działającym artefaktem.

Rys. 01 · twój model, nie czarna skrzynka

# tydzień 6 · własna pętla treningowa

model = GPT(n_layer=6, n_head=6, n_embd=384)

params = 10.6M # policzone, nie zgadnięte

step 4000 · loss 1.83 · „kot siedział na”

step 5000 · loss 1.61 · „parapecie i patrzył”

# loss spada. rozumiesz każdą macierz.

12
tygodni wspólnej pracy
01
model rozwijany od początku do końca
12
kolejnych artefaktów technicznych
PL
dane, język i kontekst badawczy

01 · rezultat

Nie oglądasz budowy modelu. Zostawiasz repo, które działa.

Program prowadzi przez cały łańcuch pracy. Rezultatem nie jest sam certyfikat, lecz kod, decyzje, pomiary i model, który potrafisz wyjaśnić.

01

Tokenizer i dane

Własny tokenizer BPE, pipeline czyszczenia, podział danych oraz raport jakości.

02

Model bazowy

Mały GPT napisany i wytrenowany od podstaw, z manifestem konfiguracji i checkpointami.

03

Ewaluacja

Held-out loss, próbki generacji i mini-benchmark z opisanym protokołem oraz ograniczeniami.

04

Wdrożenie

Dostrojenie, kwantyzacja i lokalne API z pomiarem szybkości oraz kosztu inferencji.

02 · program

Jeden model. Pięć warstw pracy.

Każdy tydzień rozwija ten sam projekt. Kliknij moduł, aby zobaczyć temat i artefakt końcowy.

Blok IFundamenty
01TokenizerBPE · polszczyzna

Byte-level BPE, kompresja i pułapki polskiej morfologii.

Artefakt: własny tokenizer i raport porównawczy.
02Danejakość · deduplikacja

Źródła, licencje, filtrowanie jakości, MinHash/LSH, PII i deterministyczne splity.

Artefakt: pipeline danych z manifestem pochodzenia.
03Język jako prawdopodobieństwobigram · MLP

Od zliczeń do sieci, embeddingi, backprop i negative log likelihood.

Artefakt: bigram i MLP generujące pierwsze próbki.
Blok IITransformer
04AttentionQ · K · V

Self-attention krok po kroku, maska przyczynowa, multi-head i pozycje.

Artefakt: single-head attention bez gotowego modułu.
05Pełna architektura GPTresidual · norm · MLP

Bloki transformera, pre-norm, RMSNorm, SwiGLU, GQA i świadome decyzje architektoniczne.

Artefakt: model robiący pełny forward pass.
06Treningoptymalizacja · debug

Batching, AdamW, harmonogram LR, mixed precision, checkpointing i diagnostyka lossa.

Artefakt: wytrenowany checkpoint i karta przebiegu.
Blok IIISkala i pomiar
07Skalowaniecompute · DDP

Scaling laws, budżet tokenów, multi-GPU i ekonomia treningu.

Artefakt: policzony plan większego eksperymentu.
08Ewaluacjaprotokół · PL

Held-out loss, zadania downstream, benchmarki polskie i ryzyko kontaminacji.

Artefakt: własny mały benchmark z kartą metodologiczną.
Blok IVOd base do instruct
09SFT, LoRA i QLoRAdostrajanie

Dane instrukcyjne, chat templates i adaptacja niskiego rzędu.

Artefakt: porównanie modelu przed i po dostrojeniu.
10Preferencje i DPOalignment

Dane preferencyjne, funkcja celu DPO i typowe błędy alignowania małych modeli.

Artefakt: kontrolowany eksperyment DPO.
Blok VProdukcja
11InferencjaGGUF · API

KV-cache, batching, kwantyzacja, llama.cpp i pomiar tokenów na sekundę.

Artefakt: lokalne API z benchmarkiem wydajności.
12Capstonedemo · publikacja

Projekt end-to-end: dane, trening lub dostrojenie, ewaluacja i wdrożenie.

Artefakt: publiczne demo i dokumentacja decyzji.

03 · metoda

Rygor bez marketingowych procentów.

Nie obiecujemy wyniku bez pomiaru. Ustalamy rytm, kryteria artefaktu i sposób review — a postęp jest widoczny w kodzie.

Co tydzień

Teoria → praktyka → artefakt

Zajęcia porządkują temat, sesja praktyczna uruchamia warsztat, a zadanie kończy się sprawdzalnym plikiem, kodem lub wynikiem.

Review

Człowiek czyta decyzje

Liczy się nie tylko to, czy kod działa. Opisujesz założenia, porównujesz warianty i bronisz wniosków na podstawie pomiaru.

Pamięć projektu

Manifesty zamiast magii

Źródła danych, konfiguracje, checkpointy, metryki i ograniczenia pozostają w repo. Da się odtworzyć drogę do wyniku.

04 · ekosystem

Jedna droga: nauka, praca badawcza, dowody.

LLM od zera jest ścieżką edukacyjną Fabryka AI. Po kursie nie kończy się mapa — można wejść w otwartą pracę Slayera, korzystać z dyscypliny ewaluacyjnej CodeSOTA i współpracować na Discordzie.

05 · dla kogo

Ambitny start. Jasne wymagania.

To ma sens, jeśli

  • znasz podstawy Pythona;
  • chcesz rozumieć modele, nie tylko wywoływać API;
  • możesz pracować systematycznie nad jednym repo;
  • interesuje cię polski język, open source i research.

To nie jest dobry moment, jeśli

  • szukasz krótkiego kursu promptowania;
  • nie chcesz pisać ani czytać kodu;
  • nie masz czasu na regularną pracę własną;
  • potrzebujesz gwarantowanego wyniku bez eksperymentów.

06 · nabór

Najpierw krótka rozmowa. Potem świadoma decyzja.

Opowiedz, skąd startujesz i co chcesz zbudować. Kacper odpowie osobiście i przed zapisem potwierdzi aktualny termin, format, warunki oraz wymagany nakład pracy.

Status
Nabór przez rozmowę
Kontakt
Telefon opcjonalny
Odpowiedź
E-mail lub rozmowa

Bez newslettera. Dane służą wyłącznie do obsługi zgłoszenia i rozmowy o programie.

07 · FAQ

Zanim aplikujesz.

Ile muszę umieć na starcie?

Wystarczą podstawy Pythona i gotowość do pracy z matematyką na poziomie licealnym. PyTorch i transformatory budujemy krok po kroku.

Czy potrzebuję własnego GPU?

Nie na każdy etap. Warunki dostępu do compute dla aktualnej edycji są potwierdzane przed zapisem — nie zakładamy ich w ciemno na stronie.

Ile czasu potrzeba tygodniowo?

Program zakłada zajęcia oraz regularną pracę własną nad kodem. Realny zakres godzin potwierdzamy przy rozmowie, zależnie od punktu startowego.

Co dokładnie zostaje po programie?

Repo projektu, tokenizer, konfiguracje, checkpointy, wyniki ewaluacji, dokumentacja decyzji i działający endpoint demonstracyjny.

Czy to kurs Fabryka AI czy Slayera?

LLM od zera jest programem edukacyjnym Fabryka AI. Slayer jest otwartym laboratorium, w którym absolwenci mogą dalej rozwijać badania i artefakty.