GLM-5.3 Flash: tani, multimodalny i z otwartymi wagami, których pełny 5.3 nie dostał
Z.ai wydało GLM-5.3 Flash: 320 mld parametrów, pierwszy multimodalny model w serii, wagi na licencji MIT i API po 0,075/0,25 USD za milion tokenów.

Z.ai wydało pod koniec sierpnia GLM-5.3 Flash, tańszy i szybszy wariant GLM-5.3. Model robi trzy rzeczy naraz, które rzadko idą w parze: jest pierwszym natywnie multimodalnym modelem w serii GLM-5, kosztuje w API grosze, i wychodzi z otwartymi wagami na licencji MIT. Ta ostatnia rzecz jest najciekawsza, bo pełny GLM-5.3 przy swojej premierze wag właśnie nie dostał.
Liczby, które podaje Z.ai
GLM-5.3 Flash to model o architekturze mixture-of-experts: 320 miliardów parametrów łącznie, z czego przy jednym zapytaniu aktywuje się około 18 miliardów. Ta różnica między łączną a aktywną liczbą parametrów jest tu celem, a nie przypadkiem. Im mniej parametrów pracuje przy pojedynczym zapytaniu, tym tańszy i szybszy jest każdy token, i to właśnie odróżnia wariant Flash od pełnego 5.3, który liczył 743 miliardy parametrów. Model obsługuje okno kontekstu sięgające miliona tokenów.
Wyniki podane na karcie modelu:
- Terminal-Bench 2.1: 84,3 punktu, czyli mocny rezultat w zadaniach agentowych wykonywanych w terminalu.
- DeepSWE: 63,4 punktu.
- Z.ai deklaruje, że model „zbliża się do Claude Opus 4.8” w kodowaniu i zadaniach agentowych, przy ułamku ceny.
Jak zawsze przy benchmarkach od producenta: to liczby z własnego testu firmy, dobre jako punkt startu, nie jako niezależny wyrok. Ale kierunek jest jasny i zgodny z tym, co widać w cenniku.
Wagi, których pełny GLM-5.3 nie dostał
Tu jest najciekawszy zwrot. Kiedy opisywaliśmy premierę pełnego GLM-5.3, Z.ai wstrzymało publikację jego wag, bo model okazał się w testach nieoczekiwanie skuteczny w znajdowaniu luk bezpieczeństwa w cudzym kodzie. „Otwarty” model, którego wag nie było skąd pobrać, to była nowa i niewygodna sytuacja.
Wariant Flash podchodzi do tego inaczej. Wychodzi od razu z wagami na licencji MIT, dostępnymi do pobrania od ręki. Osoba, która chce uniezależnić się od jednego dostawcy i uruchomić model u siebie albo u innego dostawcy, przy Flashu może to zrobić, a przy pełnym 5.3 na razie nie mogła.
„Flash” nie znaczy „odpalę to na laptopie”
Nazwa myli, więc trzeba to powiedzieć wprost. „Flash” u Z.ai, podobnie jak u innych producentów, oznacza „tańszy do serwowania”, a nie „mały”. Wagi GLM-5.3 Flash zapisane w formacie FP8 zajmują około 321 gigabajtów, a wariant w wyższej precyzji jeszcze dwa razy tyle. To wciąż model na serwerownię z wieloma kartami graficznymi, nie na domowy komputer. Otwarte wagi dają tu swobodę wyboru dostawcy i możliwość audytu, a nie realną opcję uruchomienia na własnym biurku.
Ceny i abonament
W API model kosztuje 0,075 USD na wejściu i 0,25 USD na wyjściu za milion tokenów. Dla porównania pełny GLM-5.3 to 1,4 USD na wejściu, czyli Flash jest na wejściu mniej więcej osiemnaście razy tańszy. Z.ai wpina go też w abonament GLM Coding Plan, gdzie ma trzykrotnie wyższy limit niż pełny 5.3 oraz 50 procent zniżki poza godzinami szczytu i w weekendy. Przy tak niskiej stawce za token subskrypcja zaczyna się opłacać dopiero przy naprawdę dużym i regularnym zużyciu, więc na start rozliczenie za realne zapytania będzie dla większości tańsze.
Co to znaczy dla vibe codingu
GLM-5.3 Flash to kolejny dowód na to, że tanie chińskie modele do kodowania gonią zamkniętą czołówkę szybciej, niż sugerowałaby różnica w cenniku. Za grosze na wejściu i wyjściu dostajesz model, który w testach zbliża się do topowych rywali, obsługuje milion tokenów kontekstu i dodatkowo widzi obraz, więc pokażesz mu zrzut ekranu interfejsu, a nie tylko go opiszesz. Dla osoby budującej aplikacje bez zaplecza programistycznego to niższy rachunek za to samo zadanie, o ile nie przeszkadza jej, że dane wysyłane do oficjalnego API trafiają na serwery w Chinach. Otwarte wagi dają tu furtkę: przy naprawdę wrażliwym projekcie ten sam model można uruchomić poza chińskim API, u dostawcy, któremu ufasz.
Warto też zobaczyć ten model w szerszym ciągu. Poprzednik z tej półki, GLM-5.2, był już tani i szybki, a Flash dokłada do tego rozumienie obrazu i jeszcze niższą stawkę. To pokazuje tempo, w jakim chińskie laboratoria schodzą z cenami i dorzucają funkcje, które wcześniej były zarezerwowane dla droższych, zamkniętych modeli.
Opanuj AI‑coding w 5 minut. W każdy poniedziałek.
Konkretne premiery, analizy cen i jeden trik, który przyspieszy Twoją pracę. Po polsku, bez żargonu, prosto na maila.