Qwen3.8 Flash Next: milion tokenów kontekstu i tylko 6 mld aktywnych parametrów
Qwen wydał Qwen3.8 Flash Next: 180 mld parametrów, ale 6 mld aktywnych, kontekst do miliona tokenów, multimodalny i tani w API po 0,15/0,47 USD.

Qwen, laboratorium AI Alibaby, wydał pod koniec sierpnia Qwen3.8 Flash Next, model do kodowania, który stawia na dwie rzeczy naraz: bardzo długi kontekst i bardzo niski koszt tokenów. Na papierze to model 180-miliardowy, ale przy jednym zapytaniu aktywuje się z niego tylko około 6 miliardów parametrów. Dzięki temu w API kosztuje grosze, obsługuje do miliona tokenów naraz i dodatkowo rozumie obraz, a nie tylko tekst.
Liczby, które podaje Qwen
To model o architekturze mixture-of-experts, czyli takiej, w której cała wiedza jest podzielona między setki „ekspertów”, a przy każdym zapytaniu uruchamia się tylko kilku z nich. W tym wypadku ekspertów jest 512, a aktywnych na token około 6 miliardów z całkowitych 180. Kontekst startuje z 262 tysięcy tokenów i rozszerza się do miliona.
Wyniki z karty modelu:
- SWE-bench Pro: 62,5 punktu, test rozwiązywania realnych zgłoszeń z repozytoriów kodu.
- LiveCodeBench v6: 91,9 punktu.
- DeepSWE 1.1: 58,7 punktu.
- GPQA Diamond: 91,7 punktu, zadania wymagające rozumowania.
To liczby producenta, więc jak przy każdym benchmarku traktuj je jako zaproszenie do własnego testu, nie jako pewnik. Model dołącza do wcześniej opisywanej przez nas rodziny Qwen z otwartymi wagami.
Dlaczego „6 miliardów aktywnych” to sedno
Cała sztuczka tego modelu siedzi w różnicy między 180 a 6. Płacisz i czekasz mniej więcej tyle, ile wynikałoby z 6 miliardów aktywnych parametrów, a jakość dostajesz bliżej tej, jakiej spodziewałbyś się po znacznie większym modelu. To właśnie dlatego tokeny są tanie, a odpowiedzi szybkie, mimo że sam model jest duży. Qwen dorzucił do tego kilka własnych mechanizmów przyspieszających pracę modelu przy długim kontekście.
Jest jednak pułapka w nazwie, o której warto wiedzieć. „Flash” nie oznacza „mały” ani „odpalę to u siebie”. Wagi w formacie FP8 zajmują około 180 gigabajtów, a w wyższej precyzji dwa razy tyle. To model do uruchamiania w chmurze albo na klastrze GPU, nie na domowym sprzęcie. Wagi są co prawda dostępne do pobrania, ale na własnej licencji społecznościowej Qwen, a nie na w pełni swobodnej licencji typu MIT.
Ceny i dostępność z Polski
W API model kosztuje 0,15 USD na wejściu i 0,47 USD na wyjściu za milion tokenów. Ważny szczegół dla nas: Qwen udostępnia go przez międzynarodowy endpoint chmury (dashscope-intl) oraz przez OpenRouter, więc jest dostępny także z Unii Europejskiej. Endpoint mówi zarówno protokołem OpenAI, jak i Anthropic, co oznacza, że w wielu narzędziach podłączysz go jako zamiennik bez przepisywania integracji.
W praktyce znaczy to, że jeśli twoje narzędzie pozwala podać własny endpoint i klucz, Qwena podłączysz jako tańszy zamiennik dotychczasowego modelu i sprawdzisz go na własnych zadaniach, zanim zdecydujesz, czy przy nim zostać. Ta swoboda podmiany modelu bez przebudowy projektu jest dla twórcy równie ważna jak sama cena.
Co to znaczy dla vibe codingu
Milion tokenów kontekstu przy tak niskiej cenie to konkretna korzyść dla osoby, która buduje aplikację. Możesz wrzucić modelowi cały projekt naraz, a nie karmić go plik po pliku, i nie zapłacisz za to fortuny. Multimodalność dokłada drugą wygodę: pokazujesz zrzut ekranu z błędem albo makietę interfejsu, zamiast opisywać je słowami. To dobre narzędzie do zadań agentowych, w których model musi utrzymać wątek przez wiele kroków i wiele plików.
W praktyce długi kontekst zmienia sposób pracy. Zamiast tłumaczyć modelowi przy każdym poleceniu, jak zbudowana jest twoja aplikacja, wrzucasz mu ją raz i przez kolejne kroki nie musisz się powtarzać. Model pamięta strukturę projektu, wcześniejsze decyzje i to, co już zostało napisane, więc rzadziej podsuwa poprawki kłócące się z resztą kodu. Przy krótkim kontekście każda taka rozmowa zaczyna się od zera, a to właśnie tam najczęściej rodzą się błędy z niezrozumienia całości.
Zastrzeżenie jest to samo, co przy innych chińskich modelach. Dane wysyłane do oficjalnego API trafiają na serwery poza Unią, więc do wrażliwych projektów lepiej rozważyć uruchomienie modelu u zaufanego dostawcy, skoro wagi są dostępne. Dla większości prostych aplikacji tani, pojemny i szybki model w API będzie jednak wygodniejszym i tańszym wyborem niż walka z własną serwerownią.
Opanuj AI‑coding w 5 minut. W każdy poniedziałek.
Konkretne premiery, analizy cen i jeden trik, który przyspieszy Twoją pracę. Po polsku, bez żargonu, prosto na maila.