DeepSeek zaczyna widzieć: V4 Flash Vision czyta obrazy, wagi na licencji MIT
DeepSeek wydał pierwszy multimodalny model w rodzinie V4. V4 Flash Vision widzi zrzuty ekranu i wykresy, kosztuje 0,22/0,66 USD i ma otwarte wagi MIT.

DeepSeek wydał 31 sierpnia DeepSeek V4 Flash Vision, pierwszy multimodalny model w swojej rodzinie V4. Nowość w jednym zdaniu: ten DeepSeek nie tylko czyta tekst, ale też widzi obraz. Pokażesz mu zrzut ekranu z błędem, makietę interfejsu albo wykres, a on to zrozumie, zamiast prosić o opis słowami. Model jest tani w API, wychodzi z otwartymi wagami na licencji MIT, a DeepSeek oznaczył go jako eksperymentalny.
Co dokładnie się zmienia
Dotąd modele DeepSeeka pracowały wyłącznie na tekście. V4 Flash Vision dokłada rozumienie obrazu, i to jest cała istota tej premiery. To model o architekturze mixture-of-experts, liczący około 305 miliardów parametrów, z oknem kontekstu sięgającym miliona tokenów.
Wyniki z karty modelu:
- Terminal-Bench 2.1: 83,9 punktu, zadania wykonywane w terminalu.
- DeepSWE: 59,3 punktu.
DeepSeek podkreśla, że dołożenie rozumienia obrazu nie popsuło wyników w zadaniach tekstowych, czyli model nie stał się gorszym programistą po to, żeby nauczyć się patrzeć. Jak zawsze przy benchmarkach od producenta, traktuj te liczby jako punkt startu do własnego testu.
Multimodalność w modelu do kodowania brzmi abstrakcyjnie, dopóki nie zobaczysz jej w działaniu. W praktyce chodzi o to, że model rozumie zawartość obrazka tak samo, jak rozumie tekst. Widzi, że przycisk nachodzi na inny element, odczytuje komunikat o błędzie na zrzucie ekranu i potrafi powiązać wykres z liczbami, o które pytasz. Dla kogoś, kto buduje interfejs, to różnica między żmudnym opisywaniem problemu a pokazaniem go wprost.
Słowo „eksperymentalny” warto potraktować poważnie
DeepSeek nie bez powodu nazwał ten model eksperymentalnym. To znak, że firma sprawdza nowy kierunek, a nie oddaje gotowego, stabilnego konia roboczego do codziennej pracy. Dla ciebie oznacza to prostą zasadę: świetnie nadaje się do testów i zabawy z obrazem, ale nie stawiałbym na nim aplikacji, od której zależy twój przychód, dopóki nie doczeka się stabilnej wersji. O przejściu DeepSeeka na nową generację V4 pisaliśmy szerzej.
Ceny i dostępność z Polski
W API model kosztuje 0,22 USD na wejściu i 0,66 USD na wyjściu za milion tokenów. Dla porównania jego tekstowy brat, DeepSeek V4 Flash, jest jeszcze tańszy, bo kosztuje 0,075 USD na wejściu i 0,15 USD na wyjściu. Rozumienie obrazu ma więc swoją cenę, ale i tak mówimy o stawkach, które są ułamkiem tego, co biorą czołowe modele zamknięte za tę samą funkcję. Model jest dostępny między innymi przez OpenRouter, więc podłączysz go z Unii Europejskiej bez kombinowania.
Warto pamiętać o tym, o czym pisaliśmy przy każdym chińskim modelu: dane wysyłane do oficjalnego API DeepSeeka trafiają na serwery w Chinach. Otwarte wagi na licencji MIT dają jednak furtkę. Przy wrażliwym projekcie ten sam model można uruchomić poza oficjalnym API, u dostawcy, któremu ufasz, albo na własnej infrastrukturze.
Co to znaczy dla vibe codingu
Tani model, który rozumie obraz, to konkretna wygoda dla osoby budującej aplikacje. Zamiast opisywać słowami, co jest nie tak z wyglądem strony, wklejasz zrzut ekranu i pytasz wprost. Zamiast tłumaczyć układ makiety, pokazujesz ją. To skraca drogę od pomysłu do poprawki, zwłaszcza przy pracy nad interfejsem, gdzie słowa i tak nie oddają tego, co widać.
Trzeba tylko trzymać w głowie dwie rzeczy. Po pierwsze, to wersja eksperymentalna, więc do poważnego projektu lepiej poczekać na stabilną. Po drugie, multimodalność robi się właśnie standardem, a nie luksusem. DeepSeek dołącza do grona modeli, które widzą obraz i kosztują grosze, a dla twórcy oznacza to, że możliwość pokazania modelowi zrzutu ekranu przestaje być czymś, za co trzeba dopłacać czołowej stawki.
Kierunek jest wyraźny. To, co jeszcze niedawno było wyróżnikiem najdroższych, zamkniętych modeli, staje się bazowym wyposażeniem także tanich modeli z otwartymi wagami. Dla osoby, która buduje aplikacje bez dużego budżetu, to dobra wiadomość, bo daje dostęp do funkcji realnie skracającej pracę nad wyglądem aplikacji, i to w cenie liczonej w groszach za milion tokenów.
Opanuj AI‑coding w 5 minut. W każdy poniedziałek.
Konkretne premiery, analizy cen i jeden trik, który przyspieszy Twoją pracę. Po polsku, bez żargonu, prosto na maila.