GPT-5.6 dostępny dla wszystkich: Sol odbiera Claude'owi koronę w kodowaniu
GPT-5.6 wyszedł z zamkniętego podglądu. Sol ma najwyższy Coding Index w naszym rankingu, ale to tańsza o połowę Terra jest tu prawdziwym zwycięzcą.

GPT-5.6 jest już ogólnie dostępny. OpenAI otworzyło 9 lipca 2026 wszystkie trzy warianty, czyli Sol, Terrę i Lunę, po tygodniach zamkniętego podglądu dla wybranych partnerów. Odpowiedź na pytanie „jak wypada w testach“ jest ciekawsza, niż sugeruje sama premiera: GPT-5.6 Sol przejmuje prowadzenie w kodowaniu, ale najlepszym zakupem z tej trójki wcale nie jest flagowiec.
Sol na szczycie, ale przewagą kilku dziesiątych
Zacznijmy od twardych liczb. Według Artificial Analysis (dane pobrane 10 lipca 2026) Sol osiąga Coding Index 77,4, czyli więcej niż Claude Fable 5 z wynikiem 76,5. To pierwszy raz od czerwca, kiedy Anthropic traci pierwsze miejsce w naszym rankingu kodowania. W wariancie z najwyższym wysiłkiem rozumowania Sol dobija nawet do 78,3.
Przewaga jest jednak wąska i nie rozciąga się na wszystko. W indeksie inteligencji, który mierzy szeroką wiedzę i rozumowanie, a nie sam kod, Fable 5 nadal prowadzi: 59,9 wobec 58,9 u Sola. Podobnie na trudnym teście wiedzy eksperckiej Humanity’s Last Exam, gdzie Claude notuje 53,3 procent, a Sol 47,2 procent. Innymi słowy: OpenAI wygrało konkurencję w pisaniu kodu, nie w myśleniu w ogóle.
Na benchmarku agentowym Terminal-Bench 2.1, który sprawdza pracę modelu w prawdziwym terminalu przez wiele kroków, Sol uzyskuje 88,0 procent wobec 84,6 procent u Fable 5. To akurat różnica, którą przy długiej sesji z agentem realnie się czuje.
Terra to model, po który sięgniesz naprawdę
Tu robi się najciekawiej. GPT-5.6 Terra, czyli środkowy wariant, notuje Coding Index 76,7. To zaledwie 0,7 punktu poniżej flagowego Sola i wciąż powyżej Claude Fable 5. Przy tym kosztuje 2,50 USD za milion tokenów wejściowych i 15 USD za wyjściowe, podczas gdy Sol chce 5 i 30 USD, a Fable 5 aż 10 i 50 USD.
Policzmy to wprost. Za pracę, która na Fable 5 kosztuje cię 50 dolarów, na Terrze zapłacisz 15. Dostajesz przy tym wyższy wynik w kodowaniu. Terra generuje też około 150 tokenów na sekundę wobec 87 u Sola, więc jest po prostu szybsza.
Haczyk widać w indeksie inteligencji: Terra ma 55,0, wyraźnie mniej niż 58,9 u Sola. Oszczędność nie jest darmowa, tylko przesunięta poza kodowanie. Jeśli twoje zadanie to pisanie i refaktoryzacja kodu, Terra jest rozsądnym domyślnym wyborem. Jeśli model ma rozumować nad projektem, planować architekturę albo analizować dziedzinę, którą słabo znasz, różnica zacznie boleć.
Luna, czyli najwięcej jakości za dolara
GPT-5.6 Luna kosztuje 1 i 6 USD za milion tokenów i osiąga Coding Index 71,4. To poziom porównywalny z Claude Sonnet 5, przy niższej cenie i prędkości 231 tokenów na sekundę, najwyższej w całej trójce.
Przeliczając Coding Index na cenę mieszaną, Luna daje około 32 punkty za każdego dolara i jest pod tym względem najefektywniejszym modelem w naszym zestawieniu. Nadaje się tam, gdzie generujesz mnóstwo tokenów w tle: masowe, powtarzalne operacje, długie sesje agentowe, praca z ciasnym budżetem.
Wszystkie trzy warianty mają identyczne okno kontekstu 1,05 miliona tokenów i limit 128 tysięcy tokenów na pojedynczą odpowiedź. Wybór wariantu nie oznacza więc rezygnacji z długiego kontekstu, tylko z jakości rozumowania.
Pułapka, o której nie mówi żadna tabela
Tu jest rzecz, którą trzeba znać, zanim wrzucisz całe repozytorium do kontekstu. Na stronach wszystkich trzech modeli OpenAI umieściło zdanie: „zapytania z ponad 272 tysiącami tokenów wejściowych są rozliczane po podwójnej stawce wejścia i półtorakrotnej stawce wyjścia za całe zapytanie“.
Kluczowe są dwa słowa: za całe zapytanie. Nie płacisz podwójnie za tokeny powyżej progu, tylko za wszystkie. Przekroczenie 272 tysięcy tokenów o jeden token zmienia cennik całej rozmowy. W praktyce stawki wyglądają wtedy tak:
- Sol: 10 USD wejście i 45 USD wyjście zamiast 5 i 30.
- Terra: 5 USD i 22,50 USD zamiast 2,50 i 15.
- Luna: 2 USD i 9 USD zamiast 1 i 6.
To odwraca część rachunków z poprzedniego akapitu. Terra przy długim kontekście kosztuje na wyjściu 22,50 USD, czyli więcej niż zwykła stawka Sola. Okno 1,05 miliona tokenów brzmi wspaniale w specyfikacji, ale próg podwyżki leży na jednej czwartej jego długości, a cała reszta okna jest już objęta wyższą stawką. Jeśli pracujesz na dużym projekcie, pilnowanie, co ląduje w kontekście, przestaje być higieną, a staje się pozycją w budżecie.
Ukryty koszt: model, który długo milczy
Jest jeszcze liczba, której nie znajdziesz w materiałach OpenAI. W trybie najwyższego wysiłku mediana czasu do pierwszego tokenu wynosi u Sola około 77 sekund, a u Terry nawet 110 sekund. Model przez ten czas myśli, zanim napisze cokolwiek.
Przy zadaniu, które i tak trwa kwadrans, to nie ma znaczenia. Przy krótkim pytaniu w edytorze różnica między czekaniem dwóch sekund a dwóch minut decyduje o tym, czy w ogóle zechcesz z modelu korzystać. To argument za tym, żeby najwyższy tryb rozumowania włączać świadomie, a nie trzymać go włączonego na stałe.
Co mówią użytkownicy
Wątek o premierze na Hacker News zebrał ponad 1300 punktów i blisko 920 komentarzy, a nastroje są mocno podzielone. Najcieplej przyjęto Terrę: pojawia się określenie „strzał w dziesiątkę“ dla modelu środkowego, który dorównuje Fable 5 na testach agentowych, a kosztuje mniej niż API Opusa.
Sceptycy uderzają w dwa punkty. Pierwszy to zmęczenie tempem wydań, podsumowane złośliwie jako zmienianie cyfry po kropce, żeby utrzymać się w nagłówkach. Drugi dotyczy pieniędzy: ceny modeli czołowych nie spadają, a chińskie modele z otwartymi wagami zbliżają się do zera, więc część komentujących pyta wprost, jak długo warto płacić stawki frontieru. Powtarza się też praktyczne pytanie użytkowników Claude Code, czy przesiadka na Codeksa dziś w ogóle coś zmienia.
Co to znaczy dla Ciebie
Praktyczna heurystyka jest prosta. Terra to twój model domyślny do kodowania, bo daje jakość flagowca za ułamek jego ceny. Po Sola sięgaj wtedy, gdy zadanie naprawdę wymaga rozumowania, a nie tylko generowania kodu. Lunę rezerwuj na masową robotę w tle.
Ceny podane wyżej to stawki API. Zanim przestawisz się na nowy wariant, sprawdź realny koszt na własnym ruchu w kalkulatorze kosztów API. Nową trójkę wdrożono błyskawicznie: 9 lipca dodał ją GitHub Copilot, tego samego dnia Cursor, gdzie Sol notuje 67,2 procent na firmowym teście CursorBench 3.2, a OpenAI odnotowało przyspieszenie obsługi komputera w Codeksie.
Nasza karta GPT-5.6 Sol oraz karty pozostałych dwóch wariantów są już zaktualizowane o świeże benchmarki i ceny. W kolejnym kroku sprawdzimy tę trójkę w boju na polskim projekcie, ze szczególnym naciskiem na to, jak szybko rachunek rośnie po przekroczeniu progu długiego kontekstu.
Opanuj AI‑coding w 5 minut. W każdy poniedziałek.
Konkretne premiery, analizy cen i jeden trik, który przyspieszy Twoją pracę. Po polsku, bez żargonu, prosto na maila.