Codex CLI obiecywał większe okno kontekstu, niż dawał. Poprawka ścina 100 tysięcy tokenów
Codex CLI miał zapisane 372 tys. tokenów kontekstu dla GPT-5.6, a usługa dawała 272 tys. Wersja 0.144.6 sprowadza dane do stanu faktycznego.

OpenAI wydało 18 lipca Codex CLI w wersji 0.144.6, a jedyna pozycja w opisie zmian brzmi jak drobiazg techniczny: skorygowano okno kontekstu modeli GPT-5.6 do 272 000 tokenów. Sprawdziliśmy, co dokładnie skorygowano, i okazało się, że to nie jest drobiazg. Narzędzie miało wcześniej zapisane 372 000 tokenów, czyli obiecywało o sto tysięcy więcej miejsca, niż usługa faktycznie dawała.
Co mówi producent
Wpis w oficjalnym changelogu Codeksa jest jednozdaniowy i mówi o odświeżeniu dołączonych instrukcji dla GPT-5.6 Sol, Terra i Luna oraz o skorygowaniu ich okien kontekstu do 272 000 tokenów.
Czego OpenAI nie mówi: jaka wartość była zapisana wcześniej. Słowo „skorygowano“ nie zdradza kierunku, a to właśnie kierunek jest tu całą historią. Wyciągnęliśmy więc katalog modeli z dwóch kolejnych wydań i porównaliśmy sami.
To nie było podniesienie, tylko obniżenie
Pobraliśmy plik models.json z tagów obu wydań w repozytorium OpenAI i liczby są jednoznaczne:
- 0.144.5: Sol, Terra i Luna mają zapisane
context_windowrówne 372 000 - 0.144.6: wszystkie trzy mają 272 000
Poprawka obniżyła zapisaną wartość o sto tysięcy tokenów, a nie ją podniosła. To zmienia całą interpretację newsa. Codex nie odblokował nikomu dodatkowego miejsca w rozmowie: przestał obiecywać miejsce, którego nigdy nie było.
Potwierdza to zgłoszenie użytkownika z 14 lipca, wciąż otwarte, którego tytuł mówi wszystko: konto Pro Lite dostaje dla Sola profil kontekstu 272 tysiące zamiast dołączonych do klienta 372 tysięcy. Autor opisuje, że po zalogowaniu narzędzie pokazywało jedną liczbę, a serwer respektował inną. Zgłoszenie ma etykiety bug, CLI i context.
Czyli: klient obiecywał 372 tysiące, usługa dawała 272 tysiące, a przez ponad tydzień rozjazd wisiał w powietrzu. Wersja 0.144.6 sprowadza metadane do stanu faktycznego.
Co udało się ustalić w zgłoszeniach
Zajrzeliśmy też do dwóch zgłoszeń, na których stoi to wydanie. Pierwsze z nich, scalone 18 lipca, przeniosło do stabilnej linii 0.144 szerszą aktualizację katalogu modeli. Drugie zawęziło ją z powrotem, bo do poprawki tej rangi nie było potrzeby ruszać reszty.
Efekt netto opisany jest w zgłoszeniu wprost: katalog różni się dokładnie w dwunastu wartościach, po cztery dla każdego z trzech wariantów GPT-5.6. Są to instrukcje bazowe, szablon instrukcji, okno kontekstu oraz maksymalne okno kontekstu. Innymi słowy, zmieniły się dwie rzeczy: tekst instrukcji, które Codex dokleja do rozmowy z tymi modelami, i zapisany rozmiar okna.
Autor drugiego zgłoszenia tłumaczy też, dlaczego cofnął resztę: wcześniejsza zmiana wprowadzała do stabilnej wersji pola, których ta wersja nie rozumie. To dobra ilustracja tego, jak wygląda ostrożne łatanie linii produkcyjnej, i przy okazji dowód, że sama poprawka jest wąska.
Sol, Terra i Luna, czyli trzy warianty jednego modelu
Skoro poprawka dotyczy trzech nazw naraz, warto wyjaśnić, czym one są, bo nazewnictwo OpenAI bywa mylące. GPT-5.6 to nie jeden model, tylko rodzina trzech wariantów różniących się mocą i ceną. Według danych w naszej porównywarce Sol kosztuje 5 i 30 USD za milion tokenów i notuje 77,4 punktu w indeksie kodowania, Terra 2,5 i 15 USD przy 76,7 punktu, a Luna 1 i 6 USD przy 71,4. Wszystkie trzy dzielą tę samą architekturę okna kontekstu, i właśnie dlatego jedna pomyłka w danych dotknęła ich naraz.
Zostaje jedna rzecz, której nie umiemy domknąć, więc stawiamy ją otwarcie. W naszej warstwie danych, zasilanej pomiarami Artificial Analysis, wszystkie trzy warianty mają okno kontekstu rzędu 1,05 miliona tokenów. Ani 372 tysiące, ani 272 tysiące do tej liczby nie pasują.
Najprawdopodobniej mówimy o różnych rzeczach: o pełnej pojemności modelu z jednej strony i o tym, ile faktycznie wydziela konkretny plan abonamentowy z drugiej. Zgłoszenie użytkownika pochodzi od kogoś na planie Pro Lite, więc limit mógł być cechą planu, a nie modelu. To jednak nasza hipoteza, a nie stanowisko OpenAI, które nigdzie tej różnicy nie tłumaczy. Zapisujemy ją jako pytanie otwarte, nie jako ustalenie.
Dlaczego rozmiar okna w ogóle ma znaczenie
Okno kontekstu to ilość tekstu, jaką model bierze pod uwagę naraz: Twoje polecenia, historia rozmowy i treść plików, które narzędzie mu podłożyło. Narzędzia takie jak Codex muszą znać tę liczbę, żeby wiedzieć, kiedy rozmowa zbliża się do granicy i trzeba ją streścić albo przyciąć.
Jeśli zapisana wartość jest za niska, narzędzie sprząta rozmowę wcześniej, niż musi. W tym przypadku było odwrotnie i to jest wariant bardziej kłopotliwy: narzędzie sądziło, że ma zapas, którego nie miało. W praktyce oznacza to pasek kontekstu pokazujący więcej wolnego miejsca, niż faktycznie zostało, i rozmowę ucinaną przez usługę wcześniej, niż wynikałoby to z tego, co widzisz na ekranie.
Zastrzeżenie: sam ten mechanizm to nasz wniosek z porównania danych i ze zgłoszenia użytkownika, a nie opis skutków podany przez OpenAI. Poza jednym zdaniem w opisie zmian producent nie wyjaśnił, co ta pomyłka realnie robiła.
Warto przy tym pamiętać, że przekroczenie progu z poprzedniej sekcji podnosi stawkę za całe zapytanie, a nie tylko za nadmiarową część. Długa rozmowa potrafi więc podrożeć skokowo, a nie stopniowo. Ile wyjdzie przy Twoim zużyciu, policzysz w kalkulatorze kosztów API.
Przy okazji: ostrzejsze wykrywanie groźnych poleceń
Dwa dni wcześniej, 16 lipca, wyszła wersja 0.144.5 z jedną zmianą wartą odnotowania. Changelog mówi o ulepszonym wykrywaniu niebezpiecznych poleceń, w tym większej liczby wymuszonych form polecenia rm, oraz o czytelniejszym uzasadnieniu, gdy narzędzie odmawia wykonania.
To ten sam kierunek, który widać dziś u konkurencji. Pisaliśmy o tym przy siedmiu poprawkach na obejścia uprawnień w Claude Code: narzędzia, które same uruchamiają polecenia w Twoim terminalu, dopiero uczą się rozpoznawać, kiedy powinny zapytać. Warto to widzieć jako proces, a nie jako listę pojedynczych łatek.
Co z tym zrobić
Jeśli używasz Codeksa w terminalu, zaktualizuj go i tyle. Żadnych zmian w konfiguracji ta poprawka nie wymaga, a po aktualizacji narzędzie po prostu lepiej wie, ile kontekstu ma do dyspozycji. Szczegóły samego narzędzia zebraliśmy na karcie Codex CLI.
Opanuj AI‑coding w 5 minut. W każdy poniedziałek.
Konkretne premiery, analizy cen i jeden trik, który przyspieszy Twoją pracę. Po polsku, bez żargonu, prosto na maila.