OpenAI pozwala wreszcie ustawić twardy limit wydatków. Jest jeden haczyk
Od 22 lipca ustawisz miesięczny limit, po którym API zwraca błąd 429. OpenAI zastrzega, że blokada nie działa natychmiast i rachunek może go lekko przekroczyć.

OpenAI dodało 22 lipca do swojego API twarde limity wydatków. Ustawiasz miesięczny pułap kwotowy, a po jego osiągnięciu zapytania kończą się błędem 429 z kodem insufficient_quota. To odpowiedź na najczęstszy lęk każdego, kto buduje aplikacje z AI bez umiejętności programowania: że agent zapętli się w nocy i rano zastaniesz rachunek na kilka tysięcy złotych.
Nowość ma jednak zastrzeżenie zapisane wprost w dokumentacji i warto je znać, zanim uznasz sprawę za załatwioną. OpenAI pisze, że egzekwowanie limitu nie jest natychmiastowe, więc zarejestrowane wydatki mogą lekko przekroczyć ustawioną kwotę. Innymi słowy, to hamulec, a nie ściana. Zatrzyma pojazd, ale nie dokładnie w tym miejscu, w którym wcisnąłeś pedał.
Jak to działa
Limit da się ustawić na dwóch poziomach i oba mogą obowiązywać jednocześnie dla tego samego zapytania:
- Limit organizacji obejmuje ruch we wszystkich projektach należących do konta.
- Limit projektu dotyczy wyłącznie ruchu rozliczanego na ten konkretny projekt.
To rozróżnienie jest praktyczne, jeśli prowadzisz kilka rzeczy naraz. Możesz dać całemu kontu górny pułap bezpieczeństwa, a eksperymentalnej aplikacji przydzielić znacznie niższy własny budżet, żeby jeden nieudany test nie zjadł puli przeznaczonej na działającą usługę.
Osobno działają alerty wydatkowe, które istniały już wcześniej i nadal są dostępne. Różnica jest zasadnicza: alert wysyła powiadomienie, ale ruch leci dalej. Dokumentacja mówi o tym jednoznacznie: alert nie egzekwuje żadnego pułapu. Dopiero twardy limit przerywa obsługę zapytań.
Dlaczego to ma znaczenie akurat teraz
Rok temu ryzyko przepalenia budżetu było ograniczone naturalnie, bo modele odpowiadały na pojedyncze pytania. Dziś standardem jest agent, który dostaje zadanie i pracuje samodzielnie przez kilkanaście minut, wywołując narzędzia, czytając pliki i uruchamiając kolejne zapytania. Każdy taki krok to tokeny, a Ty widzisz jedno polecenie, które wpisałeś.
Do tego dochodzi zagnieżdżanie. Pisaliśmy niedawno, że Claude Code pozwala agentom powoływać kolejnych agentów na trzech poziomach. Ta sama logika obowiązuje w narzędziach opartych na modelach OpenAI. Koszt nie rośnie liniowo wraz z Twoim wysiłkiem, tylko z liczbą kroków, które narzędzie uzna za potrzebne.
Warto też zauważyć, że to trend w całej branży, a nie pomysł jednej firmy. Na początku lipca podobne mechanizmy wprowadzała u siebie konkurencja, a limity budżetowe stały się jednym z głównych tematów rozmów o wdrożeniach AI. Dostawcy zrozumieli, że nieprzewidywalny rachunek skuteczniej zniechęca do korzystania z narzędzi niż jakikolwiek brak funkcji.
Czego ten limit nie obejmuje
Tu trzeba być precyzyjnym, bo łatwo o nieporozumienie. Mowa o API, czyli o sytuacji, w której Twoja aplikacja albo Twoje narzędzie łączy się z modelem własnym kluczem i płacisz za zużycie. To nie dotyczy abonamentu ChatGPT ani planów, w których płacisz stałą kwotę miesięczną, bo tam z definicji nie ma czego ograniczać.
Jeśli więc korzystasz z narzędzia, które ma własny model rozliczeniowy i nie prosiło Cię o klucz OpenAI, ta zmiana Cię nie dotyczy. Jeśli natomiast wklejałeś gdzieś swój klucz, na przykład konfigurując własny klucz API w edytorze albo w automatyzacji, to mowa właśnie o Tobie i warto to ustawić dziś.
Jak ustawić to sensownie
Trzy rzeczy, które warto zrobić od razu.
Po pierwsze, ustaw twardy limit na kwotę, której utrata Cię nie zaboli, a nie na kwotę, którą planujesz wydać. To zabezpieczenie na wypadek błędu, nie budżet operacyjny.
Po drugie, ustaw alert wyraźnie poniżej twardego limitu, na przykład na jego połowę. Dzięki temu dostaniesz sygnał, gdy zużycie zaczyna nietypowo rosnąć, i zdążysz zareagować, zanim aplikacja przestanie działać. Twardy limit odetnie usługę bez uprzedzenia, a to znaczy, że Twoi użytkownicy zobaczą awarię.
Po trzecie, zaplanuj, co się stanie po odcięciu. Błąd 429 to formalnie ta sama rodzina odpowiedzi co ograniczenie tempa zapytań, więc wiele bibliotek domyślnie potraktuje go jako sygnał do ponawiania próby. Przy wyczerpanym budżecie ponawianie nie ma sensu i tylko zaciemnia obraz, bo w logach zobaczysz setki nieudanych prób zamiast jednej wyraźnej informacji o wyczerpanym limicie.
Na koniec uczciwe podsumowanie. Ta funkcja realnie zmniejsza ryzyko i dobrze, że powstała. Nie zwalnia jednak z pilnowania, co Twoje narzędzia robią między jednym poleceniem a drugim, bo OpenAI z góry zastrzega, że naliczona kwota może nieznacznie przekroczyć ustawiony limit.
Opanuj AI‑coding w 5 minut. W każdy poniedziałek.
Konkretne premiery, analizy cen i jeden trik, który przyspieszy Twoją pracę. Po polsku, bez żargonu, prosto na maila.