Límites
Peticiones por minuto
Sección titulada «Peticiones por minuto»| Límite | Cuánto |
|---|---|
| Por llave | 30 peticiones por minuto |
| Por dirección IP | 120 peticiones por minuto |
Al pasarte recibes un 429 con code: "rate_limited" y la cabecera Retry-After: 60. No se cobra nada: espera y reintenta, idealmente con una espera que crezca en cada intento.
import timefrom openai import RateLimitError
for intento in range(5): try: r = client.chat.completions.create(model="colibri", messages=mensajes) break except RateLimitError: time.sleep(2 ** intento * 5)Si tu caso necesita más, escríbenos: el límite se puede subir por cuenta.
Tamaño de la respuesta
Sección titulada «Tamaño de la respuesta»max_tokens admite hasta 8192 por respuesta, y ese es también el valor por defecto.
Con una llave de plan
Sección titulada «Con una llave de plan»Una llave jmy_plan_… respeta además los topes de tu plan. Si llegas al tope del período, la API responde 429 monthly_limit.
