VM0 ahora es Okou. El mismo equipo, el mismo producto, un nombre nuevo.

Todos los modelos

GPT-5.4 Mini: modelo de OpenAI

El miembro optimizado en costo de OpenAI de la familia GPT-5. ×0,3 créditos, visión multimodal, y lo suficientemente rápido para enrutamiento, clasificación y prefiltrado de alto volumen.

400K tokens · Text / Vision / Code · Prompt cache

Okou ya no ejecuta GPT-5.4 Mini. Esta página se mantiene como referencia de sus especificaciones, precios y benchmarks. Para el mismo tipo de trabajo, usa GPT 5.6 Luna.

Ver GPT 5.6 Luna

GPT-5.4 Mini es el miembro que ahorra costos de la familia GPT-5 de OpenAI — al que recurres cuando el costo unitario importa más que la calidad de razonamiento máxima. Mantiene la ventana de contexto de 400K y las entradas multimodales del resto de la familia pero recorta el cómputo por token, lo que se traduce en menor precio ($0,75 / $4,5 por 1M) y velocidad notablemente mayor.

¿Qué es GPT-5.4 Mini?

Abril 2026 · Variante que ahorra costos de la familia GPT-5. El par del lado OpenAI de Kimi K2.7 Code.

GPT-5.4 Mini es el miembro optimizado en costo de la generación GPT-5 de OpenAI, lanzado en abril de 2026 junto con GPT-5.5 y GPT-5.4. OpenAI lo posiciona como el nivel de alto rendimiento — el modelo que mantienes ejecutándose en pasos de clasificación, enrutamiento y prefiltrado donde 5.4 o 5.5 más grandes se desperdiciarían en decisiones rutinarias.

Arquitectónicamente comparte la ventana de contexto de 400K tokens de la familia GPT-5, el parámetro reasoning_effort, Prompt Caching, y la superficie Responses API que usa el codex CLI por defecto. El compromiso frente a 5.4 es la profundidad de razonamiento: Mini maneja bien llamadas a herramientas estándar, resúmenes cortos y cargas de salida estructurada, pero empieza a derivar en los planes multi-paso más difíciles donde 5.4 todavía aguanta. El compromiso frente a competidores al mismo precio es el ecosistema — si ya estás en Codex, quedarte dentro de la superficie OpenAI mantiene definiciones de herramientas y esquemas de salida estructurada consistentes.

Qué destaca de GPT-5.4 Mini

Características principales de arquitectura y capacidades.

GPT-5.4 Mini usa la misma arquitectura que el resto de la familia GPT-5: ventana de contexto de 400K tokens, el parámetro reasoning_effort en cuatro niveles, Prompt Caching donde la entrada cacheada se factura a una décima parte de la tarifa de entrada, y la superficie Responses API. Tool-Use, salidas estructuradas y entradas de visión multimodal son soportadas. El modelo es un hermano menor más rápido — menos parámetros por token, más rendimiento por dólar.

Especificaciones rápidas

FamiliaGeneración GPT-5
ModalidadesTexto, visión, código
IdiomasInglés primero, multilingüe
Prompt CachingSoportado (OpenAI)
Ventana de contexto400K tokens
Salida máximaHasta 128K tokens
Reasoning effortMínimo / Bajo / Medio / Alto
Precio listado$0,75 entrada / $4,5 salida por 1M

Benchmarks de GPT-5.4 Mini

Puntuaciones reportadas por el proveedor de los materiales de lanzamiento de GPT-5 Mini de OpenAI. Las reseñas independientes sitúan a 5.4 Mini en la misma banda que ahorra costos que Kimi K2.7 Code en la mayoría de benchmarks de agente. Trata los porcentajes absolutos como direccionales.

SWE-bench Verifiedreportado por el proveedor
~60%
Terminal-Bench 2.0uso de herramientas reportado por el proveedor
~42%
AIME 2025 (sin herramientas)matemáticas de competición reportadas por el proveedor
~84%
GPQA Diamondciencia de nivel posgrado reportada por el proveedor
~74%
VelocidadArtificial Analysis, esfuerzo medio
~165 tokens/seg

Precios de GPT-5.4 Mini

Precio de lista del proveedor, por 1M de tokens.

Input$0.75
Output$4.50
Lectura de caché$0.07
Escritura de cachéNo facturado

Cómo se comporta GPT-5.4 Mini en la práctica

Comportamiento observado en ejecuciones de agentes en producción.

Velocidad

El modelo más rápido de la familia GPT-5 — alrededor de 165 tokens/seg en esfuerzo medio según Artificial Analysis. Esta es la propiedad que lo hace viable para respuestas de chat interactivo y llamadas a herramientas fan-out cortas donde la latencia visible al usuario domina.

Llamadas a herramientas rutinarias

Preciso en el catálogo estándar de herramientas del framework Codex. Donde 5.4 se adelanta es en casos límite difíciles (selección condicional de herramientas, argumentos profundamente anidados) — para los casos rutinarios Mini maneja el enrutamiento de herramientas limpiamente a un tercio del costo.

Clasificación masiva y prefiltrado

La posición de costo/calidad más fuerte de la familia GPT-5 para trabajo fan-out. Triaje masivo de PRs, categorización de tickets de soporte, clasificación por nivel de documentos — todas las cargas de trabajo donde antes habrías hecho regex a mano ahora son asequibles en una llamada real de modelo.

Eficiencia de costo

×0,3 créditos con visión multimodal incluida. Mini y Kimi K2.7 Code se sitúan en la misma banda, mientras DeepSeek V4 Pro se sitúa más bajo en ×0,1 — la elección usualmente se reduce al ajuste de framework y comportamiento en tu carga de trabajo específica.

Cuándo escalar

Mini deriva en planes largos multi-paso, razonamiento difícil y ediciones de código multi-archivo al primer intento. Construye el agente para que el orquestador decida cuándo escalar a 5.4 o 5.5, no para que Mini intente llevar todo el bucle.

Mejores tareas para GPT-5.4 Mini

El clasificador fan-out que se ejecuta en cada evento

Ticket de soporte entrante, comentario de PR, transcripción de llamada de ventas, carga de documento — Mini lee cada uno y lo enruta al agente o revisor humano correcto. ×0,3 créditos y 165 tokens/seg significan que el costo por evento es lo suficientemente pequeño como para que ejecutarlo en cada evento (no solo en lotes muestreados) sea realmente viable.

El paso de prefiltrado antes del modelo caro

Fija Mini en lo alto de la llamada a herramienta del agente para que decida si la solicitud siquiera necesita escalarse. La mayoría de solicitudes obtienen una respuesta rápida y barata; solo la minoría residual paga el costo completo de GPT-5.4 o 5.5. Aquí es donde apilar niveles que ahorran costos y de núcleo genuinamente cambia lo que es asequible.

La respuesta de chat interactivo

Turnos multimodales cortos donde la latencia visible al usuario domina la experiencia. Mini responde lo suficientemente rápido como para que el streaming se sienta instantáneo, y el soporte multimodal significa que una captura de pantalla en la conversación simplemente funciona.

Cuándo evitar GPT-5.4 Mini

Evita GPT-5.4 Mini en los pasos más difíciles de razonamiento, orquestación de agente multi-paso, secuencias de computer-use y ediciones de código multi-archivo al primer intento — escala a 5.4 para versiones rutinarias de esas tareas y a 5.5 para las más difíciles.

GPT-5.4 Mini vs otros modelos

GPT-5.4 Mini vs GPT-5.4

Misma familia, diferente posicionamiento. 5.4 Mini (×0,3) gana en costo y velocidad; 5.4 (×1) gana en calidad de razonamiento y precisión de enrutamiento de herramientas en casos difíciles. El patrón estándar es prefiltrar con Mini y escalar los casos residuales a 5.4.

GPT-5.4 Mini vs Claude Sonnet 4.6

Claude Sonnet 4.6 es el punto de comparación más fiable cuando la calidad de enrutamiento de herramientas importa más que el rendimiento bruto. Mini es más barato y rápido para prefiltrado y pasos simples.

Conclusión: ¿deberías usar GPT-5.4 Mini?

GPT-5.4 Mini es el predeterminado que ahorra costos del lado OpenAI. Prefiltra con Mini, escala a GPT-5.4 para pasos rutinarios, escala a GPT-5.5 solo para el razonamiento más difícil.

Preguntas frecuentes

¿Cuál es la ventana de contexto de GPT-5.4 Mini?

400.000 tokens, con hasta 128K tokens de salida por respuesta — la misma que el resto de la familia GPT-5.

¿Puede GPT-5.4 Mini manejar imágenes?

Sí. Como el resto de la familia GPT-5 acepta entradas de imagen junto con texto y código.

¿Cuándo debería elegir GPT-5.4 Mini sobre Kimi K2.7 Code?

Cuando tu agente ya está construido en el framework Codex o necesitas el ecosistema de salidas estructuradas / llamadas a herramientas de OpenAI. Ambos se sitúan en ×0,3 créditos, así que el costo es idéntico y la elección se reduce al framework y comportamiento.

¿GPT-5.4 Mini soporta Prompt Caching?

Sí. La entrada cacheada se factura a $0,075 por 1M tokens — un descuento del 10× en la porción cacheada.

Alternativas

Disponibilidad de GPT-5.4 Mini en Okou

GPT-5.4 Mini se ha retirado del catálogo de Okou, por lo que ya no puede seleccionarse en el chat ni en un workflow, y tampoco está disponible con tu propia clave de API. GPT 5.6 Luna cubre el mismo nivel de ahorro de costes.