FLASH CODER ⚡

Aprovecha hasta 35% OFF y hasta 12 cuotas sin interés en CURSOS y CARRERAS

|

Hasta el 16/08 ⏰

FLASH CODER ⚡

Aprovecha hasta 35% OFF y hasta 12 cuotas sin interés en CURSOS y CARRERAS

|

Hasta el 16/08 ⏰

Hasta el 16/08 ⏰

FLASH CODER ⚡

Aprovecha hasta 35% OFF y hasta 12 cuotas sin interés en CURSOS y CARRERAS

OpenAI presenta Ultrafast: el modo de GPT-5.6 Sol que es 14 veces más rápido y cómo cambia el trabajo con IA

Tutoriales gratuitos

Aprendécreando

Guías prácticas y gratuitas para incorporar nuevas herramientas de IA a tu trabajo.

Transición Drone FPV con IA: creá un efecto de vuelo entre dos tomas

Ver ebook

Tareas programadas en ChatGPT: automatizá tus recordatorios diarios

Ver ebook

Efecto café antigravedad: creá una foto con el líquido suspendido

Ver ebook
ChatGPTClaudeVeo 3Nano BananaMidjourney
Ver tutoriales

Francisco Rhaiel

AI Growth Engineer

Inteligencia Artificial

OpenAI presenta Ultrafast: el modo de GPT-5.6 Sol que es 14 veces más rápido y cómo cambia el trabajo con IA

Publicado el

OpenAI presentó Ultrafast, un nuevo modo de servicio que ejecuta GPT-5.6 Sol hasta 14 veces más rápido que el modo estándar: pasa de unos 53 tokens por segundo a cerca de 750. Está disponible en preview limitado en la API y funciona sobre hardware de Cerebras. La novedad no es la calidad de las respuestas, es que la latencia deja de ser el límite de lo que se puede construir.

El anuncio se conoció esta semana y ya hay clientes probándolo en producción. Lo interesante no es el número en sí, sino qué tipo de aplicaciones se vuelven viables cuando un modelo responde en el tiempo que tarda una persona en parpadear.

Qué es exactamente Ultrafast

Ultrafast no es un modelo nuevo. Es un nivel de servicio distinto para GPT-5.6 Sol, el modelo insignia de OpenAI. Las respuestas son las mismas; lo que cambia es la velocidad a la que se generan.

Los números que publicó la compañía, recogidos por TechCrunch:

  • Hasta 750 tokens de salida por segundo en modo Ultrafast.

  • Alrededor de 53 tokens por segundo en el modo estándar.

  • Hasta 14 veces más rápido en la comparación directa.

Para dimensionarlo: una respuesta de 1.500 tokens —el equivalente a unas dos páginas de texto— pasa de tardar cerca de 28 segundos a resolverse en aproximadamente dos.

La pieza clave: el hardware

Ultrafast funciona sobre infraestructura de Cerebras, en el marco de una alianza entre ambas compañías enfocada en inferencia de latencia ultrabaja. Cerebras fabrica chips con una arquitectura distinta a la de las GPU tradicionales, diseñada específicamente para minimizar el tiempo de generación.

Esto marca una tendencia más amplia del sector: la competencia se está desplazando desde "qué modelo razona mejor" hacia "qué modelo responde más rápido y a qué costo por token". Como señala el análisis de The Decoder, la infraestructura de inferencia se volvió tan estratégica como el entrenamiento.

Disponibilidad: quién puede usarlo hoy

Por ahora es un preview limitado en la API de OpenAI, abierto a un grupo seleccionado de clientes, con acceso que se irá ampliando a medida que crezca la capacidad. Entre los primeros usuarios están Jane Street, Basis, Rogo y Podium, que lo están probando en código, comercio, investigación financiera y soporte.

No está disponible en ChatGPT ni en los planes de consumo. Es una capacidad de API pensada para quienes construyen productos.

Por qué la velocidad cambia el juego

En los últimos años, la conversación sobre modelos giró casi por completo alrededor de la capacidad de razonamiento. La latencia era un costo aceptado: esperás unos segundos y listo. Pero hay categorías enteras de producto donde esa espera es la diferencia entre algo usable y algo que nadie adopta.

Agentes que ejecutan muchos pasos

Este es el caso más claro. Un agente que encadena diez llamadas al modelo —consultar, decidir, ejecutar, evaluar, repetir— acumula la latencia de cada paso. Con 28 segundos por paso, ese agente tarda casi cinco minutos. Con dos segundos por paso, termina en menos de medio minuto.

Eso convierte a los agentes de una herramienta que corre en segundo plano en algo que puede acompañar a una persona mientras trabaja. Si te interesa el enfoque práctico de esto, esta guía sobre qué tareas conviene delegar a agentes de IA en el trabajo muestra dónde ya se está aplicando.

Interfaces conversacionales de verdad

En soporte y atención al cliente, la diferencia entre responder en dos segundos o en veinte define si la conversación fluye o si el usuario abandona. Lo mismo aplica a asistentes de voz, donde cualquier demora perceptible rompe la sensación de diálogo.

Asistencia de código en tiempo real

Un asistente que sugiere código mientras escribís solo funciona si la sugerencia llega antes de que vos hayas terminado de pensarla. Con latencias altas, la herramienta interrumpe en lugar de ayudar.

Automatizaciones de alto volumen

Procesar 50.000 registros con un modelo deja de ser un proceso nocturno para convertirse en algo que corre en minutos. Eso cambia la frecuencia con la que una empresa puede reprocesar sus datos.

Las contras que hay que tener en cuenta

  • Acceso restringido. Es un preview: no podés planificar un producto asumiendo que vas a tener acceso mañana.

  • La velocidad no arregla la calidad. Es el mismo modelo. Si tu agente elige mal las herramientas o alucina datos, ahora va a hacerlo 14 veces más rápido.

  • El costo importa. Un tier de mayor performance suele tener un precio distinto por token. Antes de rediseñar tu arquitectura, medí el impacto económico real.

  • Dependencia de infraestructura específica. La capacidad está atada a hardware particular, así que la disponibilidad puede variar.

Qué significa esto para quien trabaja con IA

Para perfiles técnicos, el mensaje es que la arquitectura de las aplicaciones puede volverse más ambiciosa: más pasos de razonamiento, más verificación intermedia, más iteraciones de refinamiento, todo dentro de un presupuesto de tiempo que antes no cerraba.

Para perfiles de producto y negocio, abre la puerta a casos de uso que se habían descartado por experiencia de usuario. Vale la pena revisar esa lista de ideas archivadas: varias pueden volverse viables.

Y para quien está aprendiendo, hay una lectura de fondo: las habilidades que importan no son "saber usar el modelo X". Son entender cómo se diseña un sistema con IA, cómo se mide su calidad y cómo se controla su costo. Esas competencias sobreviven a cada lanzamiento.

Cursos recomendados de Coderhouse

Si querés construir sobre esta clase de infraestructura, estos programas cubren distintos niveles:

Preguntas frecuentes

¿Ultrafast está disponible en ChatGPT?

No. Es un nivel de servicio de la API de OpenAI, en preview limitado para un grupo de clientes seleccionados. La compañía indicó que ampliará el acceso a más empresas a medida que crezca la capacidad de cómputo disponible.

¿Ultrafast da respuestas de peor calidad por ser más rápido?

Es el mismo modelo, GPT-5.6 Sol, corriendo sobre hardware distinto. Lo que cambia es la velocidad de generación, no el razonamiento ni el entrenamiento. Dicho esto, cualquier cambio de infraestructura conviene validarlo con tus propios casos de prueba antes de mover una aplicación en producción.

¿Qué es Cerebras y por qué importa acá?

Es un fabricante de chips especializados en inteligencia artificial cuya arquitectura está optimizada para inferencia de baja latencia, a diferencia de las GPU de propósito general. Su rol en este anuncio muestra que la ventaja competitiva en IA ya no depende solo del modelo sino también del hardware sobre el que corre.

¿Cómo afecta esto al costo de usar IA en una empresa?

Un tier de alta performance normalmente tiene un precio por token diferente al estándar, así que la recomendación es medir antes de migrar. La estrategia habitual es híbrida: usar el modo rápido solo en los puntos donde la latencia afecta la experiencia del usuario, y el estándar para procesos que corren en segundo plano.

¿Vale la pena rediseñar mi aplicación por esto?

Solo si la latencia es hoy tu limitante real. Si tu producto funciona bien con los tiempos actuales, la prioridad debería seguir siendo la calidad de las respuestas y el control de costos. Si en cambio descartaste funcionalidades porque "tardaban demasiado", este es un buen momento para volver a evaluarlas.

Sobre el autor

Francisco Rhaiel

Soy Francisco Rhaiel, AI Growth Engineer en Coderhouse. Mi día a día consiste en automatizar y optimizar procesos aplicando lo último en inteligencia artificial, incluyendo Agentic AI y Gen AI. Soy graduado de la Universidad Torcuato Di Tella (UTDT) en Tecnología Digital, y mi recorrido me llevó a especializarme en la intersección entre tecnología, datos y negocio. Me mueve aprender, construir y aplicar tecnologías innovadoras para resolver problemas reales. Para profundizar en mi trayectoria, te espero en mi perfil de LinkedIn.

Imagen promocionando quiz gratis de Coderhouse para encontrar tu formación.
Imagen promocionando quiz gratis de Coderhouse para encontrar tu formación.
Argentina

© 2026 Coderhouse. Todos los derechos reservados.

Argentina

© 2026 Coderhouse. Todos los derechos reservados.

Argentina

© 2026 Coderhouse. Todos los derechos reservados.

Argentina

© 2026 Coderhouse. Todos los derechos reservados.