GPT4o de OpenAIGPT4o de OpenAI

OpenAI presentó su más reciente innovación: GPT-4o, «omni».

Este modelo representa un avance significativo hacia una interacción persona-computadora mucho más natural. Lo anterior permitirá entradas de texto, audio, imagen y video, y generando salidas en texto, audio e imagen.

Su capacidad para responder a entradas de audio en tan solo 232 milisegundos, con un promedio de 320 milisegundos, rivaliza con el tiempo de respuesta humano.

GPT-4o, una revolución en la interacción multimodal

GPT-4o no solo iguala el rendimiento de GPT-4 Turbo en texto en inglés y código, sino que también muestra mejoras notables en texto en otros idiomas. Además, es mucho más rápido y un 50% más económico en la API. Este modelo destaca especialmente en visión y comprensión de audio en comparación con sus predecesores.

Antes de la llegada de GPT-4o, el modo de voz permitía hablar con ChatGPT con latencias de 2.8 segundos (GPT-3.5) y 5.4 segundos (GPT-4) en promedio.

Este modo utilizaba una canalización de tres modelos separados para transcribir audio a texto, generar texto, y convertir ese texto nuevamente en audio. Ello resultaba en pérdida de información y limitaciones en la expresión emocional y auditiva.

GPT-4o, integración completa y mejorada seguridad

GPT-4o, entrenado como único modelo de extremo a extremo en texto, visión y audio, procesa todas las entradas y salidas a través de la misma red neuronal.

Este es el primer modelo que combina todas estas modalidades, abriendo un mundo de posibilidades aún por explorar.

La seguridad ha sido una prioridad en el diseño de GPT-4o, incorporando técnicas como el filtrado de datos de entrenamiento y el refinamiento del comportamiento del modelo mediante entrenamiento posterior. Se han creado nuevos sistemas de seguridad para proporcionar barreras en las salidas de voz.

El modelo, evaluado de acuerdo con el Marco de Preparación de OpenAI y sus compromisos voluntarios, muestra que no supera el riesgo medio en ciberseguridad, persuasión, autonomía del modelo y otros parámetros evaluados. Un equipo externo de más de 70 expertos ha participado en la identificación y mitigación de riesgos asociados a las nuevas modalidades.

Disponibilidad y futuro de GPT-4o

GPT-4o marca un avance en la usabilidad práctica del aprendizaje profundo. Después de dos años de investigación y mejoras en eficiencia, GPT-4o está listo para implementarse de manera más amplia. Las capacidades de texto e imagen del modelo ya están comenzando a implementarse en ChatGPT, disponible tanto para usuarios gratuitos como Plus, con límites de mensajes hasta 5 veces mayores.

En próximas semanas, la nueva versión del Modo de Voz con GPT-4o se lanzará en alfa para ChatGPT Plus. Los desarrolladores también pueden acceder a GPT-4o a través de la API como modelo de texto y visión, que es dos veces más rápido y la mitad de caro en comparación con GPT-4 Turbo.

El soporte para las capacidades de audio y video de GPT-4o será lanzado a un grupo selecto de socios confiables en la API en las próximas semanas, continuando así con la expansión y mejora de esta revolucionaria tecnología.

GPT-4o no solo amplía los límites del aprendizaje profundo, sino que también promete redefinir la forma en que interactuamos con la inteligencia artificial, acercándonos a una experiencia más natural e intuitiva.

Para conocer más información sobre herramientas de inteligencia artificial, visita la sección.

Esta información fue curada con herramientas de inteligencia artificial, revisada por un humano.

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *