Noticias

OpenAI anunció a GPT-6 Sol y Luna con mejoras en programación, agentes y uso de computadores

GPT-6 Sol y Luna mejoran programación, agentes y uso de computadores, con menos errores en tareas complejas y nuevas opciones para trabajo profesional

Compartir

OpenAI presentó GPT-6 Sol y GPT-6 Luna como nuevas variantes de la familia GPT-6, desarrolladas con métodos de entrenamiento similares a los utilizados en GPT-6 Astra. Los modelos incorporan avances en trabajo profesional, factualidad, programación, uso de computadores y alineamiento, pero se sitúan por debajo de Astra dentro de la familia.

GPT-6 Sol mejora el desempeño en flujos de trabajo profesionales

En AutomationBench 1.0.6, una prueba que evalúa agentes en flujos completos mediante 47 herramientas de ventas, marketing, operaciones, soporte, finanzas y recursos humanos, GPT-6 Sol alcanzó 33,2% con nivel de esfuerzo xhigh. En la misma evaluación superó el resultado máximo publicado para Claude Opus 5 y también al GPT-6 Astra configurado con bajo esfuerzo.

AutomationBench 1.0.6 compara la puntuación de distintos modelos frente al costo por tarea en flujos de trabajo que utilizan 47 herramientas empresariales. | Créditos: OpenAI

Agents’ Last Exam V1 amplía la evaluación hacia trabajos profesionales de mayor duración distribuidos en 55 subindustrias. GPT-6 Sol alcanzó 56,4% con esfuerzo máximo, mientras los resultados publicados también muestran el comportamiento de GPT-6 Astra, Luna y los modelos GPT-5.6 frente a Claude Opus 5 y Fable 5.

Agents’ Last Exam V1 evalúa agentes de IA en tareas profesionales de largo horizonte distribuidas en 55 subindustrias. | Créditos: OpenAI

Menos errores factuales y mejores resultados en programación

OpenAI evaluó la factualidad mediante conversaciones anonimizadas de ChatGPT en las que usuarios habían reportado previamente errores y señala que GPT-6 Sol produjo aproximadamente la mitad de fallos que GPT-5.6 Sol. La firma advierte que estas conversaciones fueron seleccionadas precisamente por provocar errores, por lo que los resultados no representan el uso habitual del servicio.

Comparación de la proporción de respuestas con errores factuales entre GPT-6 Astra, Sol y Luna y sus equivalentes de la generación GPT-5.6. | Créditos: OpenAI

En programación, GPT-6 Sol obtuvo 68,8% en DeepSWE 1.1 y GPT-6 Luna llegó a 66,6% en esta prueba de ingeniería de software sobre repositorios reales. Sol también alcanzó 60,5% en OSWorld 2.0, una evaluación de agentes que ejecutan tareas prolongadas mediante interfaces de computador.

Disponibilidad de GPT-6 Sol y GPT-6 Luna

GPT-6 Sol y Luna están disponibles en ChatGPT Work y Codex para usuarios Plus, Pro, Business, Enterprise y Edu, mientras GPT-6 Luna también está disponible para usuarios Free y Go mediante la aplicación de escritorio. OpenAI señala que la incorporación de ambos modelos a ChatGPT se realizará de manera gradual y que también están disponibles mediante su API.

Ivan

Editor especializado en ciencia y tecnología, con foco en innovación, inteligencia artificial, telecomunicaciones y centros de datos. Trabajo con un enfoque riguroso y técnico, desarrollando contenidos sobre semiconductores, energía, ciberseguridad e infraestructura tecnológica.

Los comentarios de Disqus están cargando....
Publicado por
Ivan