GPT-6.1 Sol pese a mejorar en pruebas que exigen interpretar documentos complejos y resolver tareas científicas, según datos de OpenAI.

OpenAI presentó GPT-6.1 Sol como una actualización de GPT-6 Sol enfocada en programación con agentes, trabajo profesional, uso del computador e investigación científica. La compañía sitúa su rendimiento más cerca de GPT-6 Astra en distintas evaluaciones, mientras mantiene los precios de Sol y un costo por tokens de entrada y salida equivalente a una quinta parte de las tarifas estándar de Astra.
GPT-6.1 Sol mejora los resultados de GPT-6 Sol en tareas que:
No obstante, GPT-6 Astra continúa siendo el modelo de mayor capacidad general de OpenAI, por lo que GPT-6.1 Sol queda ubicado como una alternativa de menor costo para cargas de trabajo en las que no se requiere alcanzar el máximo rendimiento de Astra.
La diferencia también aparece en precisión factual, donde GPT-6.1 Sol registró una tasa de respuestas con al menos un error factual del 4,1 % utilizando razonamiento muy alto, frente al 4,5 % de GPT-6 Sol y el 4,0 % de GPT-6 Astra. OpenAI advierte que esta evaluación utiliza conversaciones seleccionadas por haber provocado errores previamente y que sus resultados no representan el uso habitual.
DeepSWE v1.1 evalúa agentes de IA mediante problemas originales de ingeniería de software que requieren trabajar durante periodos prolongados sobre bases de código reales. El gráfico compara la puntuación conseguida con el costo por tarea para distintas configuraciones de razonamiento de GPT-6.1 Sol, GPT-6 Sol y GPT-6 Astra.
En DeepSWE cuanto más arriba está un punto, mejor es el resultado; cuanto más a la derecha, mayor es el costo por tarea. GPT-6.1 Sol obtiene puntuaciones cercanas a las de Astra con un gasto mucho menor.
GDP.pdf utiliza solicitudes procedentes de flujos profesionales y exige que los modelos encuentren y relacionen información dentro de archivos PDF que incluyen texto, tablas, gráficos, diagramas y detalles en letra pequeña. La evaluación incluye documentos de finanzas, salud y derecho, además de otros siete ámbitos profesionales, y relaciona la puntuación obtenida con el costo necesario para completar cada tarea.
AutomationBench 1.0.6 mide si un agente puede completar correctamente procesos de varios pasos utilizando 47 herramientas correspondientes a ventas, marketing, operaciones, soporte, finanzas y recursos humanos. La prueba no se limita a responder una pregunta, sino que exige ejecutar un flujo de trabajo completo y mide su resultado frente al costo por tarea.
Los agentes de IA deben completar procesos que encadenan varias acciones y herramientas. GPT-6.1 Sol alcanza resultados similares a los de algunas configuraciones más costosas de Opus 5.5 y Astra.*
OSWorld 2.0 somete a los agentes a flujos de trabajo prolongados que requieren utilizar aplicaciones informáticas para completar tareas cotidianas y profesionales. OpenAI informa en este caso la recompensa parcial obtenida sobre el conjunto sin conexión correspondiente a la versión publicada el 8 de agosto de 2026.
En esta prueba, la IA realiza acciones dentro de aplicaciones del computador. GPT-6.1 Sol se acerca al mejor resultado de Astra, mientras el costo por tarea es considerablemente menor.
Terminal-Bench Science 0.1 prueba agentes en flujos de investigación científica que requieren trabajar con código y herramientas de terminal, incluidas tareas de análisis de datos, simulación, ajuste de modelos y demostración de teoremas. La evaluación permite comparar tanto la capacidad obtenida como el costo necesario para completar cada tarea.
Precio y disponibilidad de ChatGPT-6.1 Sol
El modelo está disponible en ChatGPT Work y Codex para usuarios Plus, Pro, Business, Enterprise y Edu, además de la API mediante el identificador gpt-6.1-sol, pero todavía no se encuentra disponible en Chat. Su precio estándar en la API es de US$2 por millón de tokens de entrada, US$0,10 por millón de tokens de entrada almacenados en caché y US$10 por millón de tokens de salida.