Inteligência próxima à do Astra por um quinto
do preço, com desempenho de fronteira sustentado.
Apresentamos o GPT‑6.1 Sol, uma atualização do GPT‑6 Sol com desempenho excepcional em programação agêntica, além de uso do computador e trabalho profissional. Ele aproxima o Sol do GPT‑6 Astra em tarefas exigentes, por um quinto dos preços padrão dos tokens de entrada e saída do Astra, dando aos desenvolvedores mais margem para criar e executar agentes capazes com o mesmo orçamento.
O GPT‑6.1 Sol oferece desempenho próximo ao do Astra pelo preço do Sol, tornando-se o modelo com a melhor relação entre custo e desempenho disponível hoje. A entrada em cache custa apenas US$ 0,10 por milhão de tokens — um desconto de 95% sobre o preço padrão de entrada —, tornando o modelo mais acessível para cargas de trabalho com agentes de IA que precisam reutilizar o contexto em solicitações repetidas.
O GPT‑6 Astra continua sendo nosso modelo de fronteira mais capaz no geral. O GPT‑6.1 Sol oferece um novo equilíbrio entre capacidade e custo para trabalhos importantes que os usuários querem realizar com mais frequência e para clientes da API que criam e executam aplicações em escala.
Um Sol mais capaz em diversas tarefas
O GPT‑6.1 Sol traz melhorias substanciais em relação ao GPT‑6 Sol em trabalhos profissionais complexos, desde escrever e depurar código até compreender documentos e executar fluxos de trabalho empresariais com várias etapas. Em várias dessas avaliações, ele se aproxima do desempenho do GPT‑6 Astra a um custo substancialmente menor.
Programação
No DeepSWE v1.1, que avalia tarefas complexas de engenharia de software em bases de código reais, o GPT‑6.1 Sol se iguala ao GPT‑6 Astra por cerca de um quinto do custo, ao mesmo tempo que supera a melhor pontuação do GPT‑6 Sol em 6,4 pontos percentuais, com menor esforço de raciocínio e custo.
No DeepSWE 1.1(abre em uma nova janela), agentes de IA resolvem tarefas inéditas de engenharia de software que exigem muitas etapas.
Trabalho profissional
No GDP.pdf, que mede a precisão com que os modelos respondem a perguntas profissionais usando documentos PDF complexos, incluindo tabelas, gráficos, diagramas e detalhes em letras miúdas, o GPT‑6.1 Sol supera a pontuação do Opus 5.5 com alternativas de contingência por menos da metade do custo por tarefa nas configurações de raciocínio testadas. Ele também se aproxima do desempenho de ponta do GPT‑6 Astra por cerca de um quinto do custo por tarefa.
No GDP.pdf(abre em uma nova janela), os modelos devem responder a prompts reais sobre PDFs complexos extraídos de fluxos de trabalho das áreas de finanças, saúde, direito e outras sete áreas profissionais.
No AutomationBench, que mede se os agentes concluem corretamente fluxos de trabalho empresariais com várias etapas, o GPT‑6.1 Sol supera o Opus 5.5 em 2,2 pontos percentuais com esforço de raciocínio médio, por cerca de um terço do custo. Essa pontuação também supera em 4,8 pontos percentuais a do GPT‑6 Sol na mesma configuração.
In AutomationBench 1.0.6(abre em uma nova janela), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.
Uso do computador
O GPT‑6.1 Sol também apresenta avanços substanciais em tarefas que exigem interação com aplicativos de computador. No conjunto offline do OSWorld 2.0, que avalia agentes em fluxos de trabalho exigentes de uso do computador, o GPT‑6.1 Sol supera o GPT‑6 Sol em sete pontos percentuais com esforço de raciocínio máximo, por menos da metade do custo. Ele fica a apenas 2,1 pontos percentuais da pontuação do Astra com esforço de raciocínio máximo, por cerca de um sétimo do custo por tarefa.
In OSWorld 2.0(abre em uma nova janela), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
Pesquisa científica
No Terminal-Bench Science 0.1, que avalia fluxos de trabalho científicos, incluindo análise de dados, simulação e demonstração de teoremas, o GPT‑6.1 Sol alcança mais que o dobro da pontuação do GPT‑6 Sol com esforço de raciocínio máximo, por menos da metade do custo por tarefa. Com esforço máximo, o GPT‑6.1 Sol custa, em média, US$ 5,47 por tarefa, ante US$ 23,21 do Opus 5.5 e US$ 23,80 do Astra, oferecendo capacidade científica substancial a um custo mais de 75% menor que o de qualquer um dos dois modelos.
O GPT‑6 Astra ainda alcança a maior pontuação entre os modelos testados, de 68,1%, e deve ser usado nas tarefas de pesquisa científica mais difíceis.
No Terminal-Bench Science 0.1(abre em uma nova janela), os agentes executam fluxos de trabalho de pesquisa científica usando código e ferramentas de terminal, incluindo análise de dados, execução de simulações e ajuste de modelos.
Precisão factual
O GPT‑6.1 Sol também melhora a precisão factual em prompts difíceis. Com esforço de raciocínio extra-alto, sua taxa de erros factuais é de 4,1%, abaixo dos 4,5% do GPT‑6 Sol e mais próxima dos 4,0% do Astra na mesma configuração, com um custo por tarefa aproximadamente 83% menor que o do Astra.
Esta avaliação mede a proporção de respostas que contêm pelo menos um erro factual em conversas sem dados de identificação nas quais os usuários sinalizaram um erro de um modelo anterior. Esses prompts deliberadamente difíceis não são representativos do uso típico.
Avaliamos a precisão factual em conversas do ChatGPT sem dados de identificação nas quais os usuários haviam sinalizado um erro factual de um modelo anterior. Essas conversas que induzem erros não são representativas do uso típico, em que erros factuais são mais raros.
Disponibilização segura do GPT‑6.1 Sol
O GPT‑6.1 Sol apresenta melhorias substanciais em relação ao GPT‑6 Sol em nossas avaliações de alinhamento, aproximando-se do GPT‑6 Astra.
O GPT‑6.1 Sol é mais transparente sobre suas limitações e mais confiável ao respeitar a intenção do usuário e as restrições de segurança. Em avaliações desafiadoras, ele apresenta taxas de falha menores que as do GPT‑6 Sol ao informar problemas em ferramentas de busca, respeitar restrições explícitas e evitar resultados não autorizados durante tarefas com agentes de IA. Não observamos tentativas de burlar um revisor de segurança automatizado, assim como no GPT‑6 Astra e no GPT‑6 Sol.
As avaliações abaixo testam deliberadamente situações desafiadoras e não medem as taxas de falha no uso típico.
Ferramenta de busca com falha - Burla do revisor
Contorno de avisos - Segurança no uso do computador
Esta avaliação testa se os agentes informam ao usuário quando a ferramenta de busca não funciona, em vez de responderem com sua melhor suposição. O GPT‑6.1 Sol deixa de informar o problema em 2,8% dos casos, ante 4,9% do GPT‑6 Sol, 1,5% do GPT‑6 Astra e 28,7% do GPT‑6 Luna. As tarefas são selecionadas para provocar falhas e não representam o uso típico. O esforço foi definido no nível máximo.
Preços e disponibilidade
O GPT‑6.1 Sol está disponível a partir de hoje para todos os usuários Plus, Pro, Business, Enterprise e Edu no ChatGPT Work e no Codex. Esses modelos ainda não estão disponíveis no Chat. Os desenvolvedores também podem acessá-lo pela API da OpenAI como gpt-6.1-sol. Seus preços padrão na API são de US$ 2 por milhão de tokens de entrada, US$ 0,10 por milhão de tokens de entrada em cache e US$ 10 por milhão de tokens de saída.
Também estamos lançando o GPT‑6 Astra Ultrafast, o modelo de fronteira mais rápido do mundo, com velocidade até 8 vezes maior que a do GPT‑6 Astra, além do GPT‑6.1 Sol Ultrafast. Eles estão disponíveis na API e também no ChatGPT Work e no Codex para usuários da nossa nova modalidade Pro, com os maiores limites de uso, por US$ 500/mês. Com o GPT‑6.1 Sol Ultrafast, os desenvolvedores podem obter inteligência próxima à do Astra com velocidade até 8 vezes maior, por aproximadamente o mesmo valor que gastavam antes na API com o GPT‑6 Astra.
Fonte: OpenAI
As avaliações do GPT foram realizadas em nosso ambiente de pesquisa ou por meio de nossa API, o que pode resultar em pequenas diferenças em relação ao ChatGPT de produção devido a diferenças nos prompts do sistema, ferramentas disponíveis, esforços, etc. As avaliações dos modelos concorrentes foram obtidas de relatórios disponíveis publicamente.
Nenhum comentário:
Postar um comentário