Modelos e plataformas de IA
A OpenAI Reduz Preços da API em Seus Dois Modelos GPT-5.6 Mais Baratos

A OpenAI reduziu o preço da API de seus dois modelos GPT-5.6 mais baratos em 30 de julho de 2026, cortando o preço do modelo mais barato em 80% e o do modelo intermediÃĄrio em 20%, enquanto deixou seu modelo de bandeira inalterado. A mudança estÃĄ registrada no prÃģprio histÃģrico de alteraçÃĩes da API da empresa e jÃĄ estÃĄ disponÃvel na tabela de preços publicada.
Por milhÃĢo de tokens de entrada e saÃda, as taxas padrÃĢo agora sÃĢo:
- GPT-5.6 Luna: 20 centavos e $1,20, contra $1 e $6
- GPT-5.6 Terra: $2 e $12, contra $2,50 e $15
- GPT-5.6 Sol: $5 e $30, inalterados, correspondendo à taxa que seu antecessor GPT-5.5 ainda possui
Os trÊs modelos atingiram a disponibilidade geral em 9 de julho de 2026, aos preços mais altos, o que coloca a redefiniçÃĢo de preços trÊs semanas apÃģs a vida comercial da famÃlia.
Os cortes se estendem por todos os nÃveis de serviço na tabela, nÃĢo apenas a taxa de destaque. O processamento em lote e o processamento Flex, ambos com metade do preço padrÃĢo, agora colocam a Luna em 10 centavos de entrada e 60 centavos de saÃda. As leituras de entrada em cache, descontadas em 90%, caem para dois centavos por milhÃĢo de tokens na Luna e 20 centavos na Terra. As solicitaçÃĩes de contexto longo, que sÃĢo cobradas em dobro da taxa de entrada e 1,5 vez a taxa de saÃda, chegam a 40 centavos e $1,80 para a Luna. Os compradores que passam pela Amazon Bedrock sÃĢo cobrados pela AWS, e a OpenAI observa que essas taxas podem ser diferentes das suas.
Os modelos mais baratos sÃĢo onde o trÃĄfego de produçÃĢo de alto volume vive: classificaçÃĢo, extraçÃĢo, roteamento de solicitaçÃĩes, elaboraçÃĢo de rascunhos e os longos loops de agente onde uma instruçÃĢo do usuÃĄrio pode acionar dezenas de chamadas de modelo antes de retornar uma resposta. Um corte de cinco vezes no modelo que absorve esse volume muda a aritmÃĐtica sobre quais cargas de trabalho valem a pena automatizar.
Onde os modelos mais baratos se posicionam em relaçÃĢo ao Claude
Ao custar 20 centavos de entrada e $1,20 de saÃda, a Luna supera o modelo mais barato publicado da Anthropic, Haiku 4.5, por um fator de cinco na entrada e aproximadamente quatro na saÃda, de acordo com a pÃĄgina de preços da Anthropic. A taxa da Terra agora estÃĄ abaixo dos $3 e $15 que o Claude Sonnet 5 estÃĄ programado para cobrar uma vez que sua taxa de introduçÃĢo de $2 e $10 expire em 31 de agosto de 2026. No topo de ambas as linhas, o Sol ainda custa mais na saÃda do que o Opus 5, que a Anthropic cobra em $5 e $25.
O processamento prioritÃĄrio se torna o modo RÃĄpido
A mesma entrada no histÃģrico de alteraçÃĩes aposenta o Processamento PrioritÃĄrio e o substitui pelo modo RÃĄpido. Para o Sol, a OpenAI afirma que o modo RÃĄpido executa atÃĐ 2,5 vezes a velocidade padrÃĢo por duas vezes o preço, e a mudança ÃĐ compatÃvel com versÃĩes anteriores: as solicitaçÃĩes jÃĄ marcadas para prioridade sÃĢo encaminhadas para o modo RÃĄpido sem alteraçÃĢo de cÃģdigo. As taxas do modo RÃĄpido sÃĢo $10 e $60 para o Sol, $4 e $24 para a Terra, e 40 centavos e $2,40 para a Luna.
A Anthropic vende o mesmo produto com o mesmo nome e os mesmos termos â modo rÃĄpido para o Opus 5, atÃĐ 2,5 vezes mais rÃĄpido por duas vezes a cobrança padrÃĢo. As duas tabelas de taxas agora convergem na inferÊncia fixada em regiÃĢo. A OpenAI cobra um aumento de 10% sobre os modelos lançados em ou apÃģs 5 de março de 2026, quando um cliente exige residÊncia de dados; a Anthropic cobra a inferÊncia apenas nos EUA em 1,1 vez sua taxa padrÃĢo.
O que tornou os modelos mais baratos mais baratos
A OpenAI publicou sua contabilidade um dia antes do corte. Em uma postagem de engenharia de 29 de julho de 2026, cinco membros de sua equipe tÃĐcnica descreveram otimizaçÃĩes em inferÊncia e no harness de agente por trÃĄs do Codex e ChatGPT Work. O Sol, executando dentro do Codex, reescreveu os kernels de GPU de produçÃĢo da empresa; combinado com o trabalho de kernel mais amplo, a OpenAI afirma que isso reduziu os custos de serviço de ponta a ponta em 20%. O Sol tambÃĐm redesenhou seu prÃģprio modelo de decodificaçÃĢo especulativa em centenas de experimentos, o que a empresa credita por aumentar a eficiÊncia de geraçÃĢo de tokens em mais de 15%.
Esses sÃĢo os prÃģprios nÚmeros da OpenAI para sua prÃģpria pilha. A postagem terminou com um compromisso de passar âmelhorias por baixo do capÃī para nossos usuÃĄrios e clientes na forma de inteligÊncia mais acessÃvel e eficiente em termos de custo.â A tabela de taxas seguiu um dia depois.
O trabalho no harness aponta para o mesmo centro de custo que o corte de preços faz. A OpenAI limita a saÃda de ferramenta em 10.000 tokens por padrÃĢo e mantÃĐm o histÃģrico do modelo visÃvel apenas para anexos, entÃĢo um loop de agente que reenvia suas instruçÃĩes e definiçÃĩes de ferramenta a cada passo atinge o cache de prompt em vez de pagar as taxas de entrada completas. Em uma tarefa que exige 30 solicitaçÃĩes de modelo, isso sÃĢo 30 chances de evitar o recÃĄlculo do mesmo prefixo.
Os cortes chegam enquanto os compradores estÃĢo auditando o gasto de inferÊncia e ampliando quais equipes tocam os modelos: a prÃģpria pesquisa da OpenAI encontrou funcionÃĄrios usando o ChatGPT muito alÃĐm de seus tÃtulos de trabalho. A organizaçÃĢo de engenharia da Amazon moveu-se para limitar o gasto em IA apÃģs estourar os custos no mesmo dia, e a OpenAI enviou limites de gasto rigorosos para organizaçÃĩes e projetos de API em 22 de julho de 2026, permitindo que os administradores definam um teto mensal que começa a retornar erros uma vez que o gasto rastreado atinge isso.
Para uma equipe que jÃĄ estÃĄ encaminhando trabalho em massa para a Luna, as mesmas chamadas agora custam um quinto do que custavam, com um teto que podem definir no painel de controle. Com o preço do Sol inalterado, a decisÃĢo ao vivo permanece onde a OpenAI o colocou desde que a famÃlia foi enviada: qual nÃvel cada solicitaçÃĢo exige. Com os erros de rastreamento de gastos uma vez que o gasto rastreado atinge isso. Para uma equipe que jÃĄ estÃĄ encaminhando trabalho em massa para a Luna, as mesmas chamadas agora custam um quinto do que custavam, com um teto que podem definir no painel de controle. Com o preço do Sol inalterado, a decisÃĢo ao vivo permanece onde a OpenAI o colocou desde que a famÃlia foi enviada: qual nÃvel cada solicitaçÃĢo exige.












