Modelos e plataformas de IA

A OpenAI Reduz Preços da API em Seus Dois Modelos GPT-5.6 Mais Baratos

mm
Adicione Unite.AI às suas fontes preferidas no Google

A OpenAI reduziu o preço da API de seus dois modelos GPT-5.6 mais baratos em 30 de julho de 2026, cortando o preço do modelo mais barato em 80% e o do modelo intermediÃĄrio em 20%, enquanto deixou seu modelo de bandeira inalterado. A mudança estÃĄ registrada no prÃģprio histÃģrico de alteraçÃĩes da API da empresa e jÃĄ estÃĄ disponível na tabela de preços publicada.

Por milhÃĢo de tokens de entrada e saída, as taxas padrÃĢo agora sÃĢo:

  • GPT-5.6 Luna: 20 centavos e $1,20, contra $1 e $6
  • GPT-5.6 Terra: $2 e $12, contra $2,50 e $15
  • GPT-5.6 Sol: $5 e $30, inalterados, correspondendo à taxa que seu antecessor GPT-5.5 ainda possui

Os trÊs modelos atingiram a disponibilidade geral em 9 de julho de 2026, aos preços mais altos, o que coloca a redefiniçÃĢo de preços trÊs semanas apÃģs a vida comercial da família.

Os cortes se estendem por todos os níveis de serviço na tabela, nÃĢo apenas a taxa de destaque. O processamento em lote e o processamento Flex, ambos com metade do preço padrÃĢo, agora colocam a Luna em 10 centavos de entrada e 60 centavos de saída. As leituras de entrada em cache, descontadas em 90%, caem para dois centavos por milhÃĢo de tokens na Luna e 20 centavos na Terra. As solicitaçÃĩes de contexto longo, que sÃĢo cobradas em dobro da taxa de entrada e 1,5 vez a taxa de saída, chegam a 40 centavos e $1,80 para a Luna. Os compradores que passam pela Amazon Bedrock sÃĢo cobrados pela AWS, e a OpenAI observa que essas taxas podem ser diferentes das suas.

Os modelos mais baratos sÃĢo onde o trÃĄfego de produçÃĢo de alto volume vive: classificaçÃĢo, extraçÃĢo, roteamento de solicitaçÃĩes, elaboraçÃĢo de rascunhos e os longos loops de agente onde uma instruçÃĢo do usuÃĄrio pode acionar dezenas de chamadas de modelo antes de retornar uma resposta. Um corte de cinco vezes no modelo que absorve esse volume muda a aritmÃĐtica sobre quais cargas de trabalho valem a pena automatizar.

Onde os modelos mais baratos se posicionam em relaçÃĢo ao Claude

Ao custar 20 centavos de entrada e $1,20 de saída, a Luna supera o modelo mais barato publicado da Anthropic, Haiku 4.5, por um fator de cinco na entrada e aproximadamente quatro na saída, de acordo com a pÃĄgina de preços da Anthropic. A taxa da Terra agora estÃĄ abaixo dos $3 e $15 que o Claude Sonnet 5 estÃĄ programado para cobrar uma vez que sua taxa de introduçÃĢo de $2 e $10 expire em 31 de agosto de 2026. No topo de ambas as linhas, o Sol ainda custa mais na saída do que o Opus 5, que a Anthropic cobra em $5 e $25.

O processamento prioritÃĄrio se torna o modo RÃĄpido

A mesma entrada no histÃģrico de alteraçÃĩes aposenta o Processamento PrioritÃĄrio e o substitui pelo modo RÃĄpido. Para o Sol, a OpenAI afirma que o modo RÃĄpido executa atÃĐ 2,5 vezes a velocidade padrÃĢo por duas vezes o preço, e a mudança ÃĐ compatível com versÃĩes anteriores: as solicitaçÃĩes jÃĄ marcadas para prioridade sÃĢo encaminhadas para o modo RÃĄpido sem alteraçÃĢo de cÃģdigo. As taxas do modo RÃĄpido sÃĢo $10 e $60 para o Sol, $4 e $24 para a Terra, e 40 centavos e $2,40 para a Luna.

A Anthropic vende o mesmo produto com o mesmo nome e os mesmos termos — modo rÃĄpido para o Opus 5, atÃĐ 2,5 vezes mais rÃĄpido por duas vezes a cobrança padrÃĢo. As duas tabelas de taxas agora convergem na inferÊncia fixada em regiÃĢo. A OpenAI cobra um aumento de 10% sobre os modelos lançados em ou apÃģs 5 de março de 2026, quando um cliente exige residÊncia de dados; a Anthropic cobra a inferÊncia apenas nos EUA em 1,1 vez sua taxa padrÃĢo.

O que tornou os modelos mais baratos mais baratos

A OpenAI publicou sua contabilidade um dia antes do corte. Em uma postagem de engenharia de 29 de julho de 2026, cinco membros de sua equipe tÃĐcnica descreveram otimizaçÃĩes em inferÊncia e no harness de agente por trÃĄs do Codex e ChatGPT Work. O Sol, executando dentro do Codex, reescreveu os kernels de GPU de produçÃĢo da empresa; combinado com o trabalho de kernel mais amplo, a OpenAI afirma que isso reduziu os custos de serviço de ponta a ponta em 20%. O Sol tambÃĐm redesenhou seu prÃģprio modelo de decodificaçÃĢo especulativa em centenas de experimentos, o que a empresa credita por aumentar a eficiÊncia de geraçÃĢo de tokens em mais de 15%.

Esses sÃĢo os prÃģprios nÚmeros da OpenAI para sua prÃģpria pilha. A postagem terminou com um compromisso de passar “melhorias por baixo do capÃī para nossos usuÃĄrios e clientes na forma de inteligÊncia mais acessível e eficiente em termos de custo.” A tabela de taxas seguiu um dia depois.

O trabalho no harness aponta para o mesmo centro de custo que o corte de preços faz. A OpenAI limita a saída de ferramenta em 10.000 tokens por padrÃĢo e mantÃĐm o histÃģrico do modelo visível apenas para anexos, entÃĢo um loop de agente que reenvia suas instruçÃĩes e definiçÃĩes de ferramenta a cada passo atinge o cache de prompt em vez de pagar as taxas de entrada completas. Em uma tarefa que exige 30 solicitaçÃĩes de modelo, isso sÃĢo 30 chances de evitar o recÃĄlculo do mesmo prefixo.

Os cortes chegam enquanto os compradores estÃĢo auditando o gasto de inferÊncia e ampliando quais equipes tocam os modelos: a prÃģpria pesquisa da OpenAI encontrou funcionÃĄrios usando o ChatGPT muito alÃĐm de seus títulos de trabalho. A organizaçÃĢo de engenharia da Amazon moveu-se para limitar o gasto em IA apÃģs estourar os custos no mesmo dia, e a OpenAI enviou limites de gasto rigorosos para organizaçÃĩes e projetos de API em 22 de julho de 2026, permitindo que os administradores definam um teto mensal que começa a retornar erros uma vez que o gasto rastreado atinge isso.

Para uma equipe que jÃĄ estÃĄ encaminhando trabalho em massa para a Luna, as mesmas chamadas agora custam um quinto do que custavam, com um teto que podem definir no painel de controle. Com o preço do Sol inalterado, a decisÃĢo ao vivo permanece onde a OpenAI o colocou desde que a família foi enviada: qual nível cada solicitaçÃĢo exige. Com os erros de rastreamento de gastos uma vez que o gasto rastreado atinge isso. Para uma equipe que jÃĄ estÃĄ encaminhando trabalho em massa para a Luna, as mesmas chamadas agora custam um quinto do que custavam, com um teto que podem definir no painel de controle. Com o preço do Sol inalterado, a decisÃĢo ao vivo permanece onde a OpenAI o colocou desde que a família foi enviada: qual nível cada solicitaçÃĢo exige.

Aiden Cross ÃĐ um estrategista gerado por IA na Unite.AI, cobrindo estratÃĐgia de produto de IA, execuçÃĢo e os desafios prÃĄticos de transformar modelos experimentais em produtos escalÃĄveis e prontos para o mercado. Seu trabalho se concentra em como as startups e equipes de empresas mudam de protÃģtipos e demonstraçÃĩes para sistemas confiÃĄveis usados por clientes reais.
Com uma perspectiva pragmÃĄtica e detalhada, Aiden analisa mapas de produtos, estratÃĐgias de marketing, decisÃĩes de plataforma e compensaçÃĩes organizacionais que determinam se as iniciativas de IA tÊm sucesso ou estagnam. Ele presta atençÃĢo especial às realidades de implantaçÃĢo, adoçÃĢo de usuÃĄrios, restriçÃĩes de infraestrutura e alinhamento entre capacidade tÃĐcnica e valor comercial.
Artigos escritos por Aiden Cross sÃĢo gerados por IA e revisados pela equipe editorial da Unite.AI para garantir clareza, precisÃĢo e cobertura responsÃĄvel de como os produtos de IA sÃĢo construídos, enviados e escalados no mundo real.