Líderes de pensamento

A memória da sua empresa deve durar mais que os seus modelos de IA

mm
Adicione Unite.AI às suas fontes preferidas no Google

As pessoas costumam perguntar qual modelo alimenta minha empresa. A resposta importa: ela define qualidade, custo e limites, e eu fico feliz em dedicar uma hora a isso. Também quero saber outra coisa: o que a organização ainda terá quando esse modelo mudar.

Coloque isso como uma data. Se o seu provedor dobrar o preço numa terça‑feira, ou descontinuar o endpoint que você utilizou, o que você ainda possuiria na manhã de quarta‑feira?

Para muitas empresas, a resposta honesta é: uma chave de API, uma fatura e um histórico de conversas muito extenso armazenado nos servidores de outra pessoa, sob a política de retenção de outra pessoa.

Minha formação é em química. Passei anos construindo modelos grey‑box para usinas químicas, integrados ao SCADA, aos resultados de laboratório e às próprias anotações do operador. Esse trabalho ensina rapidamente uma regra: um número sem suas condições não é um resultado. Se alguém trocou um sensor na semana passada e ninguém anotou, a leitura na tela não explica nada.

Isso é um problema de caderno de laboratório. Agora aparece como um problema de aquisição, e raramente está na planilha onde o orçamento de IA é definido.

Três perguntas que são respondidas de uma só vez

Uma janela de contexto maior permite que um modelo use mais informações em uma única solicitação. O armazenamento durável determina o que sobrevive entre solicitações. A portabilidade determina se essas informações permanecem utilizáveis quando o provedor muda. Estas são questões arquiteturais distintas, e a janela de um milhão de tokens incentivou todos a tratá‑las como uma só.

A própria documentação do Google oferece a analogia diretamente: “Uma analogia para a janela de contexto é a memória de curto prazo.” Leve isso ao pé da letra. A memória de curto prazo é o que você perde.

Portanto, todo fornecedor que vende uma janela enorme também vende algo separado para persistir o estado. Leia essas camadas de forma restrita, nas próprias palavras deles, e observe o que cada uma realmente cobre.

OpenAI armazena objetos Response por 30 dias por padrão; Objetos de Conversa e seus itens estão isentos desse TTL. A exclusão de 30 dias da Amazon se aplica à a API de Gerenciamento de Sessão Bedrock, e cobre apenas essa API. A ferramenta de memória do lado do cliente da Anthropic ilustra um limite útil: o modelo solicita operações de memória, a aplicação controla o armazenamento, enquanto a mesma empresa também fornece armazenamentos de memória gerenciados para seus agentes hospedados.

Todas essas são decisões de engenharia comuns, publicadas abertamente. Elas também significam que as regras de retenção para o contexto de trabalho da sua empresa vivem nas notas de versão de outra pessoa, e você deve ser capaz de identificar qual regra se aplica a quais dos seus dados.

Onde o custo de troca realmente reside

Trocar uma chamada de geração de texto por outra leva um fim de semana. É por isso que dizer “somos multimodelo” é algo tão barato de se dizer. As camadas caras são aquelas que ninguém demonstra.

Incrustações.Alterando o incorporação modelo normalmente requer re-incorporação do corpus e migração ou reconstrução do índice. Uma mudança de geração modelo não tem tal exigência, e os dois ficam constantemente confundidos — geralmente por quem promete que a migração será rápida. A literatura de 2025 descreve o caminho padrão como “re‑codificar todo o corpus e reconstruir o índice Approximate Nearest Neighbor (ANN), levando a uma interrupção operacional significativa e a custos computacionais elevados”; a própria contribuição desse artigo, Drift-Adapter, é um método para adiar a reconstrução aprendendo uma transformação entre espaços de incorporação. De qualquer forma, o custo da migração cobre a validação de recuperação e o trabalho operacional, bem como as próprias chamadas de incorporação.

Comportamento ajustado. Uma frase da aviso de descontinuação de setembro de 2025 está acima de todas as mesas de aquisição: “Modelos previamente ajustados não estarão mais acessíveis.” Comportamento que você pagou para criar, aposentado juntamente com o endpoint que o hospedava. Todos seguiram o processo publicado. Seu modelo ainda assim desapareceu.

Comportamento de prompts e ferramentas. As mesmas instruções produzem uma aplicação diferente em um modelo diferente. Em uma aplicação empresarial, pesquisadores relataram a queda da taxa de aprovação da regressão de 100% no modelo original para 97,3% em um modelo mais novo com prompts idênticos, recuperada apenas após redesign deliberado de prompts. Cenários de teste aparecem em produção em suas próprias frequências, de modo que esse número não sustenta nenhuma estimativa de quão frequentemente fluxos de trabalho ao vivo falham. A regra operacional que ele sustenta é mais simples: valide cada atualização de modelo no nível da aplicação, você mesmo, antes que chegue a um cliente.

Tudo isso acaba chegando à fatura, muito tempo depois de as páginas de preços terem sido comparadas.

Alguém mais está segurando sua agenda

Depreciação ocorre em um cronograma publicado, e os cronogramas não são seus. OpenAI deu um aviso de um ano antes de encerrar a Assistants API em agosto de 2026 – generoso pelos padrões da mesma página, onde o GPT-4.5 Preview recebeu cerca de três meses. A política da Mistral é de seis meses para modelos GA e um mês para pré‑visualizações e de terceiros, com um aviso de que um alias rotativo “pode expor você a atualizações silenciosas no comportamento e preço do modelo.”

A AWS diz a parte silenciosa em voz alta em sua política de ciclo de vida: “Migre para um modelo Active antes da data de EOL; a migração não acontecerá automaticamente.”

Seu roteiro tem um coautor. Ele nunca participa das suas reuniões de planejamento e não se importa em que trimestre você está.

Preço Também É uma Parte Mutável

Nas tarifas Standard listadas do Gemini 3.7 Flash, cinco bilhões de tokens de entrada não armazenados em cache e um bilhão de tokens de saída faturados custam $7,500 por mês. As tarifas atualmente programadas para 1 janeiro 2027 elevariam essa fatura de tokens para $15,000, antes de outras cobranças ou descontos, enquanto seu produto faz exatamente o que fazia antes.

Uma lista de preços congelada também pode gerar uma fatura maior. A documentação de preços da Anthropic observa que o tokenizador usado por suas gerações de modelos mais recentes “produz aproximadamente 30% mais tokens para o mesmo texto” – dependente do conteúdo e específico dessas gerações – o que torna o efeito em qualquer fatura algo que você deve medir. Portanto, meça os tokens pelos quais está sendo cobrado. Um cartão de tarifas por si só não lhe informará.

Para um produto que executa fluxos de trabalho, a medida econômica útil é o custo de uma tarefa concluída com sucesso, incluindo tentativas de nova execução e revisão humana. Esse número varia quando um modelo muda, mesmo que o cartão de tarifas não mude.

E nada disso é negociável a partir de uma posição em que sair leva um ano. A Capgemini pesquisou 1,300 executivos em organizações de bilhões de dólares na primavera de 2026 sobre fornecedores críticos de tecnologia em geral: 36% disseram que mudar de um levaria mais de doze meses, e um em cada dez não tinha alternativa viável alguma. Essa é uma descrição de um relacionamento com fornecedor sem segunda fonte.

Leve Isso à Área de Compras

Eu dirijo uma empresa francesa, registrada em Marselha, hospedada na Europa, e ainda assim evitarei o discurso sobre soberania de forma abstrata. A independência de todos os fornecedores de tecnologia está fora do alcance de uma empresa comum. O mesmo estudo da Capgemini constatou que 59% dos executivos consideram a soberania digital completa irrealista, e eu concordo com eles.

Entender e controlar suas dependências críticas é uma tarefa menor, e possível. Três perguntas, todas respondíveis em uma reunião: onde nossos dados são armazenados e processados, quem pode acessá‑los e o que seria necessário para continuar operando com outro fornecedor?

Toda empresa sabe como perguntar isso sobre logística, pagamentos e armazenamento em nuvem. Quando se trata de contexto de trabalho, a dependência europeia surge na reunião como uma discussão de segunda fonte com um número associado, o que é uma forma que a área de compras pode atuar.

Um alerta sobre os números citados aqui. O fato de uma empresa usar vários modelos nos diz pouco sobre se ela pode mover seu contexto de trabalho entre fornecedores. Isso requer um teste separado: os registros, as permissões e o trabalho incompleto podem ser transferidos e ainda serem utilizáveis?

O Que Realmente Torna um Modelo Substituível

Uma interface compartilhada entre modelos é útil, e eu construiria uma. Ela deve tornar visíveis as capacidades e dependências específicas de cada modelo. Portabilidade não requer a pretensão de que todos os modelos se comportam da mesma forma, e uma abstração que nivela as diferenças elimina silenciosamente o motivo pelo qual você pagou por um bom modelo.

O trabalho mais pesado é possuir o estado que nenhum provedor deve ser o único custodiante. Quatro itens, na ordem em que falham.

Um registro autoritário sob seu controle. Mensagens, fontes recuperadas, aprovações, pontos de verificação de execução. Registre o que foi concluído em sistemas externos e o que pode ser reexecutado com segurança: o e‑mail pode ter sido enviado enquanto a confirmação falhou ao ser salva, e um procedimento de recuperação que não souber disso o enviará duas vezes. Qualquer estado de provedor que você não consiga reconstruir é uma dependência. Anote‑o como um, explicitamente, antes que um incidente faça a documentação por você.

A fonte ao lado de cada vetor. Um vetor é um artefato compilado; o fragmento é o código-fonte. Armazene o documento fonte e sua versão, ID do documento, limites do fragmento, versão do fragmentador, modelo de incorporação com versão e dimensões, versão do índice e o que o processamento produziu como texto. Um fragmento de texto armazenado isoladamente não reconstruirá uma tabela, uma imagem ou um resultado de OCR. Manter tudo isso transforma um reindexamento em uma migração planejada, o que oferece tanto conforto quanto eu prometo.

Registros que distinguem fonte, inferência e decisão. A memória precisa separar o que uma fonte disse, o que um modelo inferiu e o que uma pessoa aprovou. Um cliente prometendo pagar na quinta‑feira, a suposição de um modelo de que o pagamento será atrasado e uma extensão acordada para sexta‑feira são três registros diferentes com três status diferentes, e o sistema deve saber qual deles pode ser acionado. Cada um precisa de sua origem, escopo, regras de acesso e status atual, incluindo se foi corrigido ou substituído. Uma transcrição pode conter a evidência; reproduzi‑la não identifica de forma confiável quais conclusões ainda são atuais e quais decisões ainda permanecem válidas.

Portabilidade que você realmente testou. Torne‑a testável de duas maneiras: um exercício de exportação‑e‑restauração e um conjunto de avaliação que define o que a aplicação deve cumprir. Então “podemos mudar” torna‑se uma métrica que alguém pode executar: o substituto consegue manter fluxos de trabalho representativos dentro dos seus requisitos de qualidade, permissões, latência e custo? E preserve os dados de treinamento que você tem direito de reutilizar, juntamente com suas versões, configuração de ajuste e testes de aceitação. Isso torna o re‑treinamento possível, sem garantia de comportamento idêntico, e o ID do modelo ajustado expira em uma data definida por alguém que você nunca conheceu.

Então use sessões hospedadas, caches de prompts e recuperação do provedor onde eles forem úteis. Eles são frequentemente excelentes, e recusá‑los por princípio é um tipo de custo próprio. O requisito é que os registros que eles mantêm possam ser recuperados e usados em outro lugar com suas regras de acesso e retenção intactas. Alugue a computação; mantenha o controle do registro.

Eu também não exageraria na promoção da arquitetura. Antes de alcançar o ajuste produto‑mercado, lançar seis semanas antes costuma superar qualquer camada de abstração, e uma startup que constrói três back‑ends de recuperação antes de ter clientes construiu um museu. Se essa troca vale a pena depende do produto e do custo da eventual reconstrução. Mantenha a matéria‑prima recuperável e um atalho continua sendo um atalho.

A Parte que Mudou

Enquanto a IA apenas respondia perguntas, perder o contexto era um incômodo. Você reescrevia o prompt e seguia em frente. Agora ela agenda a reunião, abre o chamado e interage com o CRM, e a falta de contexto leva a trabalhos duplicados ou incompletos em sistemas que pertencem aos seus clientes.

Os fornecedores de modelos criam coisas extraordinárias e eu as utilizo diariamente. A responsabilidade que estou descrevendo recai sobre nós, que construímos as plataformas intermediárias: tornar as dependências visíveis e preservar um registro confiável do que foi autorizado e do que foi concluído.

Todo fluxo de trabalho concluído deve deixar a organização com algo que possa ser reutilizado — um resultado verificado, uma decisão com histórico rastreável, um ponto de partida mais claro para a próxima tarefa. Esse valor acumulado deve superar a vida útil do modelo que ajudou a criá‑lo.

Pergunte o que você ainda possuiria na manhã de quarta‑feira.

Ilia Razvin é o fundador e CEO da IOSYA, uma plataforma de produtividade empresarial e automação de fluxos de trabalho de IA. Ele anteriormente desenvolveu modelos de processo de caixa cinza e sistemas de apoio à decisão para a fabricação química, e possui um Master 2 em microsensores e sistemas de detecção pela Aix-Marseille Université.