Modelos e plataformas de IA

Pinecone disponibiliza como código aberto o framework VQ-Bench de Quantização Vetorial

mm
Adicione Unite.AI às suas fontes preferidas no Google

A Pinecone lançou o VQ-bench, um framework de código aberto para construir e avaliar métodos de quantização vetorial, em um anúncio de 17 de setembro de 2026 por Ashwin Padaki, Amir Ingber e Edo Liberty. O lançamento inclui um site público que hospeda um benchmark em execução dos quantizadores populares, um repositório no GitHub licenciado sob MIT e um artigo apresentado no VecDB@VLDB 2026.

Por que a Pinecone criou um benchmark de quantização

A quantização vetorial reduz a quantidade de bits necessária para armazenar um vetor, o que os autores descrevem como uma parte crítica da manutenção de um banco de vetores e como importante tanto para bancos de vetores quanto para grandes modelos de linguagem. A Pinecone tem usado quantização desde seus primeiros protótipos, e os autores escreveram que, ao se proporem a pesquisar e avaliar pesquisas mais recentes, descobriram que cada artigo avaliava o desempenho de forma diferente: métricas distintas, conjuntos de dados diferentes e hardware-alvo diverso. Eles afirmaram não ter encontrado nenhuma tentativa sistemática de avaliar os principais métodos entre si.

A premissa do projeto, como os autores descrevem, é que a maioria dos quantizadores publicados são montados a partir de um conjunto relativamente pequeno de operações primitivas, de modo que construir um quantizador pode ser reduzido a uma receita de quais primitivas usar e em que ordem. O artigo complementar, submetido ao arXiv em 31 de julho de 2026, afirma que o framework descreve sete primitivas conceituais de quantização, demonstra como compô‑las arbitrariamente e reexpressa 25 quantizadores comuns como pipelines dessas primitivas.

Como o VQ-Bench compõe quantizadores

No VQ-bench, um quantizador é qualquer coisa que possa receber um conjunto de vetores, comprimí‑los e recuperar as informações desejadas posteriormente. Um quantizador deve implementar quatro métodos: fit, que aprende um modelo a partir de uma amostra de vetores e, opcionalmente, consultas; encode, que devolve códigos por vetor a partir do modelo; reconstruct, que reconstrói um vetor a partir do modelo e de seu código; e score, que estima o produto escalar entre um vetor de consulta e um vetor codificado.

Uma primitiva implementa os mesmos quatro métodos mais dois adicionais, apply e apply_queries, que especificam como a etapa entrega os dados à próxima. Esses dois métodos formam o contrato de encadeamento que permite a composição das primitivas. O VQ-bench implementa três grupos de primitivas: condicionadores como Center, Normalize, PCA e RandomRotate; arredondadores como CastUint, CastAngular, CastNormal e KMeans; e divisores como Segment.

Um pipeline encadeia duas ou mais primitivas. Os métodos fit e encode avançam os vetores ao longo da cadeia, executando a tarefa de cada etapa e concatenando o modelo aprendido e os códigos de saída de cada estágio; reconstruct começa na última etapa e retrocede, com cada estágio reintegrando sua própria contribuição; e score primeiro encaminha a consulta adiante através de apply_queries antes de executar a mesma passagem retroativa. Um quantizador não precisa ser um pipeline, já que qualquer coisa que implemente os quatro métodos é elegível, mas os autores relatam que a maioria dos quantizadores publicados pode ser expressa como pipelines de primitivas.

O anúncio demonstra o E-RaBitQ como um pipeline de exemplo composto por quatro primitivas: Center, que subtrai o vetor médio do conjunto de dados de cada vetor; Normalize, que escala cada vetor para norma unitária; uma rotação aleatória aplicando uma transformação ortogonal ou Hadamard aleatória; e um cast angular que ajusta cada vetor a uma grade inteira de b bits, arredondando ao ponto de grade mais próximo em ângulo.

Configuração do Benchmark e Resultados Reportados

Os autores avaliaram um conjunto de 14 quantizadores em cinco conjuntos de dados da VIBE, apresentando resultados detalhados para dois deles: ArXiv, com 1.344.643 vetores em 768 dimensões, e Yahoo, com 677.305 vetores em 384 dimensões. Os resultados completos estão publicados no site de benchmark do projeto.

O erro quadrático médio de reconstrução, que os autores chamam de métrica tradicional para quantização vetorial e que é importante para aplicações como compressão de pesos de LLMs, é medido em 1.000 vetores amostrados aleatoriamente do conjunto de dados como a distância quadrática média entre cada vetor e sua reconstrução. Para bancos de vetores, os autores descrevem a revocação (recall) como a métrica mais relevante, especificamente para reclassificação; recall@10 é medido calculando os 1.000 vetores do conjunto de dados com maior produto escalar para cada consulta e verificando que fração dos top‑10 estimados pelo quantizador está dentro do verdadeiro top‑10, em média sobre todas as consultas. Os valores de tempo de codificação no anúncio foram obtidos em um Apple M2 Pro com 16 GB de RAM usando seis threads, com a codificação feita em blocos e acelerada por multithreading.

Os autores relatam que PQ e OPQ produziram consistentemente o menor MSE de reconstrução, que EDEN e E-RaBitQ foram comparáveis em recall, especialmente em orçamentos de bits mais altos, e que EDEN codificou muito mais rápido que PQ, OPQ e E-RaBitQ, o que eles descrevem como tornando‑o um bom candidato para a maioria das aplicações de quantização.

Repositório, Ferramentas e Contribuições

O repositório do GitHub tem licença MIT e lista os mantenedores Amir Ingber e Edo Liberty, da Pinecone, e Ashwin Padaki, da Universidade da Pensilvânia. Ele inclui uma ferramenta de linha de comando baseada em Rust, vqb, cujas configurações de execução em JSON selecionam conjuntos de dados, métodos e seus parâmetros, métricas de qualidade, valores k para recall, temperaturas de softmax, uma semente mestre, contagens de subamostragem e número de threads; uma flag de execução a seco valida uma configuração antes que qualquer cálculo seja realizado. Um modo de streaming processa conjuntos de dados maiores que a memória lendo vetores base do disco em blocos de 256 MB por padrão.

O repositório aceita dois tipos de contribuições, de acordo com o anúncio: novos quantizadores, que geralmente são algumas linhas de código reordenando primitivas que a biblioteca já fornece, e novas primitivas que implementam os seis métodos de interface, as quais então se combinam com todas as outras primitivas do catálogo. O harness de avaliação mede recall@k, erro de reconstrução e de pontuação, viés, KL de softmax e variação total, tamanho em bits por dimensão, e custo de codificação, pontuação e reconstrução. Os autores descrevem esta versão como a primeira iteração do VQ-bench e disseram que adicionarão mais quantizadores ao longo do tempo; correções podem ser enviadas através do rastreador de issues do repositório, e o benchmark publicado é atualizado regularmente com novos métodos incorporados.

Jonas Reeve é um analista gerado por IA na Unite.AI, com foco em inteligência artificial cognitiva, inteligência artificial geral (AGI) e fundamentos teóricos de inteligência de máquina. Seu trabalho explora como aprendizado, raciocínio, memória e abstração surgem em sistemas biológicos e artificiais, estabelecendo conexões entre arquiteturas de IA modernas e questões de longa data em ciência cognitiva e filosofia da mente.
Com uma abordagem conceitual e reflexiva, Jonas examina estruturas como modelos de raciocínio, sistemas agênticos, cognição emergente e teoria de alinhamento, visando esclarecer o que o progresso em direção à AGI realmente significa - e o que não significa. Em vez de perseguir cronogramas ou hype, ele enfatiza princípios fundamentais, rigor conceitual e os limites dos modelos atuais.
Artigos escritos por Jonas Reeve são gerados por IA e revisados pela equipe editorial da Unite.AI para garantir precisão, clareza e discussão responsável de conceitos de IA avançados.