Modelos y plataformas de IA

Pinecone publica VQ-Bench, marco de cuantización vectorial de código abierto

mm
Añade Unite.AI a tus fuentes preferidas en Google

Pinecone ha lanzado VQ-bench, un marco de código abierto para crear y evaluar métodos de cuantización vectorial, en un anuncio del 17 de septiembre de 2026 por Ashwin Padaki, Amir Ingber y Edo Liberty. El lanzamiento combina un sitio web público que aloja una referencia de rendimiento de cuantizadores populares con un repositorio de GitHub bajo licencia MIT y un artículo presentado en VecDB@VLDB 2026.

Por qué Pinecone construyó un benchmark de cuantización

La cuantización vectorial reduce la cantidad de bits necesarios para almacenar un vector, lo que los autores describen como una parte crítica del mantenimiento de una base de datos vectorial y como importante tanto para bases de datos vectoriales como para los grandes modelos de lenguaje. Pinecone ha utilizado la cuantización desde sus primeros prototipos, y los autores escribieron que al intentar revisar y evaluar investigaciones más recientes, descubrieron que cada artículo evaluaba el rendimiento de manera distinta: diferentes métricas, diferentes conjuntos de datos y diferentes hardware objetivo. Afirmaron que no pudieron encontrar ningún intento sistemático de evaluar los principales métodos entre sí.

La premisa del proyecto, según describen los autores, es que la mayoría de los cuantizadores publicados se ensamblan a partir de un conjunto relativamente pequeño de operaciones primitivas, por lo que construir un cuantizador puede reducirse a una receta que indique qué primitivas usar y en qué orden. El artículo complementario, enviado a arXiv el 31 de julio de 2026, indica que el marco describe siete primitivas conceptuales de cuantización, muestra cómo combinarlas arbitrariamente y reexpresa 25 cuantizadores comunes como canalizaciones de esas primitivas.

Cómo VQ-Bench compone cuantizadores

En VQ-bench, un cuantizador es cualquier cosa que pueda tomar un conjunto de vectores, comprimirlos y recuperar la información deseada posteriormente. Un cuantizador debe implementar cuatro métodos: fit, que aprende un modelo a partir de una muestra de vectores y opcionalmente consultas; encode, que devuelve códigos por vector dado el modelo; reconstruct, que reconstruye un vector a partir del modelo y su código; y score, que estima el producto punto entre un vector de consulta y un vector codificado.

Una primitiva implementa los mismos cuatro métodos más dos adicionales, apply y apply_queries, que especifican cómo la etapa entrega los datos a la siguiente. Estos dos métodos forman el contrato de encadenamiento que permite componer primitivas. VQ-bench implementa tres grupos de primitivas: condicionadores como Center, Normalize, PCA y RandomRotate; redondeadores como CastUint, CastAngular, CastNormal y KMeans; y divisores como Segment.

Una canalización encadena dos o más primitivas. Los métodos fit y encode hacen avanzar los vectores a lo largo de la cadena, ejecutando la tarea de cada etapa y concatenando el modelo aprendido y los códigos de salida de cada una; reconstruct comienza en la última etapa y retrocede, con cada etapa incorporando su propia contribución; y score primero impulsa la consulta hacia adelante mediante apply_queries antes de ejecutar el mismo paso inverso. Un cuantizador no tiene que ser una canalización, ya que cualquier cosa que implemente los cuatro métodos califica, pero los autores informan que la mayoría de los cuantizadores publicados pueden expresarse como canalizaciones de primitivas.

El anuncio muestra E-RaBitQ como una canalización de ejemplo de cuatro primitivas: Center, que resta el vector promedio del conjunto de datos a cada vector; Normalize, que escala cada vector a norma unitaria; una rotación aleatoria que aplica una transformación ortogonal o de Hadamard aleatoria; y una conversión angular que ajusta cada vector a una cuadrícula entera de b bits redondeando al punto de cuadrícula más cercano en ángulo.

Configuración del benchmark y hallazgos reportados

Los autores evaluaron un conjunto de 14 cuantizadores en cinco conjuntos de datos de VIBE, presentando resultados detallados para dos de ellos: ArXiv, con 1,344,643 vectores en 768 dimensiones, y Yahoo, con 677,305 vectores en 384 dimensiones. Los resultados completos se publican en el sitio web de benchmark del proyecto.

El error cuadrático medio de reconstrucción, que los autores denominan la métrica tradicional para la cuantización vectorial y es importante para aplicaciones como la compresión de pesos de LLM, se mide en 1,000 vectores del conjunto de datos seleccionados al azar como la distancia cuadrática promedio entre cada vector y su reconstrucción. Para bases de datos vectoriales, los autores describen el recall como la métrica más relevante, específicamente para reordenamiento; recall@10 se mide calculando los 1,000 vectores del conjunto de datos con mayor producto punto para cada consulta y verificando qué fracción del top‑10 estimado por el cuantizador se encuentra dentro del verdadero top‑10, promediado sobre todas las consultas. Las cifras de tiempo de codificación en el anuncio se obtuvieron en un Apple M2 Pro con 16 GB de RAM usando seis hilos, con la codificación realizada en bloques y acelerada mediante multihilo.

Los autores informan que PQ y OPQ produjeron consistentemente el MSE de reconstrucción más bajo, que EDEN y E-RaBitQ fueron comparables en recall, especialmente con presupuestos de bits más altos, y que EDEN codificó mucho más rápido que PQ, OPQ y E-RaBitQ, lo que describen como lo convierte en un buen candidato para la mayoría de las aplicaciones de cuantización.

Repositorio, herramientas y contribuciones

El repositorio de GitHub tiene licencia MIT y enumera a los mantenedores Amir Ingber y Edo Liberty de Pinecone y a Ashwin Padaki de la Universidad de Pensilvania. Incluye una herramienta de línea de comandos basada en Rust, vqb, cuyas configuraciones JSON de ejecución seleccionan conjuntos de datos, métodos y sus parámetros, métricas de calidad, valores k para recall, temperaturas softmax, una semilla maestra, recuentos de submuestreo y un número de hilos; una bandera de ejecución en seco valida una configuración antes de que se calcule algo. Un modo de transmisión procesa conjuntos de datos mayores que la memoria leyendo los vectores base del disco en bloques, 256 MB por defecto.

El repositorio acepta dos tipos de contribuciones, según el anuncio: nuevos cuantizadores, que a menudo son solo unas pocas líneas de código que reordenan primitivas que ya incluye la biblioteca, y nuevas primitivas que implementan los seis métodos de la interfaz, los cuales luego se combinan con cualquier otra primitiva del catálogo. El arnés de evaluación mide recall@k, reconstrucción y error de puntuación, sesgo, KL softmax y variación total, tamaño en bits por dimensión, y costos de codificación, puntuación y reconstrucción. Los autores describen este lanzamiento como la primera iteración de VQ‑bench y dijeron que añadirán más cuantizadores con el tiempo; se pueden presentar correcciones a través del rastreador de incidencias del repositorio, y el benchmark publicado se actualiza con regularidad incorporando nuevos métodos.

Jonas Reeve es un analista generado por IA en Unite.AI, centrado en la inteligencia artificial cognitiva, la inteligencia artificial general (AGI) y los fundamentos teóricos de la inteligencia de la máquina. Su trabajo explora cómo surgen el aprendizaje, el razonamiento, la memoria y la abstracción en sistemas biológicos y artificiales, estableciendo conexiones entre las arquitecturas de IA modernas y las preguntas largamente debatidas en la ciencia cognitiva y la filosofía de la mente.
Con un enfoque conceptual y reflexivo, Jonas examina marcos como los modelos de razonamiento, los sistemas agénticos, la cognición emergente y la teoría de alineación, con el objetivo de aclarar qué significa realmente el progreso hacia la AGI —y qué no. En lugar de perseguir cronogramas o publicidad, enfatiza los primeros principios, la rigidez conceptual y los límites de los modelos actuales.
Los artículos escritos por Jonas Reeve son generados por IA y revisados por el equipo editorial de Unite.AI para garantizar la precisión, la claridad y la discusión responsable de conceptos de IA avanzados.