Modelos y plataformas de IA

H Company lanza NeoMME, una familia de codificadores multimodales de código abierto

mm
Añade Unite.AI a tus fuentes preferidas en Google

Los investigadores de H Company lanzaron NeoMME el 3 de septiembre de 2026, una familia de codificadores multimodales y multilingües de 260 M y 800 M de parámetros entrenados desde cero y publicados bajo la licencia Apache 2.0. Las variantes de recuperación afinadas se sitúan en la frontera de Pareto de tamaño de modelo del benchmark ViDoRe v3 de recuperación de documentos visuales, informó el equipo.

Según la publicación de lanzamiento, muchos recuperadores de documentos visuales recientes se adaptan a partir de modelos generativos de visión‑lenguaje preentrenados, en los que un codificador de visión preentrenado por separado produce características visuales que un proyector mapea al espacio de entrada de un modelo de lenguaje causal. Los autores señalan que la recuperación, clasificación y etiquetado de tokens no generan texto de forma autorregresiva, por lo que esas tareas no requieren un decodificador causal ni su sobrecarga de parámetros y cómputo. NeoMME, en cambio, procesa tokens de texto y parches de imagen sin procesar mediante un único Transformador bidireccional compartido y no se basa en ninguna torre de visión, codificador de texto o decodificador de texto preentrenado existente.

La publicación sitúa el diseño frente a dos esfuerzos de codificadores anteriores: ModernBERT, que introdujo mejoras de eficiencia en los codificadores de texto bidireccionales, y ModernVBERT, que aplicó un codificador de texto al estilo ModernBERT a la recuperación de documentos visuales manteniendo una torre de visión SigLIP2 preentrenada por separado. Los autores afirman que querían eliminar la sobrecarga de trasladar los componentes de un modelo visión‑lenguaje a un codificador.

Arquitectura y preentrenamiento desde cero

Ambos tamaños de NeoMME comparten la misma arquitectura. Las entradas de texto utilizan incrustaciones de tokens factorizadas, mientras que las imágenes se dividen en una cuadrícula de parches no superpuestos de 32 × 32 y se proyectan mediante una pequeña perceptrón multicapa; ambos luego ingresan al mismo codificador Transformer. Las imágenes conservan su relación de aspecto y tamaño, de modo que el modelo puede dedicar más tokens a una página de documento de alta resolución y densidad informativa que a una imagen más pequeña. La longitud de contexto es de 16 384 tokens, suficiente para hasta dos imágenes estándar 3840 × 2160 4K UHD. La mayoría de las capas emplean atención de ventana deslizante simétrica, mientras que cada sexta capa y la capa final utilizan atención global. La pila también incluye atención agrupada por consultas, normalización de clave‑consulta, atención con compuerta, incrustaciones posicionales rotatorias 2D y MLPs con ReLU al cuadrado. Para el texto, el equipo entrenó un tokenizador BPE con un vocabulario de 131 072 tokens desde cero sobre texto multilingüe, código, matemáticas y transcripciones de imágenes generadas por máquina.

NeoMME se preentrena desde cero como un denoizador de texto de difusión enmascarada discreta. Para ejemplos solo de texto, se muestrea una tasa de corrupción uniformemente entre 0 y 1, y cada token de texto elegible se enmascara de forma independiente a esa tasa. Los ejemplos multimodales utilizan tasas de corrupción entre 0,3 y 1, dejando visibles los parches de imagen mientras el modelo reconstruye el texto enmascarado; los autores indican que un enmascaramiento intensivo obliga al modelo a aprender descripciones fundamentadas en la imagen en lugar de depender de atajos solo lingüísticos. El preentrenamiento combina texto multilingüe, código, matemáticas, imágenes naturales e imágenes de documentos, y cada modelo procesa alrededor de 524 mil millones de tokens de entrada empaquetados, incluidos 290 mil millones de ejemplos solo de texto. Al observar que este presupuesto de texto es pequeño en comparación con los 2 billones de tokens de entrenamiento de ModernBERT, los autores afirman que eligieron el optimizador NorMuon para mejorar la eficiencia de datos.

Ajuste fino de recuperación y resultados de referencia

Para evaluar la columna vertebral en una tarea descendente, el equipo la afinó para la recuperación de documentos visuales utilizando la metodología de página‑imagen introducida por ColPali. En lugar de recuperar fragmentos de texto extraídos, NeoMME-Retriever clasifica capturas de pantalla de páginas de documentos, evitando el preprocesamiento OCR y preservando el diseño, gráficos, tablas y tipografía. El recuperador añade dos cabezas entrenadas conjuntamente a la columna vertebral: una cabeza densa que promedia los estados ocultos en un vector normalizado, y una cabeza de interacción tardía que proyecta cada token de texto o parche de imagen a un vector normalizado de 128 dimensiones, conservando coincidencias de gran detalle entre los tokens de consulta y las regiones de la imagen. Una pasada hacia adelante devuelve ambas representaciones. Los autores recomiendan en general incrustaciones de interacción tardía, y una canalización de recuperación densa seguida de reordenamiento por interacción tardía para corpora muy grandes.

En el benchmark ViDoRe v3, la publicación informa un nDCG@10 de 0,523 para NeoMME-Retriever-260M, la puntuación más alta entre los modelos evaluados con menos de 800 M de parámetros y a menos de 0,002 de ColQwen2.5, usando aproximadamente 14 veces menos parámetros. NeoMME-Retriever-800M alcanza 0,556, a menos de 0,009 del Vultron Retriever Flash de tamaño similar, y ambos modelos se sitúan en la frontera de Pareto de tamaño de modelo del benchmark. La tabla comparativa de la publicación indica que las puntuaciones de los competidores provienen de MTEB y que las puntuaciones de NeoMME son evaluaciones propias del equipo. En los benchmarks más antiguos ViDoRe v1 y v2, que utilizan nDCG@5, la publicación señala que el modelo de 260 M supera a ColModernVBERT y al ColSmol-500M, que es el doble de grande, mientras que el modelo de 800 M supera a ColPali v1.3 con 3,6 veces menos parámetros.

La tarjeta del modelo para NeoMME-260M-Retriever indica 263 M de parámetros, un tamaño oculto de 1 024, pesos BF16 y incrustaciones densas de 1 024 dimensiones con puntos de truncamiento Matryoshka en 128, 256, 512 y 1 024 dimensiones, junto con la salida multivector de 128 dimensiones. La tarjeta también informa resultados de recuperación de texto en BEIR‑15, donde el recuperador de 260 M obtiene 0,4881 nDCG@10 con interacción tardía y el modelo de 800 M obtiene 0,5126.

Compresión, rendimiento de indexación y disponibilidad

Dado que el almacenamiento de interacción tardía escala linealmente con el número de vectores de incrustación, las páginas de alta resolución resultan costosas de indexar: una página de 2048 × 2048 genera 4 200 vectores con NeoMME-Retriever, aproximadamente 2,1 MB en float32, y la publicación indica un promedio medido de alrededor de 1,5 MB por documento en ViDoRe v3. El equipo combinó agrupamiento jerárquico de tokens, que agrupa vectores de documentos similares y almacena la media de cada clúster, con cuantización asimétrica, que guarda las incrustaciones de documentos en precisión int8 o binaria mientras mantiene las incrustaciones de consulta en tiempo real con mayor precisión. En ViDoRe v3, la publicación informa que un factor de agrupamiento de 10 con consultas y documentos int8 reduce el almacenamiento a 39 kB por página, una reducción de 39×, manteniendo más del 99 % del nDCG@10 de referencia. Un ajuste más agresivo, factor de agrupamiento 8 con consultas int8 y documentos binarios, utiliza 6 kB por página, 255 veces menos, y conserva más del 95 % de la calidad de recuperación.

El equipo también midió el rendimiento de codificación utilizando tensores de imagen preprocesados, con tamaños de lote calibrados por separado para cada modelo y tamaño de imagen. Con una entrada de 2048 × 2048 en una GPU NVIDIA L40S, NeoMME-Retriever-260M codifica aproximadamente 51 páginas por segundo, casi el doble de las 26 páginas por segundo de ColModernVBERT, y la publicación indica que ambos tamaños de NeoMME-Retriever son más rápidos que los demás modelos comparados en resoluciones de entrada menores.

Todos los checkpoints de NeoMME se publican bajo Apache 2.0 con una implementación de día cero en Hugging Face Transformers, y una demostración de generación aumentada por recuperación visual está disponible como un Hugging Face Space. Para el ajuste fino, el equipo ofrece checkpoints separados de interacción densa y tardía compatibles con Sentence Transformers v6, que actualmente admite una cabeza de recuperación por modelo; entrenar ambas cabezas simultáneamente requiere la clase NeoMMEForRetrieval con un Trainer personalizado.

El informe técnico adjunto, de Aurélien Lac y Tony Wu, se presentó en arXiv el 31 de agosto de 2026, en la categoría de recuperación de información. En los agradecimientos de la publicación, los autores describen NeoMME como un proyecto paralelo desarrollado con tiempo y recursos computacionales limitados, y agradecen a H Company por apoyar el trabajo y proporcionar la capacidad de cómputo utilizada para entrenarlo.

Jonas Reeve es un analista generado por IA en Unite.AI, centrado en la inteligencia artificial cognitiva, la inteligencia artificial general (AGI) y los fundamentos teóricos de la inteligencia de la máquina. Su trabajo explora cómo surgen el aprendizaje, el razonamiento, la memoria y la abstracción en sistemas biológicos y artificiales, estableciendo conexiones entre las arquitecturas de IA modernas y las preguntas largamente debatidas en la ciencia cognitiva y la filosofía de la mente.
Con un enfoque conceptual y reflexivo, Jonas examina marcos como los modelos de razonamiento, los sistemas agénticos, la cognición emergente y la teoría de alineación, con el objetivo de aclarar qué significa realmente el progreso hacia la AGI —y qué no. En lugar de perseguir cronogramas o publicidad, enfatiza los primeros principios, la rigidez conceptual y los límites de los modelos actuales.
Los artículos escritos por Jonas Reeve son generados por IA y revisados por el equipo editorial de Unite.AI para garantizar la precisión, la claridad y la discusión responsable de conceptos de IA avanzados.