NeoMME: un encoder multimodal y multilingüe eficiente para documentos visuales
NeoMME es una familia de encoders multimodales de 260M y 800M parámetros que procesa texto y parches de imagen en un único Transformer bidireccional. Entrenado desde cero con un objetivo de difusión discreta enmascarada, ofrece altas tasas de recuperación y eficiencia en almacenamiento.
Qué es NeoMME y por qué importa
NeoMME (pronunciado “nee-oh-me”) es una familia de encoders foundation multimodales y multilingües (260M y 800M parámetros) diseñada para generar representaciones vectoriales tanto de texto como de imágenes. A diferencia de muchos modelos visual-language que combinan una torre visual preentrenada y un decodificador causal, NeoMME integra texto y parches de imagen en un único Transformer bidireccional entrenado desde cero. Esto reduce la sobrecarga de parámetros y de cómputo innecesaria para tareas como recuperación de documentos, clasificación o etiquetado de tokens, que no requieren generación autoregresiva de texto.
Para equipos técnicos y tomadores de decisión en América Latina, NeoMME representa una alternativa interesante: permite trabajar directamente con capturas de página (page-image) —preservando diseño, tablas y tipografías— evitando pasos costosos y frágiles de OCR en flujos de trabajo de gestión documental, archivos, justicia, salud o educación.
Arquitectura: un solo Transformer para texto e imagen
NeoMME utiliza un único backbone Transformer para procesar entradas nativas multimodales:
- Entrada unificada: el texto usa embeddings tokenizados por un BPE multilingüe y las imágenes se dividen en parches no solapados de 32×32, proyectados mediante un pequeño MLP. Ambos tipos de tokens siguen el mismo camino computacional dentro del encoder.
- Resolución de imagen dinámica: las imágenes mantienen su proporción y tamaño, lo que permite más tokens en páginas con alta densidad de información sin forzar un recorte o reescalado excesivo.
- Contexto largo bidireccional: ambos tamaños de modelo manejan una longitud de contexto de 16,384 tokens, suficiente para procesar hasta dos imágenes 4K en un solo pase.
- Atención eficiente: la mayoría de las capas usan atención por ventana deslizante simétrica, mientras que cada sexta capa y la última usan atención global para mantener conectividad a largo alcance.
- Mejoras modernas de encoder: el stack incorpora grouped-query attention, normalización query-key, gated attention, embeddings rotatorios 2D y MLPs con squared-ReLU, entre otras optimizaciones.
- Tokenización multilingüe: se entrenó un BPE desde cero con un vocabulario de 131k tokens sobre texto multilingüe, código, matemáticas y transcripciones de imágenes generadas por máquina.
Aprendizaje desde imágenes usando enmascaramiento de texto
NeoMME se preentrenó con un objetivo de denoising tipo difusión discreta enmascarada. El procedimiento mezcla ejemplos solo de texto y multimodales:
- Para ejemplos solo texto, se muestrea una tasa de corrupción uniforme entre 0 y 1 y se enmascara cada token elegible a esa tasa.
- Para ejemplos multimodales, las tasas de corrupción varían entre 0.3 y 1; los parches de imagen permanecen visibles mientras el modelo reconstruye texto enmascarado.
Con tasas altas de enmascaramiento, el modelo no puede apoyarse en atajos puramente lingüísticos y aprende descripciones ancladas en la evidencia visual. El preentrenamiento mezcló texto, código, matemáticas, imágenes naturales e imágenes de documentos.
En total, cada variante procesó alrededor de 524 mil millones de tokens empaquetados, de los cuales 290 mil millones provinieron de ejemplos solo texto. Para mejorar la eficiencia con este presupuesto de texto relativamente moderado, los autores usaron el optimizador NorMuon.
NeoMME-Retriever: recuperación de páginas como imágenes
Para evaluar el encoder en un escenario real, NeoMME se afinó para recuperación visual de documentos usando la metodología page-image de ColPali. En lugar de recuperar fragmentos de texto, NeoMME-Retriever ordena capturas de página completas, evitando todo el pipeline de OCR y conservando información de layout, gráficos, tablas y tipografía que son críticos en documentos profesionales.
Diseño dual-head NeoMME-Retriever reutiliza el backbone y agrega dos cabezas entrenadas conjuntamente:
- Cabeza densa: promedia la representación del backbone para generar embeddings densos.
- Cabeza de late-interaction: produce representaciones optimizadas para interacciones tardías entre query y documento.
Ambas salidas se generan en un único pase hacia adelante, lo que simplifica la inferencia y reduce latencias en sistemas de búsqueda.
Rendimiento y eficiencia en almacenamiento
En benchmarks de visual document retrieval (ViDoRe v3), ambas variantes de NeoMME quedaron en la frontera de Pareto para nDCG@10 frente al tamaño del modelo. Algunos resultados clave:
- A tamaño de entrada de 2048×2048 en una GPU NVIDIA L40S, el modelo de 260M codifica aproximadamente 51 páginas por segundo —aproximadamente el doble del throughput de ColModernVBERT en las mismas condiciones.
- Mediante pooling jerárquico de tokens y cuantización asimétrica en el esquema de late-interaction, el almacenamiento por página en el índice se redujo de ~1.5 MB a solo 6 kB por página, es decir, alrededor de 255× menos espacio, manteniendo más del 95% del nDCG@10 de referencia.
Estos números son relevantes para despliegues en la nube o en entornos con almacenamiento y costos operativos limitados: reducciones masivas en espacio de índice y aumentos en throughput pueden traducirse en menores costos y mejor respuesta para usuarios finales.
Implicaciones prácticas para América Latina
Para organizaciones en América Latina que gestionan grandes volúmenes de documentos escaneados—gobiernos locales, universidades, bufetes, bancos y archivos—NeoMME ofrece ventajas concretas:
- Menos dependencia de OCR: recuperar páginas como imágenes preserva elementos visuales clave y reduce errores introducidos por OCR en documentos complejos o multilingües.
- Ahorro en infraestructura: la reducción en tamaño de índice y la alta velocidad de codificación implican menor gasto en almacenamiento y GPUs para servicios de búsqueda.
- Multilingüismo y formatos mixtos: el tokenizer y el preentrenamiento contemplan múltiples lenguas, código y matemáticas, lo que ayuda en contextos técnicos y académicos comunes en la región.
Sin embargo, como con cualquier modelo foundation, conviene evaluar su rendimiento en colecciones locales, sesgos en los datos y requisitos legales o de privacidad antes de un despliegue a escala.
Disponibilidad y licencia
NeoMME y sus checkpoints están disponibles en Hugging Face Transformers y se distribuyen bajo la licencia Apache 2.0. También se publicaron una colección en Hugging Face, un reporte técnico y una demo de Visual RAG para explorar casos de uso.
Conclusión
NeoMME propone una vuelta de tuerca en encoders multimodales al integrar texto e imagen en un único Transformer bidireccional entrenado desde cero con un objetivo de difusión discreta enmascarada. Para tareas de recuperación visual de documentos, muestra mejoras en eficiencia de cómputo y almacenamiento sin sacrificar calidad de ranking. Esto lo convierte en una opción atractiva para proyectos que buscan simplificar pipelines documentales complejos y optimizar costos operativos, una propuesta especialmente relevante para organizaciones en América Latina que manejan grandes repositorios de documentos visuales.
Para quienes evalúan tecnologías de IA para gestión documental, el código abierto y la licencia Apache 2.0 facilitan la experimentación y adopción, siempre considerando las pruebas específicas en datos locales y controles de privacidad necesarios.
Fuente original: Hugging Face Blog