Cómo funciona Baidu Unlimited-OCR y por qué importa para documentos largos

Baidu presentó Unlimited-OCR como evolución de DeepSeek OCR para transcribir documentos multi-página con alta precisión y menor uso de memoria. La innovación clave: atacar tanto el volumen de tokens de entrada como el crecimiento de la caché de salida.

Por Redaccion TD
Cómo funciona Baidu Unlimited-OCR y por qué importa para documentos largos

Introducción

Hace poco Baidu lanzó Unlimited-OCR, una evolución sobre su trabajo anterior DeepSeek OCR pensada para transcribir documentos largos y multi-página de forma rápida y estable. A diferencia de sistemas OCR tradicionales, las modernas arquitecturas visión-lenguaje enfrentan dos cuellos de botella distintos al trabajar con documentos extensos: la explosión de tokens de entrada (visual tokens) y el crecimiento continuo de la caché Key-Value (KV) en el decodificador conforme se generan más tokens de salida. Unlimited-OCR mejora la eficiencia y la escalabilidad atacando ambos frentes.

Cómo “leen” una página los modelos visión-lenguaje

Los modelos visión-lenguaje no procesan píxel a píxel. Dividen cada página en una cuadrícula de pequeñas regiones —parches— y convierten cada parche en un embedding numérico: un token visual. Así una página se transforma en una secuencia de tokens que el transformer puede procesar.

Más parches implican mejor preservación de detalles (fuentes pequeñas, tablas complejas, escritura a mano) pero también mayor cantidad de tokens de entrada, más cómputo, mayor uso de memoria en GPU y latencia de inferencia más alta. Menos parches aceleran el proceso pero pueden perder información crítica. Esta es la primera de las dos grandes compensaciones que enfrentan estos sistemas.

El problema de dos frentes: tokens de entrada y de salida

  1. Tokens de entrada: Una página de alta resolución puede generar miles de tokens visuales. Para documentos de decenas o cientos de páginas esto se vuelve muy costoso en cómputo y memoria. La pregunta es: ¿cómo reducir tokens de entrada sin perder la información relevante?

  2. Tokens de salida: Tras procesar la entrada, el modelo genera la transcripción token por token. En los decodificadores transformer convencionales, cada token generado se guarda en la caché Key-Value (KV) para que los tokens futuros puedan atenderlo. Con documentos largos (cientos de páginas) la caché KV crece continuamente, consumiendo más memoria GPU y ralentizando la atención del decodificador. A diferencia del costo fijo de la etapa de entrada, este costo crece durante todo el proceso de decodificación y puede convertirse en el cuello de botella principal.

Ambos problemas requieren soluciones independientes: reducir tokens de entrada sin perder calidad visual y controlar el crecimiento de la caché de salida.

Cómo DeepSeek abordó la entrada: compresión óptica

DeepSeek OCR introdujo una estrategia efectiva para la primera parte del problema: compresión óptica de la representación visual. En lugar de convertir toda la página a un número muy alto de tokens, DeepSeek reduce la resolución de regiones menos relevantes y asigna más detalle solo a las áreas densas o críticas.

Un ejemplo ilustrativo incluido en el análisis muestra una página que normalmente generaría 1,000 tokens textuales; con la compresión se puede reducir hasta 16x y alimentarla al modelo con aproximadamente 128 tokens visuales. Esta reducción masiva baja el costo de cómputo manteniendo la mayor parte de la información útil. Según el paper de DeepSeek, a 10x de compresión la precisión se mantiene en alrededor del 97%; sin embargo, comprimir más allá de ciertos límites causa una caída pronunciada en la exactitud.

DeepSeek ofrecía varios modos de resolución (cinco, según la publicación), permitiendo un trade-off entre velocidad y detalle: menos tokens para inferencia más barata pero con pérdida de detalle, o más tokens para máxima fidelidad a costa de recursos.

Qué aporta Unlimited-OCR: resolver la caché de salida

Unlimited-OCR se construye sobre las ideas de DeepSeek, conservando la compresión óptica para la entrada y añadiendo soluciones para el problema de la salida: el crecimiento incontrolable de la caché KV durante la generación de transcripciones muy largas.

La idea clave es evitar que la memoria necesite crecer de forma lineal con cada token nuevo. En términos prácticos, esto implica estrategias para que el decodificador siga teniendo acceso al contexto necesario sin mantener todos los estados intermedios en memoria todo el tiempo. Entre las aproximaciones conceptuales que siguen esta línea están los esquemas de atención con ventana deslizante y mecanismos que conservan una referencia compacta del historial relevante. En la tabla de contenidos original del trabajo de Baidu se menciona explícitamente un método denominado Reference Sliding Window Attention (R-SWA), que combina una ventana móvil de tokens recientes con referencias condensadas del contexto anterior para controlar el tamaño de la caché.

Sin entrar en detalles de implementación que dependen del diseño interno, el beneficio práctico es claro: la memoria necesaria para decodificar no crece indefinidamente con cada token adicional, lo que permite transcribir documentos muy largos sin requerir GPUs con cantidades enormes de RAM. Esto, a su vez, mejora la velocidad y la estabilidad de la inferencia en escenarios reales.

¿Por qué importa esto para América Latina?

Latinoamérica enfrenta desafíos urgentes de digitalización: expedientes legales, historiales médicos, registros administrativos y archivos históricos. Muchas instituciones necesitan procesar grandes volúmenes de documentos multi-página, a menudo con limitaciones presupuestarias y de infraestructura. Las mejoras que propone Unlimited-OCR son relevantes por varias razones:

  • Reducción de costos de infraestructura: controlar la memoria de decodificación permite ejecutar cargas de trabajo pesadas en hardware más accesible o con menor consumo de GPU.
  • Mejor rendimiento en lotes grandes: para procesos de digitalización masiva (por ejemplo, tribunales, ministerios de salud), tiempos de procesamiento más predecibles y estables son valiosos.
  • Privacidad y despliegue local: al reducir requisitos de cómputo, es más factible desplegar soluciones on-premise en gobiernos y empresas que prefieren no enviar documentos sensibles a la nube.
  • Flexibilidad para documentos complejos: la compresión óptica mantiene gran parte del detalle necesario para tablas y escritura a mano, escenarios comunes en archivos latinoamericanos.

Consideraciones y limitaciones

Aunque Unlimited-OCR mejora la escalabilidad, no elimina por completo las compensaciones clásicas:

  • La compresión óptica sigue siendo un balance: a mayor compresión, menor gasto pero posible pérdida de detalles finos.
  • Las estrategias para controlar la caché implican seleccionar qué contexto se mantiene y qué se descarta o resume; en documentos con referencias largas y dependencia contextual, la selección incorrecta puede afectar la fidelidad.
  • Integración y costos operativos: aunque la memoria por documento baje, existe trabajo de ingeniería para integrar y optimizar estos modelos en flujos de trabajo locales.

Recomendaciones prácticas

  • Piloten con conjuntos reales: prueben diferentes modos de compresión sobre sus propios tipos de documentos (actas, facturas, historiales) para medir precisión versus costo.
  • Valoren despliegues mixtos: combinar procesamiento local para datos sensibles y nube para volúmenes puntuales puede ser una estrategia costo-efectiva.
  • Supervisen calidad en partes críticas: para documentos legales o médicos, mantengan revisiones humanas en secciones de alto riesgo.

Conclusión

Unlimited-OCR representa un paso importante en la transcripción automática de documentos largos: mantiene las mejoras de DeepSeek en compresión óptica para reducir tokens de entrada y añade mecanismos para contener la explosión de memoria en la etapa de decodificación. Para organizaciones en América Latina que buscan digitalizar grandes volúmenes de documentos, estas innovaciones pueden traducirse en menor costo de infraestructura, mayor velocidad y viabilidad de despliegues locales. Sin embargo, como en cualquier tecnología de IA aplicada a procesamiento de documentos, es necesario probar en datos reales y ajustar los parámetros de compresión y atención según las necesidades y riesgos específicos.

Fuente original: Analytics Vidhya