Bodhan AI lanza cuatro modelos Indic para OCR, traducción, transcripción y voz
Bodhan AI y AI4Bharat publicaron en septiembre de 2026 cuatro modelos que abordan OCR estructural, traducción de documentos, reconocimiento automático de voz y síntesis de voz para lenguas indias. Revisamos arquitectura, métricas y aplicaciones prácticas.
Resumen ejecutivo
En septiembre de 2026 Bodhan AI, en colaboración con AI4Bharat, publicó un conjunto de cuatro modelos diseñados para procesar contenido multilingüe y multiscript en las 22 lenguas programadas de la India más el inglés. Los modelos cubren: OCR con preservación de la estructura de página (IndicOCR), traducción de documentos (Indic-Translate), reconocimiento de voz (Indic-Transcribe) y generación de voz que maneja texto mixto (Indic-Speak). Este lanzamiento representa uno de los avances más amplios en infraestructura de IA para lenguas indias desde el Indic-LM Arena de 2025.
Para los tomadores de decisiones y equipos técnicos en América Latina, el paquete ofrece un ejemplo de cómo abordar la complejidad de entornos multilingües y mixtos —algo relevante para países con diversidad lingüística y necesidades de digitalización y accesibilidad— aunque las soluciones deben adaptarse a diferencias de script, fonética y recursos locales.
Los cuatro modelos en síntesis
- IndicOCR: convierte imágenes de página en texto estructurado. Arquitectura: parser de layout de 33M y OCR de 0.8B.
- Indic-Translate: traducción de documentos basada en un fine-tune de Gemma 4 (4B parámetros efectivos y ventana de contexto de 32K tokens).
- Indic-Transcribe: familia ASR con dos variantes Core y Flex, ambos de 1.2B parámetros.
- Indic-Speak: síntesis de voz para texto mixto, stack de 3.36B y 45 voces.
IndicOCR: texto y estructura
IndicOCR está pensado para leer documentos impresos en inglés y las 22 lenguas programadas de la India, sobre 13 escrituras distintas. Reconoce además manuscritos en inglés y en 12 lenguas (entre ellas hindi, bengalí, tamil, telugu y urdu). Su flujo en dos etapas usa:
- IndicDocLayout (33M), basado en PP-DocLayoutV3, para identificar bloques de página y orden de lectura.
- IndicBlockOCR (basado en Qwen3.5-0.8B con tokenizador Sarvam) para transcribir cada bloque.
El sistema intenta preservar la estructura: tablas mantienen su formato y las ecuaciones se convierten a LaTeX. En pruebas, Bodhan reporta 92.76 en OmniDocBench v1.6 (subconjunto inglés de 610 páginas) y 82.20 en el subconjunto inglés de olmOCR-Bench. Su benchmark interno IndicOCR-Printed señala 86.2% de exactitud a nivel de palabra en textos impresos a través de las 22 lenguas y el inglés.
Limitaciones identificadas incluyen dificultades con órdenes de lectura muy densas, manuscritos complejos y diseños fuera del ámbito educativo. La soportabilidad de escritura a mano para las 10 lenguas restantes está en la hoja de ruta.
Dónde encaja: digitalización de libros de texto, archivado regional y preparación de páginas escaneadas para búsquedas o para sistemas RAG (retrieval-augmented generation).
Indic-Translate: traducción a nivel de documento
Indic-Translate es un fine-tune sobre Gemma 4 E4B IT, con 4B parámetros efectivos y capacidad de contexto de 32K tokens. Soporta traducciones entre inglés y las 22 lenguas programadas en ambos sentidos y está entrenado para preservar elementos estructurales como Markdown, LaTeX, tablas y bloques de código; además maneja texto romanizado, transliteración y entradas code-mixed.
En la evaluación interna por documento, Indic-Translate alcanza 58.97 dBLEU frente a 47.44 de Sarvam Translate y 31.93 de IndicTrans2-1B. En tasa de error por palabra (WER) registra 0.4326 comparado con 0.5553 y 0.8304, respectivamente. Bodhan indica liderazgo en estas métricas en las 22 lenguas evaluadas, aunque la evaluación humana aún está en curso, por lo que no se declara un ganador universal.
Limitaciones prácticas: la ventana de 32K tokens ayuda con documentos largos, pero no permite procesar un PDF ilimitado en una sola petición. Además, la traducción directa entre dos lenguas indias aún está en el roadmap; hoy la ruta descrita pasa por traducción vía inglés. Bodhan también señala margen de mejora en la fluidez de oraciones del inglés a lenguas indias.
Dónde encaja: localización de contenido educativo y técnico, manuales y bases de conocimiento donde es importante mantener la estructura y formato del documento.
Indic-Transcribe: precisión o flexibilidad de script
Indic-Transcribe incluye dos modelos ASR de 1.2B parámetros: Core y Flex. Su cobertura alcanza las 22 lenguas programadas, inglés, Bhili y Bhojpuri; la versión Flex añade Haryanvi y Chhattisgarhi en la lista.
- Core prioriza transcripciones precisas en script nativo.
- Flex permite salida en script nativo, romanizada o en modo mixto (mantiene palabras nativas en su escritura y permite términos en inglés y números en caracteres latinos).
La evaluación en Voice of India (15 lenguas) muestra 8.7 OIWER para Core y 11.1 para Flex según el blog de lanzamiento; el card en Hugging Face reporta un promedio ligeramente distinto para Flex (11.3). OIWER es una métrica que acepta variantes documentadas de ortografía y transliteración, reduciendo penalizaciones por variantes válidas.
Ambos modelos usan un encoder FastConformer derivado de Canary y un decoder Transformer de 24 capas. Bodhan reporta entrenamiento con 1.3 millones de horas de audio usando supervisión débil, síntesis y datos etiquetados por humanos.
Limitaciones: el procesamiento se hace en ventanas de hasta 30 segundos, por lo que grabaciones largas requieren segmentación. Funcionalidades como streaming en tiempo real, diarización de hablantes y separación de hablantes superpuestos están planificadas para futuras versiones.
Dónde encaja: transcripción de clases grabadas, entrevistas y notas de voz en lenguas regionales; elegir Core cuando la fidelidad al script nativo sea crítica y Flex cuando el formato del texto de salida sea un requisito del producto.
Indic-Speak: síntesis para texto mixto
Indic-Speak está diseñado para generar voz a partir de texto que mezcla lenguas y scripts (por ejemplo, términos ingleses dentro de un texto en una lengua india). Según el paquete técnico, el stack de síntesis tiene 3.36B parámetros y ofrece 45 voces. Su objetivo es leer contenido mixto preservando pronunciaciones y manejo de préstamos lingüísticos.
Aplicaciones naturales incluyen lectura en voz alta de material educativo multilingüe, creación de audiocontenido accesible y generación de audio para interfaces conversacionales en entornos con code-mixing frecuente.
Acceso y adopción
Los modelos se publicaron como parte del esfuerzo de Bodhan AI con AI4Bharat; el lanzamiento incluye datos de bench y modelos disponibles en plataformas públicas asociadas al proyecto. Para equipos en América Latina, la ruta de adopción habitual es evaluar la compatibilidad técnica con su infraestructura, validar la cobertura lingüística y diseñar pipelines que incluyan preprocesamiento de layout, segmentación de audio y postprocesamiento de traducción/transcripción.
Oportunidades para América Latina
Aunque los modelos están centrados en lenguas indias, el enfoque modular y las lecciones técnicas son aplicables a contextos latinoamericanos:
- Digitalización y estructuración de material educativo en lenguas indígenas y español regional.
- Localización de contenidos técnicos manteniendo formatos (tablas, código, ecuaciones).
- Transcripción y accesibilidad para radio comunitaria, entrevistas y recursos orales.
- Síntesis de voz para servicios públicos y educación remota, especialmente donde hay mezcla de lenguas o uso de términos extranjeros.
Conclusión
El conjunto de modelos de Bodhan AI y AI4Bharat marca un avance amplio en soporte para entornos multilingües y multiscript. Aporta herramientas prácticas para transformar imágenes en texto estructurado, traducir documentos conservando formato, transcribir audio con opciones de salida flexibles y generar voz que maneje contenido mixto. Para América Latina, el lanzamiento es relevante como referencia técnica y estratégica para proyectos que buscan atender diversidad lingüística y modernizar contenidos analógicos.
Aunque las métricas mostradas son prometedoras, las limitaciones reconocidas por los autores —soporte de manuscritos incompletos, segmentación de audio, y necesidad de evaluaciones humanas en traducción— ilustran que la integración en productos debe acompañarse de pruebas de calidad y adaptación local.
Preguntas frecuentes (rápido)
- ¿Cubren estos modelos lenguas no programadas o dialectos? Actualmente cubren las 22 lenguas programadas y algunos dialectos adicionales en distintos modelos; la cobertura exacta varía por componente.
- ¿Pueden procesar documentos largos de una sola vez? No: la traducción tiene límite de contexto (32K tokens) y la transcripción maneja ventanas de audio de hasta 30 segundos.
- ¿Son opciones para producción inmediata? Pueden integrarse en flujos productivos pero conviene validar con datos reales, especialmente para manuscritos complejos, dialectos locales y entornos ruidosos.
Fuente original: Analytics Vidhya