10 proyectos resueltos de IA generativa para potenciar su portafolio

Una colección de proyectos listos para implementar, desde un motor de búsqueda con respaldo de fuentes hasta estudios de generación musical y vídeo. Ideal para profesionales y equipos en América Latina que buscan mostrar habilidades prácticas en IA generativa.

Por Redaccion TD
10 proyectos resueltos de IA generativa para potenciar su portafolio

Por qué construir proyectos resueltos

Los proyectos son el puente entre el aprendizaje teórico y la práctica profesional. En procesos de contratación y en decisiones internas de adopción tecnológica, lo que más pesa es la capacidad de resolver problemas reales. Un portafolio diverso y bien explicado demuestra no solo conocimientos técnicos, sino también criterio para diseñar flujos de trabajo, integrar herramientas y producir resultados útiles.

A continuación encontrará 10 proyectos resueltos que cubren un espectro desde sistemas de búsqueda con respaldo de fuentes hasta aplicaciones multimodales de audio y video. Para cada caso incluimos el objetivo, las herramientas recomendadas y lo que aprenderán al desarrollarlo. Muchos de los proyectos citan repositorios de referencia que pueden usarse como punto de partida.

1. Motor de búsqueda potenciado por IA

Objetivo: Construir un buscador que devuelva respuestas directas y fundamentadas en fuentes, en vez de solo enlaces.

Qué hace: Combina búsqueda web, generación de incrustaciones (embeddings), reranking y un LLM para entregar respuestas con citas y un modo de investigación profunda.

Herramientas sugeridas: Python, Next.js, SearXNG, Ollama, embeddings, vector search, APIs de LLM.

Qué aprenderán: Diseñar pipelines de recuperación, reranking, grounding, atribución de fuentes y arquitectura para modos de búsqueda especializados (por ejemplo, académico o YouTube).

Referencia: Perplexica (repositorio de arquitectura de referencia).

2. Generador multimodal de podcasts

Objetivo: Transformar artículos, PDFs, URLs o imágenes en episodios de podcast donde el contenido suena como una conversación entre varios anfitriones.

Qué hace: Ingresa distintos tipos de fuentes, extrae lo esencial, genera un guion estructurado en formato diálogo y lo convierte a audio con TTS de calidad.

Herramientas sugeridas: Python, APIs de Gemini/OpenAI/Anthropic, OpenAI TTS, ElevenLabs, podcastfy, Gradio.

Qué aprenderán: Ingesta multimodal, prompting para LLMs, generación de diálogo, text-to-speech, procesamiento de audio y generación de contenido largo.

Referencia: Podcastfy (workflow y código de ejemplo).

3. Estudio de generación de música con IA

Objetivo: Crear una aplicación que convierta prompts en lenguaje natural y letras en canciones completas y editables.

Qué hace: Permite controlar género, tempo, instrumentación, estructura y soporta remix o referencia de audio.

Herramientas sugeridas: Python, PyTorch, ACE-Step, Gradio, CUDA, Hugging Face.

Qué aprenderán: Modelos de difusión para audio, condicionamiento, inferencia en GPU y pipelines de generación y comparación de versiones.

Referencia: ACE-Step (repositorio de ejemplo).

4. Aplicación de generación sincronizada de audio y video

Objetivo: Generar clips de video con sonido sincronizado a partir de un único prompt o imágenes clave.

Qué hace: Soporta text-to-video, image-to-video, condicionamiento por keyframes y transformaciones de video, además de generar la banda sonora.

Herramientas sugeridas: Python, PyTorch, LTX-2, ComfyUI, Diffusers, CUDA.

Qué aprenderán: Difusión para video, sincronización audio-video, condicionamiento por keyframes y optimización de inferencia en GPU.

Referencia: LTX-Video (implementación de referencia).

5. Herramienta de lip-sync y doblaje con IA

Objetivo: Sincronizar los movimientos labiales de un hablante en video con un nuevo audio (por ejemplo, una traducción doblada).

Qué hace: Toma un video y una pista de audio traducida, genera una versión sincronizada y exportable.

Herramientas sugeridas: Python, PyTorch, Whisper, Stable Diffusion, LatentSync, FFmpeg, CUDA.

Qué aprenderán: Modelos de difusión aplicados a video, condicionamiento por audio, procesamiento temporal y consistencia visual para doblaje automatizado.

Referencia: LatentSync (pipeline de lip-sync disponible en GitHub).

6. Generador de voces multi‑hablante para formato largo

Objetivo: Convertir un guion escrito en una conversación natural entre múltiples voces para podcasts o audiolibros.

Qué hace: Un LLM genera el diálogo; los usuarios asignan voces a cada personaje y el sistema produce la pista de audio completa.

Herramientas sugeridas: Python, PyTorch, VibeVoice, Transformers, Gradio, CUDA.

Qué aprenderán: TTS neuronal, condicionamiento por hablante, generación larga, clonación de voz y pipelines de audio para producciones extendidas.

Referencia: VibeVoice (repositorio comunitario).

7. Estudio de edición de imágenes guiado por instrucciones

Objetivo: Permitir que usuarios editen imágenes existentes usando indicaciones en lenguaje natural.

Qué hace: Operaciones como eliminar objetos, cambiar colores o reemplazar fondos con prompts sencillos.

Herramientas sugeridas: Python, PyTorch, OmniGen2, Gradio, Hugging Face, ComfyUI.

Qué aprenderán: Prompting multimodal, condicionamiento de imágenes, modelos de difusión y técnicas de edición visual.

Referencia: OmniGen2 (implementación y ejemplos).

8. Generador de presentaciones con IA

Objetivo: Transformar un tema, documento o conjunto de datos en una presentación editable (PPTX).

Qué hace: Etapas de investigación, creación de esquema, selección de layouts, generación de visuales y exportación a un deck editable.

Herramientas sugeridas: TypeScript, React, Python, bibliotecas para generación de PPTX, APIs de LLM e imagen.

Qué aprenderán: Generación estructurada, procesamiento de documentos y conversión a formatos de presentación.

Referencia: Presenton (flujo de trabajo de referencia).

9. Asistente de investigación profunda

Objetivo: Construir un asistente que apoye la investigación compleja combinando recuperación, resúmenes y verificación de fuentes.

Qué hace: Integra búsquedas, embeddings y LLMs para producir resúmenes extensos con evidencia y pasos reproducibles para profundizar en un tema.

Herramientas sugeridas: Python, embeddings, vector search, LLM APIs, herramientas de scraping y procesamiento de documentos.

Qué aprenderán: Diseño de pipelines de investigación, verificación automática de fuentes, y cómo estructurar resultados para usuarios técnicos y tomadores de decisiones.

(Este proyecto toma elementos del motor de búsqueda potenciado por IA y los orienta a flujos de trabajo de investigación.)

10. Cómo sacar el máximo provecho del portafolio

  • Documenten cada proyecto con su objetivo, arquitectura, decisiones clave y retos resueltos.
  • Incluyan demos o links a deploys y un README con instrucciones reproducibles.
  • Para audiencias en América Latina, exploren casos de uso locales: doblaje y localización de contenidos, generación de materiales educativos en lenguas regionales, podcasts sobre temas relevantes para mercados locales y automatización de procesos en industrias clave.

Conclusión

Estos 10 proyectos ofrecen una hoja de ruta práctica para demostrar competencias en IA generativa y construir soluciones aplicables en contextos empresariales y académicos. No es necesario completar todos: prioricen los que mejor se alineen con su rol o mercado objetivo y documente cada avance. Un portafolio bien estructurado puede abrir puertas en reclutamiento, inversores y colaboración con instituciones en la región.

Preguntas frecuentes (rápida)

  • ¿Por dónde empezar? Empiecen con un proyecto pequeño que integre un LLM y una tarea de recuperación o generación (por ejemplo, motor de búsqueda o generador de presentaciones).
  • ¿Qué mostrar en la demo? Un flujo completo: input, proceso (arquitectura), output y limitaciones observadas.
  • ¿Qué considerar éticamente? Siempre indiquen fuentes, limiten el uso de voces o contenidos protegidos y comuniquen las limitaciones del sistema.

Fuente original: Analytics Vidhya