10 proyectos resueltos de IA generativa para potenciar su portafolio
Una colección de proyectos listos para implementar, desde un motor de búsqueda con respaldo de fuentes hasta estudios de generación musical y vídeo. Ideal para profesionales y equipos en América Latina que buscan mostrar habilidades prácticas en IA generativa.
Por qué construir proyectos resueltos
Los proyectos son el puente entre el aprendizaje teórico y la práctica profesional. En procesos de contratación y en decisiones internas de adopción tecnológica, lo que más pesa es la capacidad de resolver problemas reales. Un portafolio diverso y bien explicado demuestra no solo conocimientos técnicos, sino también criterio para diseñar flujos de trabajo, integrar herramientas y producir resultados útiles.
A continuación encontrará 10 proyectos resueltos que cubren un espectro desde sistemas de búsqueda con respaldo de fuentes hasta aplicaciones multimodales de audio y video. Para cada caso incluimos el objetivo, las herramientas recomendadas y lo que aprenderán al desarrollarlo. Muchos de los proyectos citan repositorios de referencia que pueden usarse como punto de partida.
1. Motor de búsqueda potenciado por IA
Objetivo: Construir un buscador que devuelva respuestas directas y fundamentadas en fuentes, en vez de solo enlaces.
Qué hace: Combina búsqueda web, generación de incrustaciones (embeddings), reranking y un LLM para entregar respuestas con citas y un modo de investigación profunda.
Herramientas sugeridas: Python, Next.js, SearXNG, Ollama, embeddings, vector search, APIs de LLM.
Qué aprenderán: Diseñar pipelines de recuperación, reranking, grounding, atribución de fuentes y arquitectura para modos de búsqueda especializados (por ejemplo, académico o YouTube).
Referencia: Perplexica (repositorio de arquitectura de referencia).
2. Generador multimodal de podcasts
Objetivo: Transformar artículos, PDFs, URLs o imágenes en episodios de podcast donde el contenido suena como una conversación entre varios anfitriones.
Qué hace: Ingresa distintos tipos de fuentes, extrae lo esencial, genera un guion estructurado en formato diálogo y lo convierte a audio con TTS de calidad.
Herramientas sugeridas: Python, APIs de Gemini/OpenAI/Anthropic, OpenAI TTS, ElevenLabs, podcastfy, Gradio.
Qué aprenderán: Ingesta multimodal, prompting para LLMs, generación de diálogo, text-to-speech, procesamiento de audio y generación de contenido largo.
Referencia: Podcastfy (workflow y código de ejemplo).
3. Estudio de generación de música con IA
Objetivo: Crear una aplicación que convierta prompts en lenguaje natural y letras en canciones completas y editables.
Qué hace: Permite controlar género, tempo, instrumentación, estructura y soporta remix o referencia de audio.
Herramientas sugeridas: Python, PyTorch, ACE-Step, Gradio, CUDA, Hugging Face.
Qué aprenderán: Modelos de difusión para audio, condicionamiento, inferencia en GPU y pipelines de generación y comparación de versiones.
Referencia: ACE-Step (repositorio de ejemplo).
4. Aplicación de generación sincronizada de audio y video
Objetivo: Generar clips de video con sonido sincronizado a partir de un único prompt o imágenes clave.
Qué hace: Soporta text-to-video, image-to-video, condicionamiento por keyframes y transformaciones de video, además de generar la banda sonora.
Herramientas sugeridas: Python, PyTorch, LTX-2, ComfyUI, Diffusers, CUDA.
Qué aprenderán: Difusión para video, sincronización audio-video, condicionamiento por keyframes y optimización de inferencia en GPU.
Referencia: LTX-Video (implementación de referencia).
5. Herramienta de lip-sync y doblaje con IA
Objetivo: Sincronizar los movimientos labiales de un hablante en video con un nuevo audio (por ejemplo, una traducción doblada).
Qué hace: Toma un video y una pista de audio traducida, genera una versión sincronizada y exportable.
Herramientas sugeridas: Python, PyTorch, Whisper, Stable Diffusion, LatentSync, FFmpeg, CUDA.
Qué aprenderán: Modelos de difusión aplicados a video, condicionamiento por audio, procesamiento temporal y consistencia visual para doblaje automatizado.
Referencia: LatentSync (pipeline de lip-sync disponible en GitHub).
6. Generador de voces multi‑hablante para formato largo
Objetivo: Convertir un guion escrito en una conversación natural entre múltiples voces para podcasts o audiolibros.
Qué hace: Un LLM genera el diálogo; los usuarios asignan voces a cada personaje y el sistema produce la pista de audio completa.
Herramientas sugeridas: Python, PyTorch, VibeVoice, Transformers, Gradio, CUDA.
Qué aprenderán: TTS neuronal, condicionamiento por hablante, generación larga, clonación de voz y pipelines de audio para producciones extendidas.
Referencia: VibeVoice (repositorio comunitario).
7. Estudio de edición de imágenes guiado por instrucciones
Objetivo: Permitir que usuarios editen imágenes existentes usando indicaciones en lenguaje natural.
Qué hace: Operaciones como eliminar objetos, cambiar colores o reemplazar fondos con prompts sencillos.
Herramientas sugeridas: Python, PyTorch, OmniGen2, Gradio, Hugging Face, ComfyUI.
Qué aprenderán: Prompting multimodal, condicionamiento de imágenes, modelos de difusión y técnicas de edición visual.
Referencia: OmniGen2 (implementación y ejemplos).
8. Generador de presentaciones con IA
Objetivo: Transformar un tema, documento o conjunto de datos en una presentación editable (PPTX).
Qué hace: Etapas de investigación, creación de esquema, selección de layouts, generación de visuales y exportación a un deck editable.
Herramientas sugeridas: TypeScript, React, Python, bibliotecas para generación de PPTX, APIs de LLM e imagen.
Qué aprenderán: Generación estructurada, procesamiento de documentos y conversión a formatos de presentación.
Referencia: Presenton (flujo de trabajo de referencia).
9. Asistente de investigación profunda
Objetivo: Construir un asistente que apoye la investigación compleja combinando recuperación, resúmenes y verificación de fuentes.
Qué hace: Integra búsquedas, embeddings y LLMs para producir resúmenes extensos con evidencia y pasos reproducibles para profundizar en un tema.
Herramientas sugeridas: Python, embeddings, vector search, LLM APIs, herramientas de scraping y procesamiento de documentos.
Qué aprenderán: Diseño de pipelines de investigación, verificación automática de fuentes, y cómo estructurar resultados para usuarios técnicos y tomadores de decisiones.
(Este proyecto toma elementos del motor de búsqueda potenciado por IA y los orienta a flujos de trabajo de investigación.)
10. Cómo sacar el máximo provecho del portafolio
- Documenten cada proyecto con su objetivo, arquitectura, decisiones clave y retos resueltos.
- Incluyan demos o links a deploys y un README con instrucciones reproducibles.
- Para audiencias en América Latina, exploren casos de uso locales: doblaje y localización de contenidos, generación de materiales educativos en lenguas regionales, podcasts sobre temas relevantes para mercados locales y automatización de procesos en industrias clave.
Conclusión
Estos 10 proyectos ofrecen una hoja de ruta práctica para demostrar competencias en IA generativa y construir soluciones aplicables en contextos empresariales y académicos. No es necesario completar todos: prioricen los que mejor se alineen con su rol o mercado objetivo y documente cada avance. Un portafolio bien estructurado puede abrir puertas en reclutamiento, inversores y colaboración con instituciones en la región.
Preguntas frecuentes (rápida)
- ¿Por dónde empezar? Empiecen con un proyecto pequeño que integre un LLM y una tarea de recuperación o generación (por ejemplo, motor de búsqueda o generador de presentaciones).
- ¿Qué mostrar en la demo? Un flujo completo: input, proceso (arquitectura), output y limitaciones observadas.
- ¿Qué considerar éticamente? Siempre indiquen fuentes, limiten el uso de voces o contenidos protegidos y comuniquen las limitaciones del sistema.
Fuente original: Analytics Vidhya