Baseten llega al Hub de Hugging Face: más opciones de inferencia serverless
Baseten ya es un Inference Provider soportado por Hugging Face, lo que permite ejecutar modelos serverless desde las páginas del Hub y a través de los SDKs oficiales. Esta integración facilita el uso de LLMs y modelos de generación de texto con opciones de enrutamiento y facturación adaptables.
Qué anuncia la integración
Hugging Face anunció que Baseten ahora figura como Inference Provider soportado en el Hub. Esto amplía el ecosistema de proveedores disponibles para ejecutar modelos en modo serverless directamente desde las páginas de modelos y a través de los SDKs oficiales de Hugging Face. En esta primera etapa Baseten habilita tareas conversacionales y de generación de texto, dando acceso a modelos de peso abierto como Kimi K3, DeepSeek V4 Flash (versión más reciente) y GLM-5.2, entre otros. El soporte para tareas adicionales se irá desplegando próximamente.
Para desarrolladores y equipos en América Latina esto significa más alternativas para desplegar capacidades de IA sin gestionar infraestructura compleja, y la posibilidad de escoger proveedores según necesidades técnicas y comerciales.
Cómo funciona desde la interfaz web
En la configuración de usuario del Hub pueden configurar proveedores de inferencia de dos maneras principales:
- Establecer claves API propias para los proveedores con los que se hayan registrado. Si se define una clave personalizada, las llamadas irán directamente al proveedor usando esa clave.
- No establecer clave personalizada: en ese caso las peticiones se enrutan a través de Hugging Face (HF) y se facturan en su cuenta de HF.
Además, pueden ordenar los proveedores por preferencia. Esa prioridad se aplica al widget y a los fragmentos de código que aparecen en las páginas de modelos. Las páginas de modelo muestran los proveedores de terceros compatibles con ese modelo, ordenados según la preferencia del usuario.
Dos modos de uso explicados de forma simple:
- Modo con clave personalizada: las llamadas van directo al proveedor (p. ej. Baseten) y la facturación la maneja el proveedor correspondiente.
- Modo enrutado por Hugging Face: no necesitan la clave del proveedor; las solicitudes pasan por HF y se cobran en la cuenta de HF.
Uso desde los SDKs oficiales
Baseten está disponible a través de los SDKs de Hugging Face: en Python mediante huggingface_hub (>= 1.26.1) y en JavaScript con @huggingface/inference. La integración permite invocar modelos alojados en Baseten utilizando un token de Hugging Face; HF enruta la petición a Baseten automáticamente cuando corresponda.
Ejemplo simplificado en Python (autenticación con token de Hugging Face, petición enruta a Baseten):
import os
from openai import OpenAI
client = OpenAI(
base_url="https://router.huggingface.co/v1",
api_key=os.environ["HF_TOKEN"],
)
completion = client.chat.completions.create(
model="deepseek-ai/DeepSeek-V4-Flash-0731:baseten",
messages=[
{"role": "user", "content": "Escribe una función en Python que calcule el n-ésimo número de Fibonacci usando memoización."}
],
)
print(completion.choices[0].message)
Y el mismo flujo en JavaScript:
import { OpenAI } from "openai";
const client = new OpenAI({
baseURL: "https://router.huggingface.co/v1",
apiKey: process.env.HF_TOKEN,
});
const chatCompletion = await client.chat.completions.create({
model: "deepseek-ai/DeepSeek-V4-Flash-0731:baseten",
messages: [
{ role: "user", content: "Escribe una función en Python que calcule el n-ésimo número de Fibonacci usando memoización." },
],
});
console.log(chatCompletion.choices[0].message);
Estos ejemplos muestran cómo consumir modelos hospedados en Baseten sin cambiar la experiencia de integración si ya usan los SDKs de Hugging Face.
Integración con Agent Harnesses
Los Inference Providers de Hugging Face están integrados con la mayoría de los Agent Harnesses, incluidos Pi, OpenCode, Hermes Agents y OpenClaw, entre otros. Esto permite conectar modelos alojados en Baseten directamente a estas herramientas sin necesidad de código adicional para la integración.
Para equipos que implementan agentes conversacionales o pipelines automatizados, esta compatibilidad reduce el trabajo de orquestación y acelera las pruebas de modelos.
Facturación y créditos
La facturación depende del modo de uso:
- Peticiones directas (con clave del proveedor): el proveedor factura la cuenta correspondiente. Si usan una clave de Baseten, la factura llegará a la cuenta de Baseten.
- Peticiones enrutadas por Hugging Face: los cargos se aplican a la cuenta de Hugging Face. HF solo reenvía los costos del proveedor, sin recargo adicional. En el futuro podrían existir acuerdos de revenue-sharing con proveedores.
Dato útil: los usuarios PRO de Hugging Face reciben 2 USD en créditos de Inference cada mes, que pueden usar a través de proveedores. HF también ofrece una cuota gratuita de inferencia para usuarios que inician sesión, aunque recomiendan actualizar a PRO para mayores límites y características adicionales como ZeroGPU y Spaces Dev Mode.
Consideraciones prácticas para equipos en América Latina
-
Gobernanza y facturación: elegir entre clave propia o enrutamiento por HF depende de su estructura de costos y control. Si requieren consolidar facturación o centralizar auditoría, el enrutamiento por HF puede simplificar la gestión. Si necesitan control directo sobre cuentas y límites en el proveedor, usar la clave propia es la opción adecuada.
-
Latencia y cumplimiento: al usar proveedores externos, verifiquen políticas de datos y latencia. Para aplicaciones sensibles a la privacidad o que deban cumplir regulaciones locales, revisen los términos de servicio y las políticas de retención de datos del proveedor.
-
Probar antes de producir: la diversidad de modelos disponibles permite comparar rendimiento y costos. Aprovechen la compatibilidad con Agent Harnesses para pruebas rápidas en flujos reales de usuario.
Próximos pasos y feedback
Baseten anuncia que irá agregando soporte para más tareas; la lista completa de modelos compatibles está disponible en el Hub. Hugging Face invita a la comunidad a compartir comentarios y sugerencias a través de su espacio de discusiones.
Si lideran equipos de producto o desarrollo en la región, esta integración ofrece una vía práctica para experimentar con modelos de última generación sin invertir en infraestructura propia desde el primer día. Pueden comenzar probando modelos vía el Hub, evaluar costos con los dos modos de facturación y decidir la mejor configuración según su gobernanza y necesidades técnicas.
Para comentarios y discusiones, Hugging Face habilitó un espacio donde recogen retroalimentación de la comunidad.
Conclusión
La llegada de Baseten como Inference Provider en Hugging Face Hub amplía las opciones para ejecutar modelos serverless, facilita el acceso a LLMs y modelos de generación de texto, e integra soporte desde los SDKs y Agent Harnesses más usados. Para equipos en América Latina, representa una oportunidad para acelerar prototipos y desplegar soluciones de IA con menor fricción operativa, siempre evaluando aspectos de facturación, cumplimiento y latencia según el caso de uso.
Fuente original: Hugging Face Blog