Tres nuevos providers de modelos: Ramp Router, Nebius Token Factory y Tencent TokenPlan


La experiencia con los providers de modelos se está dividiendo rápido: unos quieren «una API key para todos los modelos y una sola factura», otros quieren pay-as-you-go puro sin compromiso mensual, y algunos ya compraron una suscripción en algún sitio y solo quieren enchufarla a Hermes. El 29 de agosto, tres nuevos providers se unieron a la fiesta el mismo día: Ramp Router (el gateway LLM de router.com), Nebius Token Factory (la inferencia pay-as-you-go de Nebius) y Tencent TokenPlan (la suscripción token-plan de Tencent Cloud Hunyuan) — este último además trae el modelo hy4-preview al catálogo oficial. Los tres PRs (#97915, #97916, #97917) están fusionados en main.

Los tres, en una línea cada uno

Provider Qué es Para quién
Ramp Router Un endpoint compatible con OpenAI Responses; enrutado del lado del servidor a OpenAI/Anthropic/xAI/Fireworks y más, con fallbacks unificados y controles de gasto Equipos que quieren una sola key para todos los modelos y una única factura
Nebius Token Factory Inferencia pay-as-you-go de Nebius, compatible con OpenAI Desarrolladores con uso irregular que no quieren suscripciones
Tencent TokenPlan Suscripción token-plan de Tencent Cloud Hunyuan (endpoint compatible con Anthropic), facturada por plan mensual Usuarios que ya tienen un TokenPlan de Tencent Cloud

1. Ramp Router: el provider gateway

El gateway LLM construido por Ramp (sí, la empresa fintech). Un solo endpoint — https://api.router.com/v1 — y una sola key; las peticiones se enrutan del lado del servidor a OpenAI, Anthropic, xAI, Fireworks y otros, con fallbacks y controles de gasto que el servicio gestiona por ti. Se acabó mantener varias upstream keys y lógica de fallback por tu cuenta.

Detalles que merece la pena conocer de la integración con Hermes:

  • La API Responses es el cable nativo (se exige api_mode="codex_responses"): el /v1/responses de Router es la interfaz real; /v1/chat/completions es solo un shim de compatibilidad mínimo añadido en agosto, así que Hermes se mantiene en la línea nativa;
  • El catálogo de modelos está acotado por cuenta: los IDs de modelo válidos vienen del GET /v1/models de tu key (las cuentas BYOK ven entradas extra), así que el perfil oficial no incluye ningún modelo fallback hardcodeado — lo que ves en el picker se obtiene en vivo;
  • Validación estricta del reasoning effort: Router valida reasoning.effort contra el vocabulario declarado de cada modelo y rechaza combinaciones no soportadas con HTTP 400. Hermes cachea las capacidades del catálogo de Router y ajusta (clampa) antes de enviar;
  • Las peticiones llevan el User-Agent Hermes-Agent.

El plugin (router-provider) está escrito por Neel Patel, de Ramp, con verificación en vivo contra api.router.com realizada en agosto de 2026.

2. Nebius Token Factory: inferencia pay-as-you-go

La «Token Factory» de Nebius es su servicio de inferencia pay-as-you-go, compatible con OpenAI. El plugin nebius-token-factory-provider lo mantiene la propia Nous Research.

Un detalle de implementación que merece la pena saber: algunos modelos de Nebius exponen soporte de reasoning effort, pero no todos. Hermes incluye una allowlist conservadora — solo los modelos que están en ella (deepseek-r1/v4, deepseek-reasoner, gpt-oss, glm-5, kimi-k2, minimax-m2, …) pueden llevar parámetros de reasoning effort; todo lo demás se ajusta automáticamente, de modo que nunca te encuentras errores por pasar parámetros no soportados.

3. Tencent TokenPlan: suscripción + hy4-preview

Tencent Cloud Hunyuan TokenPlan es una suscripción mensual de tokens, servida sobre el formato de mensajes de Anthropic (transporte anthropic_messages). En Hermes existe como provider overlay integrado:

  • Id interno: tencent-tokenplan; aliases tokenplan / tencent-lkeap;
  • Base URL: https://api.lkeap.cloud.tencent.com/plan/anthropic;
  • Variable de entorno: TOKENPLAN_BASE_URL (el endpoint y las credenciales de acceso del plan se inyectan a través de ella);
  • Nombre en el picker: «Tencent TokenPlan».

El mismo PR también registra tencent/hy4-preview (Tencent Hunyuan 4 preview) en el catálogo oficial de modelos — los suscriptores de TokenPlan pueden elegirlo directamente en el selector de modelos.

Cómo usarlos

Ninguno requiere editar la configuración a mano — el flujo de modelos de hermes setup (select_provider_and_model) detecta automáticamente los plugins nuevos en plugins/model-providers/ y despacha a la configuración estándar de API key:

hermes setup        # enter model configuration
# choose Ramp Router / Nebius Token Factory / Tencent TokenPlan
# paste the service's API key / access credential when prompted
hermes model        # switch providers anytime afterwards

El Tencent TokenPlan integrado funciona igual: define TOKENPLAN_BASE_URL (y la credencial del plan), elige Tencent TokenPlan en el selector y escoge tencent/hy4-preview como modelo.

Advertencias

  • Los tres PRs aterrizaron el 29 de agosto y hoy solo están en main — todavía sin release tag (v0.20.6 se etiquetó el 27 de agosto); ejecuta hermes update primero para ver estos providers;
  • La lista de modelos de Ramp Router depende por completo del catálogo en vivo de tu key — refresca la lista de modelos del picker antes del primer uso;
  • Para planes de suscripción como TokenPlan, revisa bien la semántica de cuotas (tope mensual de tokens frente a recarga medida) en las páginas oficiales de Tencent Cloud.

Resumen

Un provider gateway (Ramp Router), un provider pay-as-you-go (Nebius Token Factory) y un provider de suscripción (Tencent TokenPlan) — tres de las formas más comunes en que los equipos compran acceso a modelos, más hy4-preview sumándose al catálogo. Cada integración pasa por el flujo estándar de hermes setup, sin configuración escrita a mano. Para profundizar en la configuración del lado de los modelos, consulta nuestra guía de overrides de modelos y la guía de GLM-5.3-Flash; la referencia completa de hermes model vive en la página de documentación del comando.