Trois nouveaux fournisseurs de modèles : Ramp Router, Nebius Token Factory et Tencent TokenPlan


L’expérience des fournisseurs de modèles se scinde rapidement : certains veulent « une API key pour tous les modèles et une seule facture », d’autres veulent du pay-as-you-go pur sans engagement mensuel, et d’autres encore ont déjà acheté un abonnement quelque part et veulent simplement le brancher sur Hermes. Le 29 août, trois nouveaux fournisseurs ont rejoint la fête le même jour : Ramp Router (la gateway LLM de router.com), Nebius Token Factory (l’inférence pay-as-you-go de Nebius) et Tencent TokenPlan (l’abonnement token-plan de Tencent Cloud Hunyuan) — le dernier amène aussi le modèle hy4-preview dans le catalogue officiel. Les trois PR (#97915, #97916, #97917) sont fusionnées sur main.

Les trois en une ligne chacun

Provider Ce que c’est Pour qui
Ramp Router Un endpoint unique compatible OpenAI Responses ; routage côté serveur vers OpenAI/Anthropic/xAI/Fireworks et plus, avec fallbacks unifiés et contrôles de dépenses Les équipes qui veulent une seule clé pour tous les modèles et une seule facture
Nebius Token Factory Inférence pay-as-you-go de Nebius, compatible OpenAI Les développeurs à usage en pics qui ne veulent pas d’abonnement
Tencent TokenPlan Abonnement token-plan de Tencent Cloud Hunyuan (endpoint compatible Anthropic), facturé par plan mensuel Les utilisateurs qui détiennent déjà un Tencent Cloud TokenPlan

1. Ramp Router : le fournisseur gateway

La gateway LLM construite par Ramp (oui, la société fintech). Un seul endpoint — https://api.router.com/v1 — et une seule clé ; les requêtes sont routées côté serveur vers OpenAI, Anthropic, xAI, Fireworks et autres, avec fallbacks et contrôles de dépenses gérés pour vous. Fini la maintenance de plusieurs clés upstream et de la logique de fallback de votre côté.

Des détails utiles sur l’intégration Hermes :

  • L’API Responses est le protocole natif (api_mode="codex_responses" est imposé) : le /v1/responses de Router est la véritable interface ; /v1/chat/completions n’est qu’un shim de compatibilité minimal ajouté en août, Hermes reste donc sur la ligne native ;
  • Le catalogue de modèles est propre au compte : les ids de modèles valides proviennent du GET /v1/models de votre clé (les comptes BYOK voient des entrées supplémentaires), le profil officiel ne livre donc aucun modèle de fallback codé en dur — ce que vous voyez dans le picker est récupéré en direct ;
  • Validation stricte de l’effort de raisonnement : Router valide reasoning.effort par rapport au vocabulaire déclaré de chaque modèle et rejette les combinaisons non prises en charge avec un HTTP 400. Hermes met en cache les capacités du catalogue de Router et serre les valeurs avant l’envoi ;
  • Les requêtes portent le User-Agent Hermes-Agent.

Le plugin (router-provider) est écrit par Neel Patel de Ramp, avec une vérification en direct contre api.router.com réalisée en août 2026.

2. Nebius Token Factory : l’inférence pay-as-you-go

Le « Token Factory » de Nebius est son service d’inférence pay-as-you-go, compatible OpenAI. Le plugin nebius-token-factory-provider est maintenu par Nous Research lui-même.

Un détail d’implémentation utile : certains modèles Nebius exposent le support du reasoning-effort, mais pas tous. Hermes embarque une allowlist prudente — seuls les modèles qui y figurent (deepseek-r1/v4, deepseek-reasoner, gpt-oss, glm-5, kimi-k2, minimax-m2, …) peuvent porter des paramètres de reasoning-effort ; tout le reste est serré automatiquement, pour que vous ne heurtiez jamais d’erreurs en passant des paramètres non pris en charge.

3. Tencent TokenPlan : abonnement + hy4-preview

Le TokenPlan de Tencent Cloud Hunyuan est un abonnement mensuel de tokens, servi au format de messages Anthropic (transport anthropic_messages). Dans Hermes, il existe comme fournisseur overlay intégré :

  • Id interne : tencent-tokenplan ; alias tokenplan / tencent-lkeap ;
  • URL de base : https://api.lkeap.cloud.tencent.com/plan/anthropic ;
  • Variable d’environnement : TOKENPLAN_BASE_URL (l’endpoint d’accès et les identifiants du plan y sont injectés) ;
  • Nom d’affichage dans le picker : « Tencent TokenPlan ».

La même PR enregistre aussi tencent/hy4-preview (Tencent Hunyuan 4 preview) dans le catalogue officiel de modèles — les abonnés TokenPlan peuvent le choisir directement dans le sélecteur de modèles.

Comment les utiliser

Aucun d’eux n’exige de modifier la config à la main — le flux de modèles de hermes setup (select_provider_and_model) détecte automatiquement les nouveaux plugins sous plugins/model-providers/ et bascule vers la configuration standard de l’API key :

hermes setup        # enter model configuration
# choose Ramp Router / Nebius Token Factory / Tencent TokenPlan
# paste the service's API key / access credential when prompted
hermes model        # switch providers anytime afterwards

Le Tencent TokenPlan intégré fonctionne pareil : définissez TOKENPLAN_BASE_URL (et l’identifiant du plan), choisissez Tencent TokenPlan dans le sélecteur, et sélectionnez tencent/hy4-preview comme modèle.

Mises en garde

  • Les trois PR ont atterri le 29 août et sont pour l’instant sur main uniquement — dans aucune étiquette de release (v0.20.6 a été taguée le 27 août) ; lancez hermes update d’abord pour voir ces fournisseurs ;
  • La liste de modèles de Ramp Router dépend entièrement du catalogue en direct de votre clé — rafraîchissez la liste de modèles dans le picker avant la première utilisation ;
  • Pour les plans par abonnement comme TokenPlan, revérifiez la sémantique des quotas (allocation mensuelle de tokens vs. recharge à l’usage) sur les pages officielles de Tencent Cloud.

Résumé

Un fournisseur gateway (Ramp Router), un fournisseur pay-as-you-go (Nebius Token Factory) et un fournisseur par abonnement (Tencent TokenPlan) — trois des façons les plus courantes d’acheter l’accès aux modèles pour les équipes, plus hy4-preview qui rejoint le catalogue. Chaque intégration passe par le flux standard hermes setup, sans config écrite à la main. Pour approfondir la configuration côté modèles, voir notre guide des overrides de modèles et notre guide GLM-5.3-Flash ; la référence complète de hermes model vit sur la page de documentation des commandes.