Três novos providers de modelo: Ramp Router, Nebius Token Factory e Tencent TokenPlan

A experiência de providers de modelo está se dividindo rápido: alguns querem “uma API key para todos os modelos e uma conta só”, outros querem pay-as-you-go puro, sem compromisso mensal, e outros já compraram uma assinatura em algum lugar e só querem plugá-la no Hermes. Em 29 de agosto, três novos providers entraram na festa no mesmo dia: Ramp Router (o gateway de LLM da router.com), Nebius Token Factory (inferência pay-as-you-go da Nebius) e Tencent TokenPlan (a assinatura token-plan do Tencent Cloud Hunyuan) — o último também traz o modelo hy4-preview para o catálogo oficial. As três PRs (#97915, #97916, #97917) estão mescladas na main.
Os três em uma linha cada
| Provider | O que é | Para quem é |
|---|---|---|
| Ramp Router | Um endpoint compatível com OpenAI Responses; roteamento no servidor para OpenAI/Anthropic/xAI/Fireworks e outros, com fallbacks unificados e controles de gasto | Times que querem uma key para todos os modelos e uma conta única |
| Nebius Token Factory | Inferência pay-as-you-go da Nebius, compatível com OpenAI | Desenvolvedores com uso irregular que não querem assinaturas |
| Tencent TokenPlan | Assinatura token-plan do Tencent Cloud Hunyuan (endpoint compatível com Anthropic), cobrada pelo plano mensal | Usuários que já têm um TokenPlan do Tencent Cloud |
1. Ramp Router: o provider gateway
O gateway de LLM construído pela Ramp (sim, a empresa de fintech). Um endpoint — https://api.router.com/v1 — e uma key; as requisições são roteadas no servidor para OpenAI, Anthropic, xAI, Fireworks e outros, com fallbacks e controles de gasto tratados por você. Chega de manter múltiplas upstream keys e lógica de fallback do seu lado.
Detalhes que valem a pena saber sobre a integração no Hermes:
- A Responses API é o wire nativo (
api_mode="codex_responses"é obrigatório): o/v1/responsesda Router é a interface real; o/v1/chat/completionsé apenas um shim mínimo de compatibilidade adicionado em agosto, então o Hermes fica na linha nativa; - O catálogo de modelos é escopo da conta: os ids de modelo válidos vêm do
GET /v1/modelsda sua key (contas BYOK veem entradas extras), então o perfil oficial não traz modelos de fallback hardcoded — o que você vê no picker é buscado ao vivo; - Validação estrita de reasoning effort: a Router valida
reasoning.effortcontra o vocabulário declarado de cada modelo e rejeita combinações não suportadas com HTTP 400. O Hermes faz cache das capacidades do catálogo da Router e aplica o clamp antes de enviar; - As requisições carregam o User-Agent
Hermes-Agent.
O plugin (router-provider) é de autoria de Neel Patel, da Ramp, com verificação ao vivo contra a api.router.com feita em agosto de 2026.
2. Nebius Token Factory: inferência pay-as-you-go
O “Token Factory” da Nebius é o serviço de inferência pay-as-you-go dela, compatível com OpenAI. O plugin nebius-token-factory-provider é mantido pela própria Nous Research.
Um detalhe de implementação que vale saber: alguns modelos da Nebius expõem suporte a reasoning effort, mas nem todos. O Hermes traz uma allowlist conservadora — só os modelos dela (deepseek-r1/v4, deepseek-reasoner, gpt-oss, glm-5, kimi-k2, minimax-m2, …) podem carregar parâmetros de reasoning effort; todo o resto é clamped automaticamente, então você nunca esbarra em erros por passar parâmetros não suportados.
3. Tencent TokenPlan: assinatura + hy4-preview
O Tencent Cloud Hunyuan TokenPlan é uma assinatura mensal de tokens, servida no formato de mensagens da Anthropic (transporte anthropic_messages). No Hermes, ele existe como um overlay provider nativo:
- Id interno:
tencent-tokenplan; aliasestokenplan/tencent-lkeap; - Base URL:
https://api.lkeap.cloud.tencent.com/plan/anthropic; - Variável de ambiente:
TOKENPLAN_BASE_URL(o endpoint de acesso/credenciais do plano são injetados por ela); - Nome de exibição no picker: “Tencent TokenPlan”.
A mesma PR também registra tencent/hy4-preview (Tencent Hunyuan 4 preview) no catálogo oficial de modelos — assinantes do TokenPlan podem escolhê-lo direto no seletor de modelos.
Como usar
Nenhum deles exige editar config na mão — o fluxo de modelos do hermes setup (select_provider_and_model) detecta automaticamente novos plugins em plugins/model-providers/ e despacha para a configuração padrão de API key:
hermes setup # enter model configuration
# choose Ramp Router / Nebius Token Factory / Tencent TokenPlan
# paste the service's API key / access credential when prompted
hermes model # switch providers anytime afterwards
O Tencent TokenPlan nativo funciona do mesmo jeito: defina TOKENPLAN_BASE_URL (e a credencial do plano), escolha Tencent TokenPlan no seletor e selecione tencent/hy4-preview como modelo.
Ressalvas
- As três PRs chegaram em 29 de agosto e estão atualmente apenas na
main— em nenhuma release tag (a v0.20.6 foi marcada em 27 de agosto); rodehermes updateprimeiro para ver esses providers; - A lista de modelos do Ramp Router depende inteiramente do catálogo ao vivo da sua key — atualize a lista de modelos no picker antes do primeiro uso;
- Para planos de assinatura como o TokenPlan, confira duas vezes a semântica de quota (cota mensal de tokens vs. recarga por medição) nas páginas oficiais do Tencent Cloud.
Resumo
Um provider gateway (Ramp Router), um provider pay-as-you-go (Nebius Token Factory) e um provider de assinatura (Tencent TokenPlan) — três das formas mais comuns de times comprarem acesso a modelos, além do hy4-preview entrando no catálogo. Todas as integrações passam pelo fluxo padrão do hermes setup, sem config escrita à mão. Para se aprofundar na configuração do lado do modelo, veja nosso guia de model overrides e o guia do GLM-5.3-Flash; a referência completa do hermes model está na página de documentação do comando.