Três novos providers de modelo: Ramp Router, Nebius Token Factory e Tencent TokenPlan


A experiência de providers de modelo está se dividindo rápido: alguns querem “uma API key para todos os modelos e uma conta só”, outros querem pay-as-you-go puro, sem compromisso mensal, e outros já compraram uma assinatura em algum lugar e só querem plugá-la no Hermes. Em 29 de agosto, três novos providers entraram na festa no mesmo dia: Ramp Router (o gateway de LLM da router.com), Nebius Token Factory (inferência pay-as-you-go da Nebius) e Tencent TokenPlan (a assinatura token-plan do Tencent Cloud Hunyuan) — o último também traz o modelo hy4-preview para o catálogo oficial. As três PRs (#97915, #97916, #97917) estão mescladas na main.

Os três em uma linha cada

Provider O que é Para quem é
Ramp Router Um endpoint compatível com OpenAI Responses; roteamento no servidor para OpenAI/Anthropic/xAI/Fireworks e outros, com fallbacks unificados e controles de gasto Times que querem uma key para todos os modelos e uma conta única
Nebius Token Factory Inferência pay-as-you-go da Nebius, compatível com OpenAI Desenvolvedores com uso irregular que não querem assinaturas
Tencent TokenPlan Assinatura token-plan do Tencent Cloud Hunyuan (endpoint compatível com Anthropic), cobrada pelo plano mensal Usuários que já têm um TokenPlan do Tencent Cloud

1. Ramp Router: o provider gateway

O gateway de LLM construído pela Ramp (sim, a empresa de fintech). Um endpoint — https://api.router.com/v1 — e uma key; as requisições são roteadas no servidor para OpenAI, Anthropic, xAI, Fireworks e outros, com fallbacks e controles de gasto tratados por você. Chega de manter múltiplas upstream keys e lógica de fallback do seu lado.

Detalhes que valem a pena saber sobre a integração no Hermes:

  • A Responses API é o wire nativo (api_mode="codex_responses" é obrigatório): o /v1/responses da Router é a interface real; o /v1/chat/completions é apenas um shim mínimo de compatibilidade adicionado em agosto, então o Hermes fica na linha nativa;
  • O catálogo de modelos é escopo da conta: os ids de modelo válidos vêm do GET /v1/models da sua key (contas BYOK veem entradas extras), então o perfil oficial não traz modelos de fallback hardcoded — o que você vê no picker é buscado ao vivo;
  • Validação estrita de reasoning effort: a Router valida reasoning.effort contra o vocabulário declarado de cada modelo e rejeita combinações não suportadas com HTTP 400. O Hermes faz cache das capacidades do catálogo da Router e aplica o clamp antes de enviar;
  • As requisições carregam o User-Agent Hermes-Agent.

O plugin (router-provider) é de autoria de Neel Patel, da Ramp, com verificação ao vivo contra a api.router.com feita em agosto de 2026.

2. Nebius Token Factory: inferência pay-as-you-go

O “Token Factory” da Nebius é o serviço de inferência pay-as-you-go dela, compatível com OpenAI. O plugin nebius-token-factory-provider é mantido pela própria Nous Research.

Um detalhe de implementação que vale saber: alguns modelos da Nebius expõem suporte a reasoning effort, mas nem todos. O Hermes traz uma allowlist conservadora — só os modelos dela (deepseek-r1/v4, deepseek-reasoner, gpt-oss, glm-5, kimi-k2, minimax-m2, …) podem carregar parâmetros de reasoning effort; todo o resto é clamped automaticamente, então você nunca esbarra em erros por passar parâmetros não suportados.

3. Tencent TokenPlan: assinatura + hy4-preview

O Tencent Cloud Hunyuan TokenPlan é uma assinatura mensal de tokens, servida no formato de mensagens da Anthropic (transporte anthropic_messages). No Hermes, ele existe como um overlay provider nativo:

  • Id interno: tencent-tokenplan; aliases tokenplan / tencent-lkeap;
  • Base URL: https://api.lkeap.cloud.tencent.com/plan/anthropic;
  • Variável de ambiente: TOKENPLAN_BASE_URL (o endpoint de acesso/credenciais do plano são injetados por ela);
  • Nome de exibição no picker: “Tencent TokenPlan”.

A mesma PR também registra tencent/hy4-preview (Tencent Hunyuan 4 preview) no catálogo oficial de modelos — assinantes do TokenPlan podem escolhê-lo direto no seletor de modelos.

Como usar

Nenhum deles exige editar config na mão — o fluxo de modelos do hermes setup (select_provider_and_model) detecta automaticamente novos plugins em plugins/model-providers/ e despacha para a configuração padrão de API key:

hermes setup        # enter model configuration
# choose Ramp Router / Nebius Token Factory / Tencent TokenPlan
# paste the service's API key / access credential when prompted
hermes model        # switch providers anytime afterwards

O Tencent TokenPlan nativo funciona do mesmo jeito: defina TOKENPLAN_BASE_URL (e a credencial do plano), escolha Tencent TokenPlan no seletor e selecione tencent/hy4-preview como modelo.

Ressalvas

  • As três PRs chegaram em 29 de agosto e estão atualmente apenas na main — em nenhuma release tag (a v0.20.6 foi marcada em 27 de agosto); rode hermes update primeiro para ver esses providers;
  • A lista de modelos do Ramp Router depende inteiramente do catálogo ao vivo da sua key — atualize a lista de modelos no picker antes do primeiro uso;
  • Para planos de assinatura como o TokenPlan, confira duas vezes a semântica de quota (cota mensal de tokens vs. recarga por medição) nas páginas oficiais do Tencent Cloud.

Resumo

Um provider gateway (Ramp Router), um provider pay-as-you-go (Nebius Token Factory) e um provider de assinatura (Tencent TokenPlan) — três das formas mais comuns de times comprarem acesso a modelos, além do hy4-preview entrando no catálogo. Todas as integrações passam pelo fluxo padrão do hermes setup, sem config escrita à mão. Para se aprofundar na configuração do lado do modelo, veja nosso guia de model overrides e o guia do GLM-5.3-Flash; a referência completa do hermes model está na página de documentação do comando.