Barre de statut améliorée : taux de cache-hit, latence et tokens/seconde en un coup d'œil


Vous fixez la barre de statut en bas de votre terminal : nom du modèle, pourcentage de contexte, une icône de compression. Beaucoup d’informations — mais ce que vous voulez vraiment savoir, c’est « ce modèle est-il rapide en ce moment ? Mon cache répond-il ? Combien de tokens par seconde produit-il ? » — car le taux de cache-hit détermine si votre facture API s’élève au dixième du prix ou au tarif complet. Une mise à jour fusionnée le 30 août (PR #98250) met les trois réponses directement dans la barre de statut : taux de cache-hit (◎), latence moyenne glissante (◷) et tokens de sortie par seconde (↑) — et chaque champ peut être activé ou désactivé via la configuration.

Ce qui change dans la barre

Sur un terminal large, la barre mise à jour ressemble à ceci :

⚕ model │ 3% │ ◎ 87.4% │ ◷ 3.2s │ ↑ 50 t/s │ 2m

De gauche à droite : nom du modèle, contexte à 3 %, taux de cache-hit 87,4 %, latence moyenne 3,2 s, 50 tokens de sortie par seconde, durée de session 2 minutes. Les trois nouvelles métriques sont des statistiques glissantes — la latence et le débit prennent la moyenne mobile des ~10 derniers appels API plutôt qu’une moyenne depuis le démarrage, elles reflètent donc l’état actuel du modèle.

Quelques détails bien pensés :

  • Le taux de cache-hit réinitialise sa base lors des changements de modèle et des compressions de contexte — il reflète le régime de cache actuel, pas un chiffre dilué par l’historique ;
  • Quand aucune lecture de cache n’existe du tout, le champ se masque au lieu d’afficher un 0 % alarmant — pas de signaux trompeurs ;
  • Les latences négatives ou NaN sont protégées — un seul appel instable ne peut pas polluer les statistiques.

Les bascules de champs : display.status_bar.fields

Les nouvelles métriques ne vous sont pas imposées — chaque champ peut être activé ou désactivé indépendamment. La clé de configuration est display.status_bar.fields ; une liste vide signifie « tous les champs par défaut » :

display:
  status_bar:
    fields: []   # vide = valeurs par défaut intégrées (tous les champs)

Disons que vous ne vous intéressez qu’au cache et à la vitesse — ne gardez que ceux-ci :

display:
  status_bar:
    fields: [model, ctx, cache_hit, latency, tps]

Votre barre devient ⚕ model │ 3% │ ◎ 87.4% │ ◷ 3.2s │ ↑ 50 t/s. D’après le code source (hermes_cli/config_defaults.py), la liste complète des champs est : cache_hit, latency, tps, compressions, bg_tasks, bg_processes, bg_subagents, goal, duration, prompt_elapsed, idle_since, focus, yolo, stash, battery, title, total_tokens. Deux réserves :

  • total_tokens (tokens cumulés de session) est opt-in uniquement — il ne s’affiche jamais sauf si vous le listez ;
  • Les terminaux étroits suppriment les champs réservés au mode large (context_detail, prompt_elapsed, idle_since), quelle que soit la configuration.

Pourquoi le taux de cache-hit mérite votre attention

C’est la plus « rentable » des trois nouvelles métriques. Les grands fournisseurs d’API (Anthropic, OpenAI, DeepSeek et autres) facturent généralement les lectures du cache de prompt à 1/10 du prix d’entrée normal, voire moins. Le taux affiché dans la barre de statut est un tableau de bord vivant de votre stratégie d’économies : s’il reste bas longtemps, c’est que la structure de vos sessions brasse en permanence (prompt système qui change souvent, descriptions d’outils instables) et que le cache manque donc ses cibles ; s’il dépasse régulièrement 80 %, votre argent est dépensé là où ça compte.

Comment l’obtenir

La PR #98250 a été fusionnée le 30 août 2026 et n’est que sur main — la v0.20.6 ne l’a pas. Mettez à jour vers le dernier main et les nouveaux champs apparaissent dans un simple hermes ; pour les régler, modifiez display.status_bar.fields via hermes config edit.

La barre de statut est le tableau de bord du CLI, et ces nouvelles métriques la transforment de décoration en données opérationnelles. Pour le playbook complet des économies de tokens et de cache, associez ce guide au guide des 5 canaux de recherche gratuits et au guide d’optimisation des tokens de contexte ; d’autres gains d’efficacité cachés du CLI se trouvent dans le guide de la command palette.