La barra de estado se renueva: tasa de cache-hit, latencia y tokens/seg de un vistazo

Te quedas mirando la barra de estado al pie de tu terminal: nombre del modelo, porcentaje de contexto, un icono de compresión. Mucha información — pero lo que de verdad quieres saber es “¿está este modelo rápido ahora mismo? ¿Está acertando mi caché? ¿Cuántos tokens por segundo está produciendo?” — porque la tasa de cache-hit decide si tu factura de API cuesta una décima parte o el precio completo. Una actualización fusionada el 30 de agosto (PR #98250) pone las tres respuestas directamente en la barra de estado: tasa de cache-hit (◎), latencia media móvil (◷) y tokens de salida por segundo (↑) — y cada campo se puede activar y desactivar desde la configuración.
Qué hay de nuevo en la barra
En una terminal ancha, la barra actualizada tiene este aspecto:
⚕ model │ 3% │ ◎ 87.4% │ ◷ 3.2s │ ↑ 50 t/s │ 2m
De izquierda a derecha: nombre del modelo, contexto al 3%, tasa de cache-hit del 87.4%, latencia media de 3.2s, 50 tokens de salida por segundo, duración de la sesión de 2 minutos. Las tres métricas nuevas son estadísticas móviles: la latencia y el rendimiento usan la media móvil de las últimas ~10 llamadas a la API en lugar de una media desde el arranque, así que reflejan el estado actual del modelo.
Unos cuantos detalles cuidados:
- La tasa de cache-hit reinicia su línea base al cambiar de modelo y al comprimir el contexto — refleja el régimen de caché actual, no un número diluido por el historial;
- Cuando no existe ninguna lectura de caché, el campo se oculta en lugar de mostrar un 0% alarmante — sin señales engañosas;
- La latencia negativa o NaN está protegida — una sola llamada temblorosa no puede contaminar las estadísticas.
Interruptores de campos: display.status_bar.fields
Las métricas nuevas no se te imponen — cada campo se puede habilitar o deshabilitar de forma independiente. La clave de configuración es display.status_bar.fields; una lista vacía significa “todos los campos predeterminados”:
display:
status_bar:
fields: [] # vacío = valores predeterminados integrados (todos los campos)
Digamos que solo te importan la caché y la velocidad — deja solo estos:
display:
status_bar:
fields: [model, ctx, cache_hit, latency, tps]
Tu barra queda así: ⚕ model │ 3% │ ◎ 87.4% │ ◷ 3.2s │ ↑ 50 t/s. Frente al código fuente (hermes_cli/config_defaults.py), la lista completa de campos es: cache_hit, latency, tps, compressions, bg_tasks, bg_processes, bg_subagents, goal, duration, prompt_elapsed, idle_since, focus, yolo, stash, battery, title, total_tokens. Dos salvedades:
total_tokens(tokens acumulados de la sesión) es solo opt-in — nunca aparece salvo que lo añadas a la lista;- Las terminales estrechas eliminan los campos exclusivos del modo ancho (
context_detail,prompt_elapsed,idle_since) independientemente de la configuración.
Por qué merece la pena vigilar la tasa de cache-hit
Es la más “valiosa” de las tres métricas nuevas. Los grandes proveedores de API (Anthropic, OpenAI, DeepSeek y otros) suelen cobrar las lecturas de caché del prompt a 1/10 del precio normal de entrada, o menos. La tasa de aciertos de la barra de estado es un panel en vivo para tu estrategia de ahorro: si se mantiene baja durante mucho tiempo, la estructura de tu sesión está en constante movimiento (el system prompt cambia a menudo, las descripciones de herramientas son inestables) y la caché falla una y otra vez; si se mantiene por encima del 80%, tu dinero se está gastando donde cuenta.
Cómo obtenerlo
El PR #98250 se fusionó el 30 de agosto de 2026 y está solo en main — v0.20.6 no lo tiene. Actualiza a la última versión de main y los campos nuevos aparecen en el hermes normal; para ajustarlos, edita display.status_bar.fields con hermes config edit.
La barra de estado es el panel de control de la CLI, y estas métricas nuevas la convierten de decoración en datos operativos. Para el manual completo de ahorro de tokens y caché, combínalo con la guía de los 5 canales de búsqueda gratuitos y la guía de optimización de tokens de contexto; más triunfos ocultos de eficiencia en la CLI están en la guía de la paleta de comandos.