Modelo local en Hermes Agent: Ollama, Qwen y cambio explícito a la nube
Guía práctica centrada en privacidad: configura Qwen local mediante Ollama, comprueba el flujo con una tarea pequeña, añade un proveedor cloud, cambia por sesión o por un turno y revisa herramientas, modelos auxiliares y rutas de fallback.
Índice

Puedes usar Hermes Agent con un modelo local para archivos y comandos cotidianos, y reservar la nube para los trabajos que realmente la necesiten. La política más clara es probar primero la ruta local y convertir cada escalado a la nube en una acción explícita, no en un fallback invisible.
Esta guía sigue la documentación actual de Hermes y Ollama. Conecta un Qwen local, ejecuta una tarea verificable, configura un proveedor cloud, explica tres alcances de cambio y muestra qué pasos pueden sacar datos del equipo. Los pasos están contrastados con documentación; no son un benchmark realizado en este hardware.
Regla recomendada: local por defecto y nube por decisión consciente
| Situación | Prioridad | Motivo |
|---|---|---|
| Archivos locales, cambios pequeños de código y tareas rutinarias | Ollama/Qwen local | La petición del modelo va a 127.0.0.1 y la frontera es fácil de inspeccionar |
| Fallos repetidos al llamar herramientas | Diagnosticar modelo, runtime y contexto | Un tool call mal formado puede ser un problema del servidor o parser, no de dificultad |
| Contexto largo, razonamiento complejo, visión o urgencia | Abrir una sesión limpia y cambiar explícitamente a cloud | Obtienes más capacidad sin subir por accidente una conversación privada anterior |
| Nada puede salir del dispositivo | Modelo y herramientas locales, sin auxiliares cloud ni fallback | Un modelo principal local no vuelve offline todo el flujo |
Separa modelo, herramientas y servicios auxiliares
| Paso | Destino habitual | Qué revisar |
|---|---|---|
Hermes llama a http://127.0.0.1:11434/v1 | Ollama local | El tag no termina en :cloud y la URL es loopback |
| Siguiente turno tras cambiar a cloud | Proveedor cloud | Pueden enviarse contexto, instrucciones del sistema y esquemas de herramientas |
| Archivos y terminal locales | Normalmente el equipo | El comando podría descargar, subir o llamar una API remota |
| Web, browser, search, MCP remoto o mensajería | Servicio contactado | Consulta, contenido, argumentos y resultados |
| Whisper local con TTS cloud | Reconocimiento local; texto de síntesis a cloud | Es un flujo híbrido, no completamente offline |
fallback_providers o auxiliares cloud | Cloud al activarse | Errores, límites o capacidad pueden cambiar la ruta automáticamente |
El selector de Ollama para Hermes incluye modelos locales y cloud. Un nombre con :cloud sigue siendo inferencia remota.
Ruta rápida con ollama launch hermes
ollama launch hermes
La integración oficial puede instalar Hermes, ofrecer el selector y configurar http://127.0.0.1:11434/v1. Elige una entrada local; qwen3.5:cloud, por ejemplo, no es local.
Comprueba la configuración efectiva:
hermes config get model --json
hermes status
Si el launcher no detecta tu modelo o quieres controlar cada paso, usa la ruta manual.
Configuración manual de Qwen local
1. Descarga un Qwen con soporte de tools
Ollama marca la familia Qwen 3.5 con soporte de tools. Usaremos qwen3.5:4b como ejemplo ligero de conectividad, no como garantía de calidad agente en cualquier tarea. Elige una variante mayor si tu RAM o VRAM lo permite.
ollama --version
ollama pull qwen3.5:4b
Inicia el servicio solo si no está ya activo:
ollama serve
En otra terminal:
curl http://127.0.0.1:11434/api/tags
Prueba el endpoint compatible con OpenAI antes de configurar Hermes:
curl http://127.0.0.1:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.5:4b",
"messages": [{"role": "user", "content": "Reply with LOCAL_OK"}],
"max_tokens": 16
}'
Si recibes JSON con la respuesta del modelo, Ollama funciona. Si aparece Connection refused, corrige el servicio antes de tocar Hermes.
2. Conecta Hermes al endpoint
hermes model
Selecciona Custom endpoint e introduce:
- API Base URL:
http://127.0.0.1:11434/v1 - API Key: vacío
- Model:
qwen3.5:4b - Context length: vacío cuando la integración actual permita auto-detección
Verifica:
hermes config get model --json
hermes status
Deberías ver el modelo local, el proveedor custom y la URL loopback. Para trabajo intenso con herramientas, Hermes recomienda un contexto amplio. Si aparece un error, sigue la guía de tu versión y revisa lo que Ollama cargó realmente:
ollama ps
No fuerces un contexto que provoque falta de memoria o swapping constante.
Ejecuta una tarea pequeña y comprueba el archivo
mkdir -p ~/hermes-local-check
cd ~/hermes-local-check
printf 'alpha\nbeta\ngamma\n' > input.txt
hermes
Dentro de Hermes:
Lee input.txt. Crea summary.md con el número de líneas y un resumen de una frase. No uses Web, browser, network, messaging ni herramientas cloud. Indica al final la ruta exacta escrita.
Comprueba el resultado:
cd ~/hermes-local-check
cat summary.md
La prueba pasa si summary.md existe, reconoce tres líneas, Hermes ejecuta la operación en vez de imprimir solo JSON, hermes status sigue mostrando Qwen local y no hay fallback o auxiliar cloud no deseado.
Esto demuestra que endpoint, tool loop y escritura están conectados. No mide tareas complejas ni garantiza que todas las herramientas opcionales sean offline.
Configura cloud sin ocultar el cambio
hermes model
Elige el proveedor cloud, completa OAuth o la entrada interactiva del secreto y selecciona un modelo. No pegues claves en el chat ni en comandos guardados en el historial.
Como hermes model cambia el valor por defecto, vuelve a local para la sesión actual y las nuevas:
/model qwen3.5:4b --provider custom --global
Los tres alcances son:
/model YOUR_CLOUD_MODEL --provider YOUR_CLOUD_PROVIDER
/model YOUR_CLOUD_MODEL --provider YOUR_CLOUD_PROVIDER --once
/model YOUR_CLOUD_MODEL --provider YOUR_CLOUD_PROVIDER --global
- La primera cambia solo la sesión.
--onceusa cloud en el siguiente turno y restaura el modelo anterior.--globalcambia también el valor por defecto.
Para volver a local:
/model qwen3.5:4b --provider custom
Si /model no muestra un proveedor, configúralo con hermes model. La orden de sesión no crea credenciales nuevas.
Cuándo conviene cambiar a la nube
Mantén local el código no publicado, documentos personales, logs internos y tareas acotadas. Si las herramientas funcionan y la velocidad es aceptable, no hace falta enviar la sesión por una mejora teórica.
Cambia a cloud cuando el modelo local siga fallando después de verificar endpoint, contexto y tool support; cuando necesites contexto mucho más largo, visión, razonamiento multietapa o menor latencia.
Para datos sensibles, abre una sesión cloud nueva y aporta solo lo imprescindible. Hermes documenta que un cambio en mitad de la sesión reinicia la prompt cache y la siguiente petición vuelve a leer la conversación. A efectos de privacidad, asume que el contexto relevante se enviará al proveedor cloud.
Audita auxiliares y fallback
Si cada llamada externa debe requerir tu decisión, no configures fallback_providers. Puede activarse por errores, rate limits, autenticación o capacidad; no significa que tú hayas decidido que la tarea es difícil.
Hermes también puede asignar compresión, visión o extracción web a modelos auxiliares. Un main model local no garantiza que esos slots sean locales.
En Bash, macOS o Linux:
grep -nE 'fallback|auxiliary|base_url|provider|default' ~/.hermes/config.yaml
En Windows, revisa %USERPROFILE%\.hermes\config.yaml. Comprueba endpoint principal, auxiliares, fallback_providers y Base URL remotas desconocidas.
Para una prueba más fuerte, observa conexiones con logs de firewall, DNS o un proxy de salida. La etiqueta “local” de una interfaz no prueba toda la red.
Solución de problemas
Connection refused
curl http://127.0.0.1:11434/api/tags
Si falla, inicia ollama serve o el servicio de escritorio.
La respuesta muestra JSON de herramientas pero no actúa
Confirma que el tag Qwen admite tools y que Hermes y Ollama están actualizados. Un modelo pequeño puede fallar con argumentos complejos. Repite la prueba de un archivo y luego prueba una variante local mayor o un cambio cloud explícito.
Falta el modelo o proveedor
Usa hermes model. /model solo muestra rutas ya configuradas.
El chat actual sigue con el modelo anterior
El cambio de default suele afectar sesiones nuevas. Usa /model para la sesión activa o inicia otra.
Lentitud o errores de contexto
ollama ps
Revisa tamaño, GPU offload y contexto. Un contexto mayor ayuda con esquemas de herramientas, pero consume más memoria y aumenta el prefill.
Un sistema híbrido no es necesariamente offline
Un usuario de X describió un prototipo personal con Gemma vía Ollama Cloud, Qwen cloud, Qwen local, Whisper local y TTS cloud. Ilustra el enrutamiento por tarea, pero es un reporte individual sin configuración reproducible, logs de red ni benchmark independiente.
Cada modelo, servicio de voz y herramienta tiene su propia frontera. Whisper local no vuelve local el TTS cloud, y un main model local no hace privadas las llamadas a calendario, gestión de proyectos, búsqueda o MCP remoto.
Lista final
- El tag local no termina en
:cloudy la Base URL eshttp://127.0.0.1:11434/v1. - El
curldirecto funciona yhermes statusmuestra la ruta prevista. - La prueba crea realmente
summary.md. - El proveedor cloud está configurado, pero cada cambio usa
/model. - El trabajo sensible en cloud empieza en una sesión nueva y mínima.
- Se han revisado herramientas remotas, auxiliares y
fallback_providers. - Para un requisito offline, todas las herramientas de red y servicios cloud quedan desactivados.