Invita y gana

Cómo funcionan las recompensas

Comparte tu enlace. Cuando un amigo se registre con él y recargue saldo, recibirás la recompensa indicada por sus recargas posteriores.

Modelo local en Hermes Agent: Ollama, Qwen y cambio explícito a la nube

Guía práctica centrada en privacidad: configura Qwen local mediante Ollama, comprueba el flujo con una tarea pequeña, añade un proveedor cloud, cambia por sesión o por un turno y revisa herramientas, modelos auxiliares y rutas de fallback.

Índice
Modelo local en Hermes Agent: Ollama, Qwen y cambio explícito a la nube

Puedes usar Hermes Agent con un modelo local para archivos y comandos cotidianos, y reservar la nube para los trabajos que realmente la necesiten. La política más clara es probar primero la ruta local y convertir cada escalado a la nube en una acción explícita, no en un fallback invisible.

Esta guía sigue la documentación actual de Hermes y Ollama. Conecta un Qwen local, ejecuta una tarea verificable, configura un proveedor cloud, explica tres alcances de cambio y muestra qué pasos pueden sacar datos del equipo. Los pasos están contrastados con documentación; no son un benchmark realizado en este hardware.

Regla recomendada: local por defecto y nube por decisión consciente

SituaciónPrioridadMotivo
Archivos locales, cambios pequeños de código y tareas rutinariasOllama/Qwen localLa petición del modelo va a 127.0.0.1 y la frontera es fácil de inspeccionar
Fallos repetidos al llamar herramientasDiagnosticar modelo, runtime y contextoUn tool call mal formado puede ser un problema del servidor o parser, no de dificultad
Contexto largo, razonamiento complejo, visión o urgenciaAbrir una sesión limpia y cambiar explícitamente a cloudObtienes más capacidad sin subir por accidente una conversación privada anterior
Nada puede salir del dispositivoModelo y herramientas locales, sin auxiliares cloud ni fallbackUn modelo principal local no vuelve offline todo el flujo

Separa modelo, herramientas y servicios auxiliares

PasoDestino habitualQué revisar
Hermes llama a http://127.0.0.1:11434/v1Ollama localEl tag no termina en :cloud y la URL es loopback
Siguiente turno tras cambiar a cloudProveedor cloudPueden enviarse contexto, instrucciones del sistema y esquemas de herramientas
Archivos y terminal localesNormalmente el equipoEl comando podría descargar, subir o llamar una API remota
Web, browser, search, MCP remoto o mensajeríaServicio contactadoConsulta, contenido, argumentos y resultados
Whisper local con TTS cloudReconocimiento local; texto de síntesis a cloudEs un flujo híbrido, no completamente offline
fallback_providers o auxiliares cloudCloud al activarseErrores, límites o capacidad pueden cambiar la ruta automáticamente

El selector de Ollama para Hermes incluye modelos locales y cloud. Un nombre con :cloud sigue siendo inferencia remota.

Ruta rápida con ollama launch hermes

ollama launch hermes

La integración oficial puede instalar Hermes, ofrecer el selector y configurar http://127.0.0.1:11434/v1. Elige una entrada local; qwen3.5:cloud, por ejemplo, no es local.

Comprueba la configuración efectiva:

hermes config get model --json
hermes status

Si el launcher no detecta tu modelo o quieres controlar cada paso, usa la ruta manual.

Configuración manual de Qwen local

1. Descarga un Qwen con soporte de tools

Ollama marca la familia Qwen 3.5 con soporte de tools. Usaremos qwen3.5:4b como ejemplo ligero de conectividad, no como garantía de calidad agente en cualquier tarea. Elige una variante mayor si tu RAM o VRAM lo permite.

ollama --version
ollama pull qwen3.5:4b

Inicia el servicio solo si no está ya activo:

ollama serve

En otra terminal:

curl http://127.0.0.1:11434/api/tags

Prueba el endpoint compatible con OpenAI antes de configurar Hermes:

curl http://127.0.0.1:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.5:4b",
    "messages": [{"role": "user", "content": "Reply with LOCAL_OK"}],
    "max_tokens": 16
  }'

Si recibes JSON con la respuesta del modelo, Ollama funciona. Si aparece Connection refused, corrige el servicio antes de tocar Hermes.

2. Conecta Hermes al endpoint

hermes model

Selecciona Custom endpoint e introduce:

  • API Base URL: http://127.0.0.1:11434/v1
  • API Key: vacío
  • Model: qwen3.5:4b
  • Context length: vacío cuando la integración actual permita auto-detección

Verifica:

hermes config get model --json
hermes status

Deberías ver el modelo local, el proveedor custom y la URL loopback. Para trabajo intenso con herramientas, Hermes recomienda un contexto amplio. Si aparece un error, sigue la guía de tu versión y revisa lo que Ollama cargó realmente:

ollama ps

No fuerces un contexto que provoque falta de memoria o swapping constante.

Ejecuta una tarea pequeña y comprueba el archivo

mkdir -p ~/hermes-local-check
cd ~/hermes-local-check
printf 'alpha\nbeta\ngamma\n' > input.txt
hermes

Dentro de Hermes:

Lee input.txt. Crea summary.md con el número de líneas y un resumen de una frase. No uses Web, browser, network, messaging ni herramientas cloud. Indica al final la ruta exacta escrita.

Comprueba el resultado:

cd ~/hermes-local-check
cat summary.md

La prueba pasa si summary.md existe, reconoce tres líneas, Hermes ejecuta la operación en vez de imprimir solo JSON, hermes status sigue mostrando Qwen local y no hay fallback o auxiliar cloud no deseado.

Esto demuestra que endpoint, tool loop y escritura están conectados. No mide tareas complejas ni garantiza que todas las herramientas opcionales sean offline.

Configura cloud sin ocultar el cambio

hermes model

Elige el proveedor cloud, completa OAuth o la entrada interactiva del secreto y selecciona un modelo. No pegues claves en el chat ni en comandos guardados en el historial.

Como hermes model cambia el valor por defecto, vuelve a local para la sesión actual y las nuevas:

/model qwen3.5:4b --provider custom --global

Los tres alcances son:

/model YOUR_CLOUD_MODEL --provider YOUR_CLOUD_PROVIDER
/model YOUR_CLOUD_MODEL --provider YOUR_CLOUD_PROVIDER --once
/model YOUR_CLOUD_MODEL --provider YOUR_CLOUD_PROVIDER --global
  • La primera cambia solo la sesión.
  • --once usa cloud en el siguiente turno y restaura el modelo anterior.
  • --global cambia también el valor por defecto.

Para volver a local:

/model qwen3.5:4b --provider custom

Si /model no muestra un proveedor, configúralo con hermes model. La orden de sesión no crea credenciales nuevas.

Cuándo conviene cambiar a la nube

Mantén local el código no publicado, documentos personales, logs internos y tareas acotadas. Si las herramientas funcionan y la velocidad es aceptable, no hace falta enviar la sesión por una mejora teórica.

Cambia a cloud cuando el modelo local siga fallando después de verificar endpoint, contexto y tool support; cuando necesites contexto mucho más largo, visión, razonamiento multietapa o menor latencia.

Para datos sensibles, abre una sesión cloud nueva y aporta solo lo imprescindible. Hermes documenta que un cambio en mitad de la sesión reinicia la prompt cache y la siguiente petición vuelve a leer la conversación. A efectos de privacidad, asume que el contexto relevante se enviará al proveedor cloud.

Audita auxiliares y fallback

Si cada llamada externa debe requerir tu decisión, no configures fallback_providers. Puede activarse por errores, rate limits, autenticación o capacidad; no significa que tú hayas decidido que la tarea es difícil.

Hermes también puede asignar compresión, visión o extracción web a modelos auxiliares. Un main model local no garantiza que esos slots sean locales.

En Bash, macOS o Linux:

grep -nE 'fallback|auxiliary|base_url|provider|default' ~/.hermes/config.yaml

En Windows, revisa %USERPROFILE%\.hermes\config.yaml. Comprueba endpoint principal, auxiliares, fallback_providers y Base URL remotas desconocidas.

Para una prueba más fuerte, observa conexiones con logs de firewall, DNS o un proxy de salida. La etiqueta “local” de una interfaz no prueba toda la red.

Solución de problemas

Connection refused

curl http://127.0.0.1:11434/api/tags

Si falla, inicia ollama serve o el servicio de escritorio.

La respuesta muestra JSON de herramientas pero no actúa

Confirma que el tag Qwen admite tools y que Hermes y Ollama están actualizados. Un modelo pequeño puede fallar con argumentos complejos. Repite la prueba de un archivo y luego prueba una variante local mayor o un cambio cloud explícito.

Falta el modelo o proveedor

Usa hermes model. /model solo muestra rutas ya configuradas.

El chat actual sigue con el modelo anterior

El cambio de default suele afectar sesiones nuevas. Usa /model para la sesión activa o inicia otra.

Lentitud o errores de contexto

ollama ps

Revisa tamaño, GPU offload y contexto. Un contexto mayor ayuda con esquemas de herramientas, pero consume más memoria y aumenta el prefill.

Un sistema híbrido no es necesariamente offline

Un usuario de X describió un prototipo personal con Gemma vía Ollama Cloud, Qwen cloud, Qwen local, Whisper local y TTS cloud. Ilustra el enrutamiento por tarea, pero es un reporte individual sin configuración reproducible, logs de red ni benchmark independiente.

Cada modelo, servicio de voz y herramienta tiene su propia frontera. Whisper local no vuelve local el TTS cloud, y un main model local no hace privadas las llamadas a calendario, gestión de proyectos, búsqueda o MCP remoto.

Lista final

  • El tag local no termina en :cloud y la Base URL es http://127.0.0.1:11434/v1.
  • El curl directo funciona y hermes status muestra la ruta prevista.
  • La prueba crea realmente summary.md.
  • El proveedor cloud está configurado, pero cada cambio usa /model.
  • El trabajo sensible en cloud empieza en una sesión nueva y mínima.
  • Se han revisado herramientas remotas, auxiliares y fallback_providers.
  • Para un requisito offline, todas las herramientas de red y servicios cloud quedan desactivados.

Fuentes

¿Quieres optimizar tu flujo de trabajo con LLM?

Conecta modelos mediante una API, gestiona claves y controla el gasto en IA.

Empezar gratis