초대하고 적립

초대 보상 안내

초대 링크를 공유하세요. 친구가 링크로 가입하고 충전하면 이후 충전마다 표시된 보상을 받을 수 있습니다.

Hermes Agent 로컬 모델 설정: Ollama·Qwen과 명시적 클라우드 전환

개인정보 경계를 중심으로 한 실전 가이드입니다. Ollama로 로컬 Qwen을 설정하고 작은 파일 작업으로 연결을 확인한 다음, 클라우드 공급자를 추가해 세션·1회·전역 범위로 전환하며 보조 모델, 도구, 자동 fallback 경로를 함께 점검합니다.

목차
Hermes Agent 로컬 모델 설정: Ollama·Qwen과 명시적 클라우드 전환

Hermes Agent의 일상적인 파일·터미널 작업은 로컬 모델로 처리하고, 정말 필요한 경우에만 클라우드 모델을 사용할 수 있습니다. 가장 명확한 운영 방식은 작은 작업으로 로컬 경로를 먼저 검증하고, 이후의 클라우드 승격을 보이지 않는 자동 fallback이 아니라 사용자가 직접 실행하는 명령으로 만드는 것입니다.

아래 절차는 현재 Hermes와 Ollama 공식 문서를 기준으로 합니다. 로컬 Qwen 연결, 확인 가능한 파일 작업, 클라우드 공급자 설정, 세 가지 전환 범위, 그리고 어떤 단계에서 데이터가 기기 밖으로 나갈 수 있는지까지 다룹니다. 특정 하드웨어에서 직접 성능을 측정했다는 의미는 아닙니다.

권장 원칙: 기본은 로컬, 클라우드는 의식적으로 선택

상황우선 선택이유
로컬 파일, 작은 코드 수정, 일상 작업로컬 Ollama/Qwen모델 요청이 127.0.0.1로 가므로 경계를 확인하기 쉽습니다
tool call이 반복해서 실패모델, runtime, context부터 진단원인이 작업 난도가 아니라 형식, parser, context일 수 있습니다
긴 context, 복잡한 reasoning, vision, 촉박한 응답 시간새 세션을 열고 명시적으로 cloud 전환이전의 민감한 대화까지 실수로 보내지 않고 추가 성능을 사용할 수 있습니다
데이터가 절대 기기 밖으로 나가면 안 됨로컬 모델과 로컬 tools만 사용, cloud auxiliary와 fallback 비활성화main model이 로컬이어도 전체 workflow가 offline인 것은 아닙니다

main model, tools, auxiliary 경로를 따로 확인

단계일반적인 전송 대상확인할 항목
Hermes가 http://127.0.0.1:11434/v1 호출로컬 Ollamamodel tag가 :cloud로 끝나지 않고 URL이 loopback인지
cloud model 전환 후 다음 turn선택한 cloud provider대화 context, system instructions, tool schemas가 전송될 수 있음
로컬 file·terminal tools보통 기기 안명령 자체가 upload, download, remote API를 실행하는지
Web, browser, search, remote MCP, messaging접속한 서비스query, 페이지 내용, tool arguments, results
local Whisper + cloud TTS음성 인식은 local, 합성 text는 cloud혼합 음성 경로를 완전 offline이라고 부르면 안 됨
fallback_providers 또는 cloud auxiliary조건 충족 시 clouderror, rate limit, auth, capacity가 자동으로 경계를 바꿀 수 있음

Ollama의 Hermes selector에는 local과 cloud 모델이 함께 표시됩니다. 이름이 :cloud로 끝나는 모델은 Ollama에서 선택해도 remote inference를 사용합니다.

빠른 경로: ollama launch hermes

ollama launch hermes

공식 integration은 필요하면 Hermes를 설치하고, 모델을 선택하게 하며, http://127.0.0.1:11434/v1를 설정합니다. 반드시 명확한 local 항목을 고르세요. 예를 들어 qwen3.5:cloud는 local 모델이 아닙니다.

설정 후 실제 route를 확인합니다.

hermes config get model --json
hermes status

launcher가 다운로드한 모델을 찾지 못하거나 모든 단계를 직접 확인하려면 manual 설정을 사용합니다.

로컬 Qwen 수동 연결

1. tools 지원 Qwen 모델 받기

Ollama는 Qwen 3.5 family를 tools 지원 모델로 표시합니다. 여기서는 비교적 가벼운 연결 예제로 qwen3.5:4b를 사용합니다. 4B model이 모든 agent task에서 안정적이라는 보장은 아닙니다. RAM 또는 VRAM이 충분하면 더 큰 공식 tag를 선택하세요.

ollama --version
ollama pull qwen3.5:4b

Ollama service가 이미 실행 중이 아닐 때만 시작합니다.

ollama serve

다른 terminal에서 model list를 확인합니다.

curl http://127.0.0.1:11434/api/tags

Hermes를 설정하기 전에 OpenAI-compatible endpoint를 직접 test합니다.

curl http://127.0.0.1:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.5:4b",
    "messages": [{"role": "user", "content": "Reply with LOCAL_OK"}],
    "max_tokens": 16
  }'

모델 응답이 포함된 JSON이 오면 Ollama가 local model을 제공하고 있는 것입니다. 여기서 Connection refused가 나오면 Hermes가 아니라 Ollama service부터 해결하세요.

2. Hermes를 local endpoint로 설정

hermes model

Custom endpoint를 선택하고 다음을 입력합니다.

  • API Base URL: http://127.0.0.1:11434/v1
  • API Key: 비워 둠
  • Model: qwen3.5:4b
  • Context length: 현재 integration이 auto-detect를 제공하면 비워 둠

저장된 route를 확인합니다.

hermes config get model --json
hermes status

local model, provider custom, loopback URL이 보여야 합니다. Hermes는 tool-heavy agent 작업에 큰 context를 권장합니다. context error가 발생하면 사용 중인 version의 문서를 따르고 Ollama가 실제로 로드한 값을 확인하세요.

ollama ps

메모리 부족이나 지속적인 swapping을 일으킬 만큼 큰 context를 강제로 지정하지 마세요.

작은 파일 작업으로 local chain 검증

mkdir -p ~/hermes-local-check
cd ~/hermes-local-check
printf 'alpha\nbeta\ngamma\n' > input.txt
hermes

Hermes session에 다음을 입력합니다.

input.txt를 읽고 줄 수와 한 문장 요약을 담은 summary.md를 만드세요. Web, browser, network, messaging 또는 cloud tools를 사용하지 마세요. 마지막에 기록한 정확한 path를 알려 주세요.

결과를 확인합니다.

cd ~/hermes-local-check
cat summary.md

summary.md가 존재하고 세 줄을 인식하며, Hermes가 tool-call JSON만 출력하지 않고 실제 파일을 만들고, hermes status가 local Qwen과 127.0.0.1를 계속 표시하며, 원하지 않는 cloud fallback이나 cloud auxiliary가 없으면 통과입니다.

이 test는 endpoint, tool loop, file write 연결을 검증합니다. 복잡한 task 성능이나 모든 optional tool이 offline이라는 사실까지 증명하지는 않습니다.

cloud provider를 추가하되 전환은 명시적으로 유지

hermes model

사용할 cloud provider를 선택하고 OAuth 또는 interactive secret input을 완료한 뒤 모델을 고릅니다. API key를 chat message나 shell history에 남는 command에 붙여 넣지 마세요.

hermes model은 default를 바꾸므로 cloud 설정 후 current session과 이후 sessions를 다시 local로 돌립니다.

/model qwen3.5:4b --provider custom --global

세 가지 전환 scope가 있습니다.

/model YOUR_CLOUD_MODEL --provider YOUR_CLOUD_PROVIDER
/model YOUR_CLOUD_MODEL --provider YOUR_CLOUD_PROVIDER --once
/model YOUR_CLOUD_MODEL --provider YOUR_CLOUD_PROVIDER --global
  • 첫 번째는 current session만 바꿉니다.
  • --once는 다음 한 turn만 cloud를 쓰고 이전 모델로 복원합니다.
  • --global은 current session과 새 sessions의 default를 함께 바꿉니다.

local로 복귀:

/model qwen3.5:4b --provider custom

/model에 provider가 보이지 않으면 hermes model로 먼저 configure 또는 authenticate하세요. Session command는 새로운 credential을 만들지 않습니다.

cloud 전환이 필요한 시점

공개 전 source code, 개인 문서, 내부 logs, 범위가 명확한 작은 작업은 local로 유지하세요. Tools가 올바르게 동작하고 속도가 수용 가능하다면 이론적인 quality 향상만으로 session을 외부로 보낼 필요는 없습니다.

endpoint, context, tool support를 확인한 뒤에도 local model이 계속 실패하거나, 훨씬 긴 context, vision, 복잡한 multi-step reasoning, 더 낮은 latency가 필요하면 cloud가 합리적입니다.

민감한 작업은 새로운 cloud session에서 시작하고 필요한 최소 정보만 제공합니다. Hermes 문서는 mid-session model switch가 prompt cache를 reset하고 다음 request가 대화를 다시 읽는다고 설명합니다. Privacy 관점에서는 relevant current-session context가 cloud provider에 전달된다고 가정하세요.

auxiliary models와 fallback도 감사

“모든 외부 model call은 내가 결정한다”가 원칙이면 fallback_providers를 설정하지 마세요. Fallback은 error, rate limit, authentication, capacity로 자동 실행될 수 있으며, 사람이 작업 난도를 판단한 것과 다릅니다.

Hermes는 compression, vision, web extraction 같은 side jobs를 auxiliary models로 보낼 수 있습니다. Local main model이 해당 slots도 local이라는 뜻은 아닙니다.

Bash, macOS, Linux에서 read-only 확인:

grep -nE 'fallback|auxiliary|base_url|provider|default' ~/.hermes/config.yaml

Windows에서는 %USERPROFILE%\.hermes\config.yaml를 확인하세요. Main endpoint, auxiliary providers, fallback_providers, 알 수 없는 remote Base URL을 점검합니다.

더 강한 증거가 필요하면 firewall, DNS, outbound proxy logs로 실제 연결을 관찰하세요. UI의 “local” 표시는 전체 workflow의 packet-level 보장이 아닙니다.

자주 발생하는 문제

Connection refused

curl http://127.0.0.1:11434/api/tags

실패하면 ollama serve 또는 desktop service를 시작합니다.

tool JSON만 출력하고 실행하지 않음

정확한 Qwen tag가 tools를 지원하는지, Hermes와 Ollama가 최신인지 확인하세요. 작은 model은 복잡한 arguments에서 불안정할 수 있습니다. 한 파일 test를 다시 실행한 뒤 더 큰 local model 또는 명시적 cloud switch를 시도합니다.

model 또는 provider가 없음

hermes model을 사용합니다. /model은 이미 설정된 routes만 표시합니다.

active chat이 이전 모델처럼 동작

Default 변경은 주로 새 sessions에 적용됩니다. Active chat에서 /model을 실행하거나 새 session을 시작하세요.

느리거나 context error 발생

ollama ps

Model size, GPU offload, context를 확인합니다. 큰 context는 tool schemas 유지에 도움이 되지만 memory와 first-turn prefill을 증가시킵니다.

하이브리드 구성이 유용해도 완전 offline은 아닐 수 있음

한 X 사용자는 Ollama Cloud의 Gemma, cloud Qwen, local Qwen, local Whisper, cloud TTS를 결합한 개인 prototype을 설명했습니다. Task별 routing 사례로는 유용하지만, 재현 가능한 설정, network logs, independent benchmark가 공개된 것은 아닌 단일 사용자 보고입니다.

Models, voice, tools는 각각 별도 경계를 가집니다. Local Whisper가 cloud TTS를 local로 만들지 않으며, local main model도 calendar, project management, search, remote MCP 요청을 자동으로 private하게 만들지 않습니다.

최종 체크리스트

  • local tag가 :cloud로 끝나지 않고 Base URL이 http://127.0.0.1:11434/v1입니다.
  • direct curl test가 성공하고 hermes status가 예상 route를 표시합니다.
  • 테스트 작업이 실제로 summary.md를 만듭니다.
  • cloud provider가 설정되어 있지만 모든 전환은 /model로 명시합니다.
  • 민감한 cloud 작업은 새 session과 최소 context로 시작합니다.
  • remote tools, auxiliary models, fallback_providers를 모두 점검했습니다.
  • 완전 offline 요구에서는 모든 network tools와 cloud services를 비활성화합니다.

참고 자료

LLM 워크플로를 최적화할 준비가 되셨나요?

하나의 API로 모델을 연결하고 키와 AI 비용을 관리하세요.

무료로 시작하기