Hermes Agent में लोकल मॉडल: Ollama, Qwen और स्पष्ट क्लाउड स्विचिंग
गोपनीयता-केंद्रित व्यावहारिक मार्गदर्शिका: Ollama के जरिए स्थानीय Qwen जोड़ें, छोटी फ़ाइल-टास्क से सेटअप जाँचें, cloud provider कॉन्फ़िगर करें, एक turn या session के लिए स्विच करें और tools, auxiliary models व fallback routes का audit करें।
विषय-सूची

Hermes Agent से रोज़मर्रा की फ़ाइल और terminal वाली टास्क अपने कंप्यूटर पर करवाई जा सकती हैं, जबकि कठिन काम के लिए cloud model उपलब्ध रखा जा सकता है। सबसे साफ़ नीति यह है कि पहले local route को एक छोटी टास्क से साबित करें और बाद में हर cloud escalation को जानबूझकर दिए गए command से करें, छिपे हुए automatic fallback से नहीं।
यह गाइड Hermes और Ollama की मौजूदा official documentation पर आधारित है। इसमें local Qwen जोड़ना, एक सत्यापित होने वाली फ़ाइल टास्क चलाना, cloud provider सेट करना, तीन प्रकार के model switch समझना और यह जाँचना शामिल है कि कौन-सा चरण मशीन से data बाहर भेज सकता है। यह documentation-verified workflow है, किसी खास hardware पर किया गया performance benchmark नहीं।
सुझाई गई नीति: default local रखें, cloud को स्पष्ट निर्णय बनाएं
| स्थिति | पहले क्या चुनें | कारण |
|---|---|---|
| Local files, छोटे code edits और routine work | Local Ollama/Qwen | Model request 127.0.0.1 पर जाती है, इसलिए सीमा साफ़ रहती है |
| Tool calls बार-बार गलत हों | पहले model, runtime और context जाँचें | समस्या tool format, parser या context की हो सकती है, task की कठिनाई की नहीं |
| बहुत लंबा context, कठिन reasoning, vision या तुरंत जवाब | नई साफ़ session खोलकर cloud पर स्पष्ट switch | पुरानी निजी conversation अनजाने में भेजे बिना अधिक क्षमता मिलती है |
| कोई data device से बाहर नहीं जाना चाहिए | केवल local model और local tools; cloud auxiliaries और fallback बंद | Local main model पूरे workflow को offline नहीं बनाता |
Model, tools और auxiliary services की सीमाएँ अलग-अलग देखें
| चरण | सामान्य data destination | क्या जाँचें |
|---|---|---|
Hermes http://127.0.0.1:11434/v1 को call करे | Local Ollama | Model tag का अंत :cloud से न हो और URL loopback हो |
| Cloud model पर switch के बाद अगला turn | चुना हुआ cloud provider | Conversation context, system instructions और tool schemas भेजे जा सकते हैं |
| Local file और terminal tools | सामान्यतः मशीन पर | Command खुद upload, download या remote API call कर सकता है |
| Web, browser, search, remote MCP या messaging | संबंधित remote service | Query, page content, tool arguments और results |
| Local Whisper और cloud TTS | Speech recognition local; synthesis text cloud में | यह hybrid voice stack है, पूरी तरह offline नहीं |
fallback_providers या cloud auxiliary slots | Trigger होने पर cloud | Error, rate limit, auth या capacity route बदल सकते हैं |
Ollama का Hermes selector local और cloud दोनों models दिखाता है। जिस model नाम का अंत :cloud से होता है, वह Ollama से चुने जाने के बावजूद remote inference करता है।
तेज़ तरीका: ollama launch hermes
ollama launch hermes
Official integration जरूरत होने पर Hermes install कर सकती है, model selector दिखाती है और http://127.0.0.1:11434/v1 सेट करती है। स्पष्ट local entry चुनें; उदाहरण के लिए qwen3.5:cloud local नहीं है।
Onboarding के बाद effective route जाँचें:
hermes config get model --json
hermes status
अगर launcher downloaded model न दिखाए या आप हर चरण देखना चाहते हों, manual setup करें।
Local Qwen को manual तरीके से जोड़ें
1. Tools support वाला Qwen model pull करें
Ollama Qwen 3.5 family को tools support के साथ सूचीबद्ध करता है। यहाँ qwen3.5:4b हल्के connectivity example के रूप में है; यह हर agentic task पर भरोसेमंद quality की गारंटी नहीं। पर्याप्त RAM या VRAM होने पर बड़ा official tag चुनें।
ollama --version
ollama pull qwen3.5:4b
यदि Ollama service पहले से नहीं चल रही है:
ollama serve
दूसरे terminal में model list जाँचें:
curl http://127.0.0.1:11434/api/tags
Hermes से पहले OpenAI-compatible endpoint सीधे test करें:
curl http://127.0.0.1:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.5:4b",
"messages": [{"role": "user", "content": "Reply with LOCAL_OK"}],
"max_tokens": 16
}'
Model reply वाला JSON आने पर Ollama local model serve कर रहा है। यहाँ Connection refused मिले तो पहले Ollama service ठीक करें।
2. Hermes को local endpoint पर सेट करें
hermes model
Custom endpoint चुनें और यह भरें:
- API Base URL:
http://127.0.0.1:11434/v1 - API Key: खाली छोड़ें
- Model:
qwen3.5:4b - Context length: जब current integration auto-detect दे, खाली छोड़ें
Saved route जाँचें:
hermes config get model --json
hermes status
Output में local model, custom provider और loopback URL दिखना चाहिए। Tool-heavy agent work के लिए Hermes बड़ा context सुझाता है। Context error आने पर अपने version की current docs देखें और Ollama में वास्तव में loaded value जाँचें:
ollama ps
ऐसा context force न करें जो out-of-memory या लगातार swapping पैदा करे।
छोटी file task चलाकर local chain सत्यापित करें
mkdir -p ~/hermes-local-check
cd ~/hermes-local-check
printf 'alpha\nbeta\ngamma\n' > input.txt
hermes
Hermes session में लिखें:
input.txt पढ़ें। summary.md बनाएं, उसमें कुल line count और एक वाक्य का सार लिखें। Web, browser, network, messaging या cloud tools का उपयोग न करें। अंत में लिखे गए exact path की जानकारी दें।
Result देखें:
cd ~/hermes-local-check
cat summary.md
Test तब pass माना जाए जब summary.md बने, तीन lines सही पहचाने, Hermes केवल tool-call JSON न छापकर फ़ाइल वास्तव में लिखे, hermes status local Qwen दिखाता रहे और अनचाहा cloud fallback या cloud auxiliary model न हो।
यह endpoint, tool loop और file write की connectivity साबित करता है। यह कठिन tasks का benchmark नहीं और सभी optional tools के offline होने का प्रमाण भी नहीं।
Cloud provider जोड़ें, लेकिन switch को visible रखें
hermes model
अपना cloud provider चुनें, OAuth या interactive secret input पूरा करें और model चुनें। API key को chat message या shell history में बचने वाले command में न डालें।
क्योंकि hermes model default बदलता है, cloud configuration के बाद current और future sessions को वापस local करें:
/model qwen3.5:4b --provider custom --global
तीन switch scopes हैं:
/model YOUR_CLOUD_MODEL --provider YOUR_CLOUD_PROVIDER
/model YOUR_CLOUD_MODEL --provider YOUR_CLOUD_PROVIDER --once
/model YOUR_CLOUD_MODEL --provider YOUR_CLOUD_PROVIDER --global
- पहला command केवल current session बदलता है।
--onceअगला turn cloud पर चलाकर पिछला model वापस लाता है।--globalcurrent session और नई sessions का default बदलता है।
Local पर लौटें:
/model qwen3.5:4b --provider custom
यदि /model में provider नहीं है, उसे पहले hermes model से configure या authenticate करें। Session command नया credentialed provider नहीं बनाता।
Cloud पर कब switch करना उचित है
Unreleased source code, personal documents, internal logs और सीमित scope वाली tasks local रखें। यदि tools सही चलते हैं और speed स्वीकार्य है, केवल संभावित quality improvement के लिए session upload करना आवश्यक नहीं।
Cloud तब चुनें जब endpoint, context और tool support जाँचने के बाद भी local model fail करे; या बहुत लंबा context, vision, complex multi-step reasoning अथवा कम latency चाहिए।
Sensitive काम में नई cloud session शुरू करें और केवल जरूरी सामग्री दें। Hermes बताता है कि mid-session model switch prompt cache reset करता है और अगली request conversation को फिर पढ़ती है। Privacy के लिहाज़ से मानें कि relevant current-session context cloud provider को जाएगा।
Auxiliary models और fallback का audit करें
यदि नियम है “हर external model call मेरी अनुमति से हो”, तो fallback_providers configure न करें। Fallback error, rate limit, authentication या capacity पर trigger हो सकता है; यह इंसान का “task बहुत कठिन है” वाला निर्णय नहीं।
Hermes compression, vision और web extraction जैसे side jobs को auxiliary models दे सकता है। Local main model से यह साबित नहीं होता कि ये slots भी local हैं।
Bash, macOS या Linux पर read-only check:
grep -nE 'fallback|auxiliary|base_url|provider|default' ~/.hermes/config.yaml
Windows में %USERPROFILE%\.hermes\config.yaml खोलें। Main endpoint, auxiliary providers, fallback_providers और अनजान remote Base URL देखें।
अधिक मजबूत सत्यापन के लिए firewall, DNS या outbound proxy logs देखें। UI का “local” label पूरे workflow की packet-level guarantee नहीं है।
सामान्य समस्याएँ
Connection refused
curl http://127.0.0.1:11434/api/tags
Failure पर ollama serve या desktop service शुरू करें।
Model tool JSON दिखाता है, action नहीं करता
Exact Qwen tag का tools support जाँचें और Hermes/Ollama update रखें। छोटा model complex arguments में अस्थिर हो सकता है। पहले single-file test दोहराएँ, फिर बड़ा local model या explicit cloud switch आज़माएँ।
Model या provider दिखाई नहीं देता
hermes model इस्तेमाल करें। /model केवल पहले से configured routes दिखाता है।
Current chat पुराना model ही चला रहा है
Default change मुख्यतः नई sessions पर लागू होता है। Active chat में /model चलाएँ या नई session खोलें।
Slow response या context error
ollama ps
Model size, GPU offload और context देखें। बड़ा context tool schemas रखने में मदद करता है, लेकिन memory और first-turn prefill बढ़ाता है।
Hybrid setup उपयोगी हो सकता है, पर पूरी तरह offline नहीं
एक X user ने Gemma via Ollama Cloud, cloud Qwen, local Qwen, local Whisper और cloud TTS वाला personal prototype बताया। यह task-based routing का उदाहरण है, लेकिन reproducible configuration, network log और independent benchmark के बिना एक व्यक्तिगत user report ही है।
Models, voice services और tools की अलग boundaries होती हैं। Local Whisper cloud TTS को local नहीं बनाता, और local main model calendar, project management, search या remote MCP calls को अपने आप private नहीं करता।
अंतिम checklist
- Local tag का अंत
:cloudसे नहीं और Base URLhttp://127.0.0.1:11434/v1है। - Direct
curltest सफल औरhermes statusexpected route दिखाता है। - Test task वास्तव में
summary.mdबनाती है। - Cloud provider configured है, पर हर switch स्पष्ट
/modelcommand से होता है। - Sensitive cloud work नई session और minimal context से शुरू होता है।
- Remote tools, auxiliary models और
fallback_providersजाँचे गए हैं। - Fully offline requirement में सभी network tools और cloud services disabled हैं।
स्रोत
- Hermes: local Ollama setup
- Hermes: models configure और switch करना
- Hermes: providers और custom endpoints
- Ollama: Hermes Agent integration
- Ollama: Qwen 3.5 library
- Hybrid prototype पर X post (user report, independent benchmark नहीं)