आमंत्रित करें और कमाएँ

आमंत्रण पुरस्कार कैसे काम करते हैं

अपना आमंत्रण लिंक साझा करें। मित्र इसके माध्यम से पंजीकरण करके टॉप-अप करता है तो उसके बाद के टॉप-अप पर आपको दिखाया गया पुरस्कार मिलेगा।

Hermes Agent में लोकल मॉडल: Ollama, Qwen और स्पष्ट क्लाउड स्विचिंग

गोपनीयता-केंद्रित व्यावहारिक मार्गदर्शिका: Ollama के जरिए स्थानीय Qwen जोड़ें, छोटी फ़ाइल-टास्क से सेटअप जाँचें, cloud provider कॉन्फ़िगर करें, एक turn या session के लिए स्विच करें और tools, auxiliary models व fallback routes का audit करें।

विषय-सूची
Hermes Agent में लोकल मॉडल: Ollama, Qwen और स्पष्ट क्लाउड स्विचिंग

Hermes Agent से रोज़मर्रा की फ़ाइल और terminal वाली टास्क अपने कंप्यूटर पर करवाई जा सकती हैं, जबकि कठिन काम के लिए cloud model उपलब्ध रखा जा सकता है। सबसे साफ़ नीति यह है कि पहले local route को एक छोटी टास्क से साबित करें और बाद में हर cloud escalation को जानबूझकर दिए गए command से करें, छिपे हुए automatic fallback से नहीं।

यह गाइड Hermes और Ollama की मौजूदा official documentation पर आधारित है। इसमें local Qwen जोड़ना, एक सत्यापित होने वाली फ़ाइल टास्क चलाना, cloud provider सेट करना, तीन प्रकार के model switch समझना और यह जाँचना शामिल है कि कौन-सा चरण मशीन से data बाहर भेज सकता है। यह documentation-verified workflow है, किसी खास hardware पर किया गया performance benchmark नहीं।

सुझाई गई नीति: default local रखें, cloud को स्पष्ट निर्णय बनाएं

स्थितिपहले क्या चुनेंकारण
Local files, छोटे code edits और routine workLocal Ollama/QwenModel request 127.0.0.1 पर जाती है, इसलिए सीमा साफ़ रहती है
Tool calls बार-बार गलत होंपहले model, runtime और context जाँचेंसमस्या tool format, parser या context की हो सकती है, task की कठिनाई की नहीं
बहुत लंबा context, कठिन reasoning, vision या तुरंत जवाबनई साफ़ session खोलकर cloud पर स्पष्ट switchपुरानी निजी conversation अनजाने में भेजे बिना अधिक क्षमता मिलती है
कोई data device से बाहर नहीं जाना चाहिएकेवल local model और local tools; cloud auxiliaries और fallback बंदLocal main model पूरे workflow को offline नहीं बनाता

Model, tools और auxiliary services की सीमाएँ अलग-अलग देखें

चरणसामान्य data destinationक्या जाँचें
Hermes http://127.0.0.1:11434/v1 को call करेLocal OllamaModel tag का अंत :cloud से न हो और URL loopback हो
Cloud model पर switch के बाद अगला turnचुना हुआ cloud providerConversation context, system instructions और tool schemas भेजे जा सकते हैं
Local file और terminal toolsसामान्यतः मशीन परCommand खुद upload, download या remote API call कर सकता है
Web, browser, search, remote MCP या messagingसंबंधित remote serviceQuery, page content, tool arguments और results
Local Whisper और cloud TTSSpeech recognition local; synthesis text cloud मेंयह hybrid voice stack है, पूरी तरह offline नहीं
fallback_providers या cloud auxiliary slotsTrigger होने पर cloudError, rate limit, auth या capacity route बदल सकते हैं

Ollama का Hermes selector local और cloud दोनों models दिखाता है। जिस model नाम का अंत :cloud से होता है, वह Ollama से चुने जाने के बावजूद remote inference करता है।

तेज़ तरीका: ollama launch hermes

ollama launch hermes

Official integration जरूरत होने पर Hermes install कर सकती है, model selector दिखाती है और http://127.0.0.1:11434/v1 सेट करती है। स्पष्ट local entry चुनें; उदाहरण के लिए qwen3.5:cloud local नहीं है।

Onboarding के बाद effective route जाँचें:

hermes config get model --json
hermes status

अगर launcher downloaded model न दिखाए या आप हर चरण देखना चाहते हों, manual setup करें।

Local Qwen को manual तरीके से जोड़ें

1. Tools support वाला Qwen model pull करें

Ollama Qwen 3.5 family को tools support के साथ सूचीबद्ध करता है। यहाँ qwen3.5:4b हल्के connectivity example के रूप में है; यह हर agentic task पर भरोसेमंद quality की गारंटी नहीं। पर्याप्त RAM या VRAM होने पर बड़ा official tag चुनें।

ollama --version
ollama pull qwen3.5:4b

यदि Ollama service पहले से नहीं चल रही है:

ollama serve

दूसरे terminal में model list जाँचें:

curl http://127.0.0.1:11434/api/tags

Hermes से पहले OpenAI-compatible endpoint सीधे test करें:

curl http://127.0.0.1:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.5:4b",
    "messages": [{"role": "user", "content": "Reply with LOCAL_OK"}],
    "max_tokens": 16
  }'

Model reply वाला JSON आने पर Ollama local model serve कर रहा है। यहाँ Connection refused मिले तो पहले Ollama service ठीक करें।

2. Hermes को local endpoint पर सेट करें

hermes model

Custom endpoint चुनें और यह भरें:

  • API Base URL: http://127.0.0.1:11434/v1
  • API Key: खाली छोड़ें
  • Model: qwen3.5:4b
  • Context length: जब current integration auto-detect दे, खाली छोड़ें

Saved route जाँचें:

hermes config get model --json
hermes status

Output में local model, custom provider और loopback URL दिखना चाहिए। Tool-heavy agent work के लिए Hermes बड़ा context सुझाता है। Context error आने पर अपने version की current docs देखें और Ollama में वास्तव में loaded value जाँचें:

ollama ps

ऐसा context force न करें जो out-of-memory या लगातार swapping पैदा करे।

छोटी file task चलाकर local chain सत्यापित करें

mkdir -p ~/hermes-local-check
cd ~/hermes-local-check
printf 'alpha\nbeta\ngamma\n' > input.txt
hermes

Hermes session में लिखें:

input.txt पढ़ें। summary.md बनाएं, उसमें कुल line count और एक वाक्य का सार लिखें। Web, browser, network, messaging या cloud tools का उपयोग न करें। अंत में लिखे गए exact path की जानकारी दें।

Result देखें:

cd ~/hermes-local-check
cat summary.md

Test तब pass माना जाए जब summary.md बने, तीन lines सही पहचाने, Hermes केवल tool-call JSON न छापकर फ़ाइल वास्तव में लिखे, hermes status local Qwen दिखाता रहे और अनचाहा cloud fallback या cloud auxiliary model न हो।

यह endpoint, tool loop और file write की connectivity साबित करता है। यह कठिन tasks का benchmark नहीं और सभी optional tools के offline होने का प्रमाण भी नहीं।

Cloud provider जोड़ें, लेकिन switch को visible रखें

hermes model

अपना cloud provider चुनें, OAuth या interactive secret input पूरा करें और model चुनें। API key को chat message या shell history में बचने वाले command में न डालें।

क्योंकि hermes model default बदलता है, cloud configuration के बाद current और future sessions को वापस local करें:

/model qwen3.5:4b --provider custom --global

तीन switch scopes हैं:

/model YOUR_CLOUD_MODEL --provider YOUR_CLOUD_PROVIDER
/model YOUR_CLOUD_MODEL --provider YOUR_CLOUD_PROVIDER --once
/model YOUR_CLOUD_MODEL --provider YOUR_CLOUD_PROVIDER --global
  • पहला command केवल current session बदलता है।
  • --once अगला turn cloud पर चलाकर पिछला model वापस लाता है।
  • --global current session और नई sessions का default बदलता है।

Local पर लौटें:

/model qwen3.5:4b --provider custom

यदि /model में provider नहीं है, उसे पहले hermes model से configure या authenticate करें। Session command नया credentialed provider नहीं बनाता।

Cloud पर कब switch करना उचित है

Unreleased source code, personal documents, internal logs और सीमित scope वाली tasks local रखें। यदि tools सही चलते हैं और speed स्वीकार्य है, केवल संभावित quality improvement के लिए session upload करना आवश्यक नहीं।

Cloud तब चुनें जब endpoint, context और tool support जाँचने के बाद भी local model fail करे; या बहुत लंबा context, vision, complex multi-step reasoning अथवा कम latency चाहिए।

Sensitive काम में नई cloud session शुरू करें और केवल जरूरी सामग्री दें। Hermes बताता है कि mid-session model switch prompt cache reset करता है और अगली request conversation को फिर पढ़ती है। Privacy के लिहाज़ से मानें कि relevant current-session context cloud provider को जाएगा।

Auxiliary models और fallback का audit करें

यदि नियम है “हर external model call मेरी अनुमति से हो”, तो fallback_providers configure न करें। Fallback error, rate limit, authentication या capacity पर trigger हो सकता है; यह इंसान का “task बहुत कठिन है” वाला निर्णय नहीं।

Hermes compression, vision और web extraction जैसे side jobs को auxiliary models दे सकता है। Local main model से यह साबित नहीं होता कि ये slots भी local हैं।

Bash, macOS या Linux पर read-only check:

grep -nE 'fallback|auxiliary|base_url|provider|default' ~/.hermes/config.yaml

Windows में %USERPROFILE%\.hermes\config.yaml खोलें। Main endpoint, auxiliary providers, fallback_providers और अनजान remote Base URL देखें।

अधिक मजबूत सत्यापन के लिए firewall, DNS या outbound proxy logs देखें। UI का “local” label पूरे workflow की packet-level guarantee नहीं है।

सामान्य समस्याएँ

Connection refused

curl http://127.0.0.1:11434/api/tags

Failure पर ollama serve या desktop service शुरू करें।

Model tool JSON दिखाता है, action नहीं करता

Exact Qwen tag का tools support जाँचें और Hermes/Ollama update रखें। छोटा model complex arguments में अस्थिर हो सकता है। पहले single-file test दोहराएँ, फिर बड़ा local model या explicit cloud switch आज़माएँ।

Model या provider दिखाई नहीं देता

hermes model इस्तेमाल करें। /model केवल पहले से configured routes दिखाता है।

Current chat पुराना model ही चला रहा है

Default change मुख्यतः नई sessions पर लागू होता है। Active chat में /model चलाएँ या नई session खोलें।

Slow response या context error

ollama ps

Model size, GPU offload और context देखें। बड़ा context tool schemas रखने में मदद करता है, लेकिन memory और first-turn prefill बढ़ाता है।

Hybrid setup उपयोगी हो सकता है, पर पूरी तरह offline नहीं

एक X user ने Gemma via Ollama Cloud, cloud Qwen, local Qwen, local Whisper और cloud TTS वाला personal prototype बताया। यह task-based routing का उदाहरण है, लेकिन reproducible configuration, network log और independent benchmark के बिना एक व्यक्तिगत user report ही है।

Models, voice services और tools की अलग boundaries होती हैं। Local Whisper cloud TTS को local नहीं बनाता, और local main model calendar, project management, search या remote MCP calls को अपने आप private नहीं करता।

अंतिम checklist

  • Local tag का अंत :cloud से नहीं और Base URL http://127.0.0.1:11434/v1 है।
  • Direct curl test सफल और hermes status expected route दिखाता है।
  • Test task वास्तव में summary.md बनाती है।
  • Cloud provider configured है, पर हर switch स्पष्ट /model command से होता है।
  • Sensitive cloud work नई session और minimal context से शुरू होता है।
  • Remote tools, auxiliary models और fallback_providers जाँचे गए हैं।
  • Fully offline requirement में सभी network tools और cloud services disabled हैं।

स्रोत

अपना LLM वर्कफ़्लो बेहतर बनाना चाहते हैं?

एक API से मॉडल जोड़ें, कुंजियाँ प्रबंधित करें और AI खर्च नियंत्रित करें।

मुफ़्त शुरू करें