1 पॉइंट द्वारा GN⁺ 2024-04-07 | 2 टिप्पणियां | WhatsApp पर शेयर करें
  • SearXNG कई search sources को संभालने वाला एक metasearch engine है, और यह उपयोगकर्ताओं को track या profile नहीं करता
  • इंस्टॉल करने के लिए आधिकारिक Installation guide का उपयोग करें, और विस्तृत समायोजन के लिए Configuration guide देखें
  • संचालन और प्रबंधन से जुड़ा अतिरिक्त उपयोग SearXNG दस्तावेज़ों के admin सेक्शन में देखा जा सकता है
  • कम्युनिटी कनेक्शन चैनल के रूप में #searxng:matrix.org Matrix रूम उपलब्ध है
  • प्रोजेक्ट GNU Affero General Public License यानी AGPL-3.0 के तहत लाइसेंस प्राप्त है

SearXNG की भूमिका

  • SearXNG एक metasearch engine है
  • उपयोगकर्ताओं को SearXNG पर track या profile नहीं किया जाता

इंस्टॉलेशन और कॉन्फ़िगरेशन

  • इंस्टॉलेशन के लिए Installation guide देखें
  • विस्तृत सेटिंग्स और समायोजन Configuration guide में देखे जा सकते हैं
  • अतिरिक्त संचालन संबंधी तरीके admin दस्तावेज़ में व्यवस्थित हैं

कम्युनिटी और योगदान

  • सवाल या कम्युनिटी से जुड़ने के लिए Matrix चैनल #searxng:matrix.org का उपयोग किया जा सकता है
  • योगदान से जुड़ी विस्तृत जानकारी के लिए CONTRIBUTING देखें

लाइसेंस

  • यह प्रोजेक्ट GNU Affero General Public License के तहत वितरित किया जाता है
  • लाइसेंस की विस्तृत जानकारी LICENSE में उपलब्ध है

2 टिप्पणियां

 
GN⁺ 2024-04-07
Hacker News की राय
  • अगर आप ब्राउज़र की विज़िट history के सभी pages के content या bookmark किए गए कुछ pages तक ही search करना चाहते हैं, तो DownloadNet देखें। इसका पुराना नाम, और शायद फिर से इस्तेमाल होने वाला नाम, "DiskerNet" है
    यह browser से जुड़कर विस्तारित browsing experience देता है, और UI बिना CSS वाले 1997 के Google जैसा सरल है। Search अभी बहुत जटिल चीज़ें नहीं करता, लेकिन आगे कर सकेगा, और अभी भी काफ़ी usable है
    https://github.com/dosyago/DownloadNet
    साथ ही, यह आपके देखे गए सभी content या bookmarked content को offline भी देखने देता है। Oil rigs, ships, long-haul freight जैसे environments में, जहां satellite bandwidth बचानी पड़ती है, सामान्य तरीके से browse करते हुए चीज़ें save कर लेने के लिए अच्छा है

    • यह कौन-से browsers support करता है, ऐसी कोई documentation बिलकुल नहीं दिखती
    • इस topic में ज़रा भी रुचि रखने वाला कोई व्यक्ति “अपने internet browsing का master archivist” क्यों बनना चाहेगा, यह मुझे समझ नहीं आता
      मेरी internet browsing से जुड़ी चीज़ें मेरे human brain के अलावा और कहीं store न हों, मैं यही चाहूंगा। बेशक, यह मेरी अपनी preference है
      लेकिन इतना खुला promotion यहां क्यों फिट बैठता है—सिर्फ topic से हटकर ही नहीं, बल्कि पूर्ण personal privacy के बिलकुल उलट tool के रूप में—यह समझ नहीं आता
    • यह YaCy से बेहतर किस तरह है?
  • पुरानी याद आ गई। Google से पहले AltaVista, HotBot, Lycos जैसी जगहों के spammy search results के बीच ठीक-ठाक answers मिलने की संभावना बढ़ाने के लिए meta-search tools इस्तेमाल करते थे

    • सिर्फ spam से बचने के लिए ही नहीं; कुछ meta search engines—मुझे Dogpile याद है—White Pages या Yellow Pages जैसे specialized search engines भी search कर सकते थे। Yelp जैसी चीज़ों के आने से बहुत पहले, business listings और contact details मिल जाते थे जो आम web search engines में अच्छे से नहीं दिखते थे
      FTP search results भी शामिल किए जा सकते थे, और public anonymous FTP अभी आम था, इसलिए यह उपयोगी था
    • Nostalgia है। कई दशक बाद अब यह digital privacy के नाम पर वापस आया है
    • मुझे Copernic पसंद था। वह Windows 9x native meta search tool था
    • Northern Light भी ठीक था
    • Dogpile भी था
  • यह भी try करने लायक है। Kagi नहीं है, लेकिन search results काफ़ी अच्छे हैं और इसे Docker से self-host कर सकते हैं
    https://felladrin-minisearch.hf.space/

    • Results देखते समय यह बार-बार reload करता है, परेशान करने वाला है
    • SearxNG पर आधारित लगता है https://github.com/felladrin/MiniSearch
  • अच्छा है। अगर किसी specific domain को search results में कभी न आने देने के लिए block करने का तरीका हो, तो बढ़िया होगा
    Edit: लगता है इसके लिए पहले से open issue है
    https://github.com/searxng/searxng/issues/2351

    • संदर्भ के लिए, मैं maintainers में से एक हूं
      SearXNG का उद्देश्य state store किए बिना, server session के बिना काम करना है, और JavaScript के बिना भी चलना है
      हालांकि इस approach में cookie size limits के कारण कुछ features सीमित हो जाते हैं। Browser storage के दूसरे forms के लिए JavaScript चाहिए
    • Google में पहले यह feature था, लेकिन उन्होंने बंद कर दिया
      अभी भी हर search में exclude conditions manually डालकर यह संभव है, लेकिन list लंबी हो सकती है और user experience अच्छा कहना मुश्किल है
      Kagi में यह feature built-in है और इस्तेमाल में आसान है
      Browser extension uBlacklist भी इस्तेमाल कर सकते हैं। हालांकि मेरे मामले में समस्या यह थी कि सब कुछ slow हो जाता था
      पक्का नहीं, लेकिन लगता है यह search complete होने के बाद actual results को filter करता है। ऊपर के दोनों तरीके शुरुआत से ही results में शामिल होने से रोकते हैं
    • uBlacklist Google और कुछ दूसरे search engines पर यही काम करता है
      मैं Firefox में Pinterest की गड़बड़ चीज़ों को search results से filter करने के लिए इसका उपयोग कर रहा हूं, और Chrome व Safari के लिए भी उपलब्ध है
      https://github.com/iorate/ublacklist
    • Kagi में यह feature है
  • अगर इसे personal internet connection पर चलाते हैं, तो search engines का उपयोग बंद हो जाने का जोखिम है

    • ऐसा केवल तब होता है जब आप इसे बिना authentication के public में expose करते हैं और residential connection के जरिए queries route करते हैं; यह recommended setup नहीं है
      Personal use के लिए, इसे अपने computer पर सीधे चलाएं या VPN से access करें। Upstream search engines पर जाने वाली queries जरूरत के हिसाब से proxy या VPN से भेजी जा सकती हैं
      कुछ Tor पर भी अच्छी तरह काम करते हैं, और कुछ को commercial या self-made tunnels के जरिए भेजा जा सकता है
    • इस हिस्से को इस thread में कही गई बातों से कहीं ज़्यादा explanation चाहिए लगता है
      Local में चलाकर सिर्फ खुद इस्तेमाल करें तो block नहीं होंगे। उस search engine की नजर में request count लगभग वैसा ही दिखेगा जैसा सीधे इस्तेमाल करने पर होता
      घर में कुछ और लोग भी इस्तेमाल करें तो भी शायद ठीक रहेगा
      मैंने पुराना searx करीब 1–2 साल local में चलाया था और कोई समस्या नहीं हुई
    • विस्तार से समझा सकते हैं?
  • Publicly hosted searx instances बहुत हैं। Online public instances की list भी है, और अगर आप ऐसा tool खोज रहे हैं जो browser address bar से search करते समय हर बार किसी random instance पर भेज दे, तो neocities इस्तेमाल कर सकते हैं: https://searx.neocities.org/changelog
    मैं इसे हमेशा इस्तेमाल करता हूं। कमी यह है कि कभी-कभी ऐसी instance मिल जाती है जो कोई result नहीं देती या बहुत खराब होती है। हाल में ऐसा कम होने लगा है

  • SearXNG शानदार है, लेकिन कुछ सावधानियां हैं
    अगर इसे उस machine पर साथ में चलाएं जो कई devices को NAT देती है, तो DuckDuckGo जैसे upstream search engine blocks से बचने में मदद मिलती है। अगर आप इसे ऐसे IP पर नहीं चला सकते जो दूसरे कामों के लिए भी उपयोग होता है, तो specific upstream search engine access को अलग proxy पर भेजने का feature अच्छा होगा। यह समस्या सच में बहुत आम है
    काश एक 100% literal search mode हो, जिसमें मैंने जो भी शब्द type किए हैं, वे बिल्कुल वैसे ही results में अनिवार्य रूप से शामिल हों। शायद यह हर word के आगे "+" लगाने और हर word को quotes में रखने जैसा हो। Results कम हैं इसलिए मेरे explicitly न चाहने के बावजूद word changes होते रहते हैं, यह परेशान करता है
    जैसा दूसरी जगहों पर भी कहा गया है, मैं specific domains को explicitly exclude करना चाहता हूं। समझता हूं कि SearXNG stateless रहना चाहता है, लेकिन इसे अलग URL से configure किया जा सकता है या सभी searches पर लागू करने के लिए set किया जा सकता है। उदाहरण के लिए, किसी PDF manual को search करते समय मैं "manualslib.com" जैसी sites कभी नहीं देखना चाहता
    अच्छा होगा अगर ये चीज़ें हल हो जाएं, लेकिन इसके अलावा SearXNG चलाकर लोगों को Google की जगह इसे इस्तेमाल करने की सलाह देना काफ़ी अच्छी तरह काम करता रहा है

  • सब लोग Searx बेचते हैं, लेकिन मुझे व्यक्तिगत रूप से presearch.com पसंद है
    कोई affiliation नहीं और कोई financial interest नहीं है। उनके cryptocurrency-based business model में भी मेरी रुचि नहीं है
    असल में Google या Bing जैसी search results filtering की कमी को मैं freedom of expression बचाने वाला stance नहीं मानता, बल्कि funding की कमी या सफलता के लिए अधिक महत्वपूर्ण दूसरी priorities का नतीजा मानता हूं। यह internet के शुरुआती दौर जैसा है, जब companies की जरूरतें PR-friendly अच्छी भावनाएं या सही बातें ही दिखाने के बजाय पहले चीज़ को चलाने पर केंद्रित थीं
    खैर, जिन topics को Google शायद strongly filter करेगा या जो obscure हैं, उन्हें खोजते समय दूसरा perspective पाने के लिए मैं presearch देखता हूं। अच्छा हो अगर archive.org भी कुछ ऐसा करे। archive.org के पास बहुत बड़ा data है, लेकिन indexing और searchability अच्छी नहीं है

  • Mainstream search engines के अलग-अलग खराब results का average निकालकर किसी तरह usable results बनाने के लिए यह मेरा favorite tool है

  • पिछले 1 साल से मैं इसे सभी devices पर default के रूप में चला रहा हूं और बहुत संतुष्ट हूं। सिर्फ दो बार block हुआ, और बस update करने पर फिर ठीक से काम करने लगा

 
GN⁺ 16 일 전
Hacker News की टिप्पणियाँ
  • Searx का मूल निर्माता हूँ, लेकिन metasearch कॉन्सेप्ट की सीमाओं के कारण अब development में शामिल नहीं हूँ। नया search project https://github.com/asciimoo/hister (https://hister.org/) है
    Hister वेबसाइटों और local files के लिए एक specialized indexer है, और browser द्वारा render किए गए visited pages को अपने-आप save करता है
    पूरा page content save करने की वजह से offline result preview और MCP के जरिए full page उपलब्ध कराना संभव है
    MCP के उपयोग का उदाहरण यहाँ देखा जा सकता है: https://hister.org/posts/give-your-ai-assistant-a-private-me...

    • मैं self-hosted LLM और agent tools में उपयोगी जानकारी जोड़ने का तरीका खोज रहा था। SearXNG जैसे metasearch tools जानकारी खोजते समय bot detection में फँसने की संभावना घटाते हैं, लेकिन आम तौर पर tools में जो डालना चाहता हूँ वह ऐसी जानकारी होती है जिसे मैं पहले ही खोज चुका, पढ़ चुका या देख चुका हूँ
      मैंने निष्कर्ष निकाला कि search engine और browser extension के जरिए webpage content और metadata extract/store करने वाला self-hosted content repository मेरे लिए ideal setup होगा, और संभव हो तो federated content sharing तथा Wikipedia, Gutenberg जैसे Creative Commons content को import करना भी चाहता था
      Hister लगभग बिल्कुल वैसा दिखता है जैसा मैं चाहता था, और कुछ हफ्तों बाद code audit और deployment करके देखना चाहता हूँ
    • Hister उस चीज़ के करीब है जिसे मैं लंबे समय से चाहता था लेकिन बना नहीं पाया। search engine से मैं जो ज्यादातर काम करता हूँ वह पहले देखी हुई चीज़ ढूँढना है, इसलिए अगर local में जल्दी मिल जाए तो शानदार होगा
    • मैं भी एक तरह का search engine खुद इस्तेमाल कर रहा हूँ
      यह सिर्फ title, description, thumbnail और common Open Graph fields download करता है, और index काफ़ी हल्का है, ऐसा मानता हूँ। crawled pages 20 लाख हैं
      https://github.com/rumca-js/Internet-Places-Database
      tags और voting features support करता है
      हाल ही में पहला F-Droid app भी release किया है
      https://github.com/rumca-js/OfflineWebSearch
      https://f-droid.org/en/packages/io.github.rumcajs.offlineweb...
    • अच्छा दिख रहा है, लेकिन यह भी जानना चाहूँगा कि metasearch कॉन्सेप्ट की सीमाएँ क्या हैं—क्या आप थोड़ा और समझा सकते हैं?
    • करीब 20 साल पहले एक दोस्त ने local proxy बनाई थी, जो सारा web traffic इकट्ठा करके long-term memory की तरह इस्तेमाल करती थी। उसका web interface था, जिससे दस दिन पहले देखी चीज़, या नाम याद न हो लेकिन दिमाग में आ रहा कोई खास algorithm, जल्दी ढूँढा जा सकता था
      कई सालों से मैं काम से जुड़े तरह-तरह के links जमा करके रोज़ इस्तेमाल कर रहा हूँ; यह दोस्तों या colleagues के random सवालों के जवाब ऐसे देने के काम आता है जैसे टोपी से खरगोश निकालना। उदाहरण के लिए, अगर कोई data charts के लिए color palette ideas पूछे तो संबंधित scientific research तुरंत दे सकता हूँ, और कम-ज्ञात algorithms के लिए भी यही बात है
      समय के साथ collection काफी बड़ा हो गया है और सही चीज़ ढूँढना बहुत झंझट वाला हो गया है; सोच रहा हूँ कि यह project मेरी समस्या में फिट बैठेगा या नहीं
  • यह local model को search देने वाला core tool जैसा दिखता है
    जिज्ञासा है कि दूसरे लोग यह capability किस setup से देते हैं
    quantized 24-billion-parameter Gemma model आने के बाद 4070 Ti Super पर tool calling अच्छी तरह चली, और सफल tool calls की वजह से local environment आखिरकार उपयोगी लगने लगा
    संदर्भ के लिए, यह coding-specific नहीं बल्कि general context की बात है

    • settings में enable करने वाला JSON mode है, जिसके बाद simple Python script से interact किया जा सकता है, या agent curl और jq इस्तेमाल करके इसे संभाल सकता है
      यह इस page के सबसे नीचे है: https://docs.searxng.org/admin/settings/settings_search.html
    • TinySearch MCP इस्तेमाल करता हूँ। हालांकि Unsloth Studio इस्तेमाल करने पर वह बजाय इसके DuckDuckGo की HTML API call करता है, और काफी अच्छी तरह काम करता है
    • web search और दूसरे tools तक शामिल करने वाला पूरी तरह local AI stack कैसा दिखता है, यह मुझे भी जानना है। देखने में SearX में built-in MCP server नहीं है, इसलिए उदाहरण के लिए llama-server से सीधे call नहीं किया जा सकता
      Open WebUI में SearX और दूसरे providers के integrations हैं, लेकिन मुझे जो results मिले वे खास impressive नहीं थे
    • जानना चाहूँगा कि क्या आप quantized model चला रहे हैं। 4080 वाला एक दोस्त local model experiments करना चाहता है, और वह card इसके जैसा ही होगा, इसलिए अगर आप अपना setup थोड़ा और बता सकें तो अच्छा होगा
  • मैं 5 साल से ज़्यादा समय से SearXNG को अपनी default internet search के रूप में इस्तेमाल कर रहा/रही हूँ, और YaCy backend वगैरह को भी विकल्प के तौर पर रखा है। इसी setup से internal documents search या RAG applications भी बना रहा/रही हूँ, और SearXNG JSON results भी support करता है
    हालांकि privacy के लिए कुछ कमियां स्वीकार करनी पड़ती हैं। यह धीमा है और results की quality दूसरी searches से कम है, लेकिन ज़्यादातर queries के लिए पर्याप्त तेज़ और पर्याप्त अच्छा है
    कभी-कभी DuckDuckGo, Brave जैसी searches पर block हो जाता है और CAPTCHA solve करना पड़ता है; API key लेकर इस्तेमाल करें तो इससे बचा जा सकता है
    अपना backend इस्तेमाल करने पर results में priority दी जा सकती है। मसलन, अगर small web या मेरे लिए ज़रूरी sites को crawl करके रखा हो, तो वे sites search results में ऊपर दिखती हैं

    • मैं भी SearXNG को 5 साल से ज़्यादा समय से रोज़ इस्तेमाल कर रहा/रही हूँ
      जानना चाहता/चाहती हूँ कि क्या आप YaCy instance को खुद “बहुत तेज़” चला रहे हैं, या कोई खास setting है
      मेरे अनुभव में YaCy करीब 30 सेकंड तक धीरे-धीरे results stream करता है, इसलिए SearX backend के तौर पर ठीक से fit नहीं बैठा
      local kiwix-serve से Wikipedia, Wiktionary, Gutenberg, ArchWiki आदि की ZIM files भी serve करता/करती हूँ, लेकिन Kiwix search engine [0] भी बहुत ज़्यादा results लौटाता है और SearX results page को clutter कर देता है, इसलिए backend के तौर पर ठीक नहीं बैठता
      अभी तक SearX को local Recoll instance [1] से connect नहीं किया है। Recoll ZIM files की indexing support नहीं करता, लेकिन दूसरे archived HTML documents के लिए उपयोगी हो सकता है
      search को सही तरीके से बनाना मुश्किल है, इसलिए अगर कोई setup वाकई अच्छी तरह चल रहा हो तो और जानना चाहूँगा/चाहूँगी
      [0] https://kiwix-tools.readthedocs.io/en/latest/kiwix-serve.htm...
      [1] https://docs.searxng.org/dev/engines/online/recoll.html
  • SearXNG को कई सालों से इस्तेमाल कर रहा/रही हूँ। GFW की अमानवीय network censorship और search engines की proxy detection की वजह से अपना instance नहीं चलाता/चलाती, बल्कि public instances की list [1] और libredirect [2] पर निर्भर करता/करती हूँ
    किसी एक instance की service guarantee नहीं होती, लेकिन लगभग बिना लागत के 1 मिनट के अंदर किसी दूसरे available instance पर switch किया जा सकता है
    यह कहना मुश्किल है कि SearXNG de-Google होने में मदद करता है। metasearch engine results इकट्ठा करने के लिए Google जैसे दूसरे search engines को call करता है
    फिर भी SearXNG इस्तेमाल करके AI summaries जैसी चीज़ों से जल्दी बचा जा सकता है
    [1] https://searx.space
    [2] https://github.com/libredirect/browser_extension

    • public instances में आजकल सही से काम करने वाला ढूंढने के लिए कई instances आज़माने पड़ते हैं। SearXNG को बेहतर quality control की ज़रूरत है
      अक्सर settings में जाकर काम न करने वाले search engines disable करने पड़ते हैं, या जो engines अच्छे से काम कर रहे हों उन्हें चुनना पड़ता है। आमतौर पर instance block हो जाने की वजह से ऐसा होता है, और reliability की समस्या है
      कौन सा engine काम करता है, यह हर public instance में अलग होता है, इसलिए settings hash save करने पर भी हमेशा काम नहीं करता
      अच्छा होगा अगर SearXNG reliability के आधार पर दिखाए जाने वाले search engines को अपने-आप adjust करे, या ऐसा option दे
  • कई सालों से सभी searches के default engine के रूप में इसे self-host करके इस्तेमाल कर रहा/रही हूँ, और strongly recommend करता/करती हूँ

    • हाल में पता चला कि Exa की pricing काफी महंगी है, इसलिए SearXNG आज़माऊँगा/आज़माऊँगी। खासकर जब एक search में 30–40 sources लाए जाते हैं; default के रूप में इस्तेमाल किया और bill देखकर चौंक गया/गई
  • TinySearch SearXNG को wrap करके agents के लिए अच्छी तरह काम करता है। यह native SearXNG MCP से बेहतर है, क्योंकि agent तक पहुंचने से पहले context optimize कर देता है और tokens waste नहीं होते
    https://github.com/MarcellM01/TinySearch

    • आखिरी बार जब देखा था, SearXNG में built-in MCP server नहीं था
  • Brave Search API से connect करने पर अच्छी तरह काम करता है, लेकिन scraper की तरह इस्तेमाल करने पर काफी unstable है। Google कुछ दिन पहले से काम करना बंद कर चुका है

  • coding agent के लिए MCP के रूप में इस्तेमाल करने के लिए https://github.com/denysvitali/searxng-mcp बनाया था। provider, जैसे DuckDuckGo, पर request limit लगने तक यह बहुत अच्छी तरह काम करता है
    इसे चलाने के लिए SearXNG server भी चाहिए, इसलिए हाल में standalone solution https://github.com/denysvitali/search-mcp की तरफ रुख किया है

    • मैंने भी मिलता-जुलता कुछ बनाया है([1]), शायद दिलचस्प हो। यह आपके project जैसा है, लेकिन एक मज़ेदार फर्क यह है कि इसमें searxng को अंदर bundle किया गया है, इसलिए अलग SearXNG instance चलाने या खोजने की ज़रूरत नहीं
      [1]: https://github.com/nikvdp/searxng-ai-kit
  • मुझे SearXNG काफी समय से बहुत पसंद है। Google के प्रति नापसंदगी बढ़ती गई है, और मेरी सहमति के बिना PC पर छोटे AI model जैसी चीज़ install होने से बचते हुए search कर पाना शानदार है

  • यह tool मुझे हमेशा पसंद रहा है, लेकिन search को एक company के बजाय 280 companies को भेजना privacy में कितना मददगार है, इस पर मेरी राय मिली-जुली है