4 पॉइंट द्वारा GN⁺ 2026-04-07 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • macOS पर Control key दबाकर बोलने पर अपने-आप टेक्स्ट में बदलकर paste करने वाला लोकल speech recognition ऐप
  • सभी speech recognition और text cleanup प्रक्रियाएँ सिर्फ लोकल में चलती हैं, इसलिए cloud ट्रांसमिशन के बिना privacy सुरक्षा सुनिश्चित होती है
  • WhisperKit और LLM.swift पर आधारित, Hugging Face models को अपने-आप डाउनलोड करके cache में सेव करता है
  • smart cleanup फीचर से अनावश्यक शब्द हटते हैं और self-correction अभिव्यक्तियों को सुधारा जाता है, menu bar ऐप के रूप में बैकग्राउंड में चलता है
  • MIT license open source के रूप में उपलब्ध है और Apple Silicon macOS 14 या उससे ऊपर पर चलता है

अवलोकन

  • Ghost Pepper macOS के लिए एक पूरी तरह लोकल speech-to-text कन्वर्ज़न ऐप है, जो Control key दबाकर बोलने और छोड़ते ही अपने-आप टेक्स्ट में बदलकर paste करने की सुविधा देता है
  • यह cloud API का उपयोग नहीं करता, और सभी डेटा व models सिर्फ लोकल में प्रोसेस होते हैं
  • Apple Silicon(M1 या उससे ऊपर) आधारित macOS 14.0 या उससे ऊपर पर चलता है
  • यह menu bar ऐप के रूप में चलता है और login पर अपने-आप शुरू किया जा सकता है
  • MIT license के तहत जारी एक open source प्रोजेक्ट है

मुख्य फीचर्स

  • Control key दबाकर बोलें → key छोड़ते ही अपने-आप text conversion और paste
  • लोकल execution structure की वजह से speech recognition और post-processing models दोनों Mac के अंदर ही चलते हैं
  • smart cleanup फीचर अनावश्यक शब्दों (uh, um आदि) को हटाता है और self-correction अभिव्यक्तियों को अपने-आप सुधारता है
  • menu bar-only interface के साथ Dock icon के बिना बैकग्राउंड में काम करता है
  • user settings support: cleanup prompt बदलना, mic चुनना, फीचर on/off करना संभव

काम करने का तरीका

  • सभी models open source आधारित हैं और पहली बार चलाने पर अपने-आप डाउनलोड होकर लोकल cache में सेव हो जाते हैं
  • speech recognition WhisperKit से और text cleanup LLM.swift के जरिए किया जाता है
  • model files Hugging Face से उपलब्ध कराई जाती हैं
  • speech recognition models

    • Whisper tiny.en (~75MB): सबसे तेज़ English-only model
    • Whisper small.en (~466MB): डिफॉल्ट, उच्च accuracy वाला English-only model
    • Whisper small (multilingual): बहुभाषी support
    • Parakeet v3 (~1.4GB): 25 भाषाओं का support, FluidAudio आधारित
  • text cleanup models

    • Qwen 3.5 0.8B (~535MB): डिफॉल्ट, लगभग 1~2 सेकंड में प्रोसेसिंग
    • Qwen 3.5 2B (~1.3GB): तेज़ प्रोसेसिंग स्पीड (लगभग 4~5 सेकंड)
    • Qwen 3.5 4B (~2.8GB): सर्वोत्तम quality (लगभग 5~7 सेकंड)

इंस्टॉलेशन और रन

  • ऐप इंस्टॉलेशन

    1. GhostPepper.dmg डाउनलोड करें
    2. DMG खोलने के बाद Applications folder में drag करें
    3. Microphone और Accessibility permissions की अनुमति दें
    4. Control key दबाकर बोलें और उपयोग शुरू करें
  • source build

    1. repository clone करें
    2. GhostPepper.xcodeproj को Xcode में खोलें
    3. Cmd+R से build और run करें

permission आवश्यकताएँ

permission उद्देश्य
Microphone आवाज़ रिकॉर्ड करना
Accessibility global shortcut और auto-paste चलाना

अतिरिक्त जानकारी

  • login पर अपने-आप चलना डिफॉल्ट रूप से सक्षम है, और settings में इसे बंद किया जा सकता है
  • disk पर कोई logs सेव नहीं होते — बदला गया टेक्स्ट file में रिकॉर्ड नहीं होता, और debug logs केवल memory में रखे जाते हैं और ऐप बंद होने पर हटा दिए जाते हैं

तकनीकी संरचना और dependencies

  • WhisperKit: speech recognition engine
  • LLM.swift: text cleanup के लिए लोकल LLM
  • Hugging Face: model hosting
  • Sparkle: macOS ऐप update management

नाम का अर्थ

  • सभी models सिर्फ लोकल में चलते हैं, इसलिए व्यक्तिगत डेटा बाहर नहीं भेजा जाता
  • Ghost Pepper(तीखी मिर्च) नाम मुफ़्त में मिलने वाली शक्तिशाली क्षमताओं का प्रतीक है

एंटरप्राइज़ और managed devices support

  • ऐप को Accessibility permission चाहिए, जिसके लिए आमतौर पर admin permission की आवश्यकता होती है
  • MDM environments(Jamf, Kandji, Mosaic आदि) में PPPC(Privacy Preferences Policy Control) profile के जरिए पहले से अनुमति दी जा सकती है
    • Bundle ID: com.github.matthartman.ghostpepper
    • Team ID: BBVMGXR9AY
    • Permission: Accessibility (com.apple.security.accessibility)

1 टिप्पणियां

 
GN⁺ 2026-04-07
Hacker News की राय
  • यह ऐप वाकई शानदार है। लेकिन इसे हर बार देखते ही मुझे अपना Pixel 6 याद आ जाता है।
    यह 2021 का मॉडल है, फिर भी ऑफलाइन रहते हुए speech को text में बदल देता है और संदर्भ के हिसाब से अपने-आप सुधार भी करता है। यहाँ तक कि अगर मैं बोलता ही रहूँ, तो यह पहले वाले वाक्यों को भी फिर से ठीक कर देता है।
    हैरानी होती है कि Google ने Whisper या Qwen से 5 साल पहले ही ऐसी तकनीक दे दी थी। लेकिन फिर सवाल आता है कि अब ज़्यादा ताकतवर प्लेटफ़ॉर्म पर 1GB का transformer model क्यों चाहिए

    • यह वही model है जो WebSpeech API में इस्तेमाल होता है। यह पूरी तरह ऑफलाइन भी काम करता है।
      Google ने लगभग 10 साल पहले इस model की training को support किया था, और यह आज भी काफ़ी बढ़िया है।
      यह Webkit या Blink आधारित browsers में built-in है, इसलिए कई websites इसे सिर्फ frontend की तरह इस्तेमाल कर रही हैं।
      लेकिन model खुद private blob फ़ॉर्म में है, इसलिए Firefox में supported नहीं है।
      MDN दस्तावेज़ / Chrome demo
    • Microsoft OneNote में भी लगभग 2007 के आसपास ऐसा ही feature था।
      मैं उस समय team में था, और maintenance staff न होने की वजह से offline model छोड़कर इसे online-only कर दिया गया।
      तकनीकी वजह से ज़्यादा, यह बस maintenance staff की कमी की वजह से हुआ
    • accuracy काफ़ी कम है।
      Android पर मैं Futo और macOS पर MacWhisper इस्तेमाल करता हूँ। यह default Apple model से काफ़ी बेहतर हैं
    • macOS और iOS में built-in dictation feature से भी यह किया जा सकता है। Mac पर Globe key + D
    • मेरे Pixel 7 में तो recognition rate इतना कम है कि मैं उसे लगभग इस्तेमाल ही नहीं कर पाता।
      उसके बजाय open source Whisper या Parakeet जैसे local STT models कहीं ज़्यादा ताकतवर हैं।
      ये background noise या बड़बड़ाहट से कम प्रभावित होते हैं।
      मैं Voice AI क्षेत्र में काम करता हूँ, इसलिए रोज़ ऐसे models इस्तेमाल करता हूँ, और फ़र्क़ सच में बहुत महसूस होता है
  • ऐप बहुत अच्छी तरह बनाया गया है। अगर feedback दूँ, तो
    पहला, अपने-आप clipboard में paste करने वाला feature ज़रूर होना चाहिए। ऐसा हो कि shortcut key दबानी न पड़े, या कम से कम इसे setting में configure किया जा सके
    दूसरा, speed दूसरी solutions की तुलना में थोड़ी धीमी है। usability पर इसका बड़ा असर पड़ता है
    तीसरा, formatting control होना अच्छा रहेगा। जैसे अगर मैं “new line” बोलूँ, तो वह सचमुच line break के रूप में पहचाना जाए

  • यह thread कुछ ऐसा लग रहा है जैसे macOS speech-to-text apps बनाने वाले लोगों का support group हो

    • मैंने अपने बनाए सभी apps को यहाँ संकलित किया है।
      हाल ही में Ghost Pepper भी जोड़ा है, और आप चाहें तो ज़रूरी features वाली skill.md बनाकर खुद भी ऐप build कर सकते हैं
    • /r/macapps subreddit में भी whisper dictation apps बहुत ज़्यादा हैं।
      ऐसी saturated category में आपको existing apps से अपनी differentiation साफ़-साफ़ बतानी पड़ती है
      संबंधित पोस्ट
    • मैंने भी एक खुद बनाया था, लेकिन बाद में KeyVox देखा और उसके creator से बात हुई।
      KeyVox GitHub
    • मैंने nixOS पर Noctalia में indicator जोड़कर इसे implement किया था।
      performance लगभग Wispr Flow जैसी है, और यह पूरी तरह local पर चलता है
    • typical Apple style में, उम्मीद है कि macOS 27 या 28 तक यह default feature बन जाएगा
  • Linux user होने के नाते मैंने Hyprwhspr विकसित किया है।
    अगर latest Cohere Transcribe model को GPU पर चलाएँ, तो performance बहुत अच्छी मिलती है।
    जानना चाहूँगा कि WhisperKit की तुलना faster-whisper या turbov3 से की गई है या नहीं।
    उम्मीद है Apple जल्द ही native STT जारी करेगा

    • जानना चाहूँगा कि यह Handy की तुलना में कैसा है।
      और यह भी कि मौजूदा project को improve करने के बजाय नया project क्यों बनाया गया
    • मैं Whisper large-v3 को M2 Max पर self-host करके चलाता हूँ।
      इसकी accuracy मेरे लिए काफ़ी है, इसलिए cleanup model की ज़रूरत नहीं पड़ी।
      लेकिन 30 सेकंड से लंबी audio में latency महसूस होती है। जानना चाहूँगा कि WhisperKit लंबी audio को कैसे handle करता है
    • मैं Omarchy में Hyprwhspr रोज़ इस्तेमाल करता हूँ। यह सच में शानदार है
    • मैं भी कुछ ऐसा ही बनाने वाला था, अब आपकी वजह से बनाने की ज़रूरत नहीं रही।
      क्या आपने कभी foot pedal PTT (Push-To-Talk) feature पर विचार किया है?
      Apple के पास पहले से STT है, लेकिन model quality अभी भी थोड़ी कमज़ोर लगती है
  • Speech-to-text मेरे development flow का अहम हिस्सा है।
    खासकर जब LLM या coding agent को prompts बोलकर देने हों, तब यह बहुत उपयोगी होता है।
    मैंने platform-wise सबसे अच्छे open source voice input tools को इस GitHub repository में संकलित किया है

    • जानना चाहूँगा कि development में dictation का उपयोग कैसे करते हैं।
      मैं 120 शब्द प्रति मिनट टाइप कर लेता हूँ, इसलिए मेरे लिए बोलना टाइपिंग से काफ़ी धीमा है।
      accessibility के अलावा, मैं सच में जानना चाहता हूँ कि यह धीमे typists के लिए है या सोफ़े पर लेटकर coding करने के लिए
  • क्या Handy जैसी apps पहले से मौजूद नहीं हैं?

    • कुछ कमियाँ हैं।
      1. Linux पर FTP account, curlftpfs, और SVN/CVS के साथ आसानी से ऐसा ही system बनाया जा सकता है
      2. यह USB drive की पूरी तरह जगह नहीं ले सकता। offline presentations के लिए मैं अब भी USB साथ रखता हूँ
      3. revenue model साफ़ नहीं है। free में देकर monetize कर पाएँगे या नहीं, इस पर संदेह है
    • Handy सच में बहुत अच्छी तरह बनाया गया tool है
    • एक ही समस्या को हल करने के लिए कई solutions हो सकते हैं
    • हाँ, speech-to-text तो पहले से मौजूद है
    • मेरे use case के लिए यह बिल्कुल फिट है। दूसरी apps के UI को छूने की ज़रूरत नहीं पड़ती
  • शेयर करने के लिए धन्यवाद। local speed और privacy पर ध्यान देने वाली बात मुझे पसंद आई।
    मैं अभी Hex इस्तेमाल कर रहा हूँ, जिसका लक्ष्य भी मिलता-जुलता है। दोनों apps के फ़र्क़ पर आपकी राय जानना चाहूँगा

  • आजकल जैसे-जैसे local-first LLM छोटे होते जा रहे हैं, लगता है वे app development की core infrastructure बन जाएँगे।
    जैसे पहले Electron ने सुंदर apps बनाना आसान कर दिया था, अब बस थोड़ा RAM sacrifice करना होगा

  • Whisper से जुड़े projects बहुत हैं, तो सोचता हूँ कि यह पुराना OpenAI model है या कोई updated version।
    मैं Parakeet v3 इस्तेमाल करता हूँ, यह छोटा है और शानदार भी। फिर भी अब तक Whisper इतना ज़्यादा क्यों है, यह समझ नहीं आता

    • Whisper अभी भी stable और reliable model है।
      नए models की तुलना में इसमें hallucination कम है, और AMD GPU पर भी इसे आसानी से चलाया जा सकता है।
      मैंने खुद Parakeet port करके देखा, लेकिन आख़िर में फिर Whisper पर लौट आया
    • मैं भी Parakeet पर switch करने का सोच रहा हूँ।
      लेकिन मैं Polish और बहुत सारे technical terms इस्तेमाल करता हूँ, इसलिए Whisper v3 मेरे लिए बेहतर बैठता है
    • Whisper कई भाषाओं को support करता है, और tiny से turbo तक इसके कई versions हैं।
      यही इसकी ताकत है कि इसे system environment के हिसाब से tune किया जा सकता है
    • मैं भी macOS पर Parakeet को Voice Ink में इस्तेमाल करता हूँ, और घर पर Kokoro से speech-to-text चलाता हूँ।
      GrapheneOS phone पर भी Parakeet server जोड़ा हुआ है
      संबंधित पोस्ट
  • यह project मुझे बहुत पसंद आया और मैं इसे अपने workflow में integrate करना चाहता हूँ।
    लेकिन “$80M funding पाने वाली बड़ी AI lab से तुलना करते हुए इसे free में दे रहे हैं” वाली line थोड़ी खटकती है।
    यह किसी rebellious चीज़ से ज़्यादा, पहले से मौजूद research की natural extension जैसा काम है।
    इसे “spicy” कहना थोड़ा बढ़ा-चढ़ाकर कहा हुआ लगता है