4 पॉइंट द्वारा dlwogjs311 7 시간 전 | 1 टिप्पणियां | WhatsApp पर शेयर करें

यह एक भर्ती और कंपनी जानकारी सेवा है जिसे मैं अकेले side project के तौर पर बना रहा हूँ.

जब हम नौकरी की पोस्टिंग देखते हैं, तो असल में जानना चाहते हैं कि "इस कंपनी में कितने कर्मचारी हैं, average salary और financials कैसे हैं", लेकिन यह जानकारी पोस्टिंग में नहीं होती. इसलिए मेरा लक्ष्य है कि पोस्टिंग के साथ कंपनी का वास्तविक डेटा अपने-आप match करके एक ही स्क्रीन पर दिखाया जाए.

ओवरव्यू

  • 8 channels की job postings का integration: Wanted·Saramin·JobKorea·Jumpit·Rallit·Programmers·Careerly·Remember (developer roles का अनुपात ज्यादा है)
  • हर पोस्टिंग में कंपनी के कर्मचारियों की संख्या, average salary, financials, government certifications, tech stack/role जोड़कर दिखाना
  • stack, role और company size के हिसाब से hiring trends की time series
  • बिना login के देख सकते हैं

हालिया updates

  • कर्मचारियों की संख्या और average salary coverage काफी बढ़ाई: National Pension disclosure data को company name normalization के बाद local matching + API supplementation से जोड़ा जाता है. legal entity naming (㈜, joint-stock company, brackets में service name) की वजह से जो कंपनियां पकड़ में नहीं आ रही थीं, उनमें से काफी को normalization/core-name matching से recover किया गया.
  • job posting body structuring: अलग-अलग sources में अलग-अलग format (plain text/images) वाली postings को LLM से job duties, qualifications, preferred qualifications और benefits जैसे 5 sections में normalize किया. image-based postings को OCR से text में बदलने के बाद structure किया जाता है.
  • cross-posting duplicates हटाना: एक ही job अगर कई platforms पर posted है, तो company और title के आधार पर clustering करके representative 1 item में merge किया जाता है (English↔Korean company name aliases सहित).
  • government-certified company filter: venture, Innobiz, Mainbiz और government R&D performing companies को match करके badges/filters दिए जाते हैं.
  • financial metrics: equity ratio, ROE, debt ratio + साल-दर-साल performance और कर्मचारियों के joining/leaving trends के graphs.
  • freshness: हर 2 घंटे में नई postings reflect होती हैं, closed postings अपने-आप deactivate हो जाती हैं. data regression (coverage में तेज गिरावट, duplicate removal failure) को automatically detect करने के लिए sanity checks भी जोड़े हैं.

डेटा sources
postings हर channel से, और company information National Pension (employee count/salary), DART (financials), और government certification public data (odcloud API) को मिलाकर ली जाती है. update cycles सबकी अलग हैं (postings=day/2 hours, pension=monthly, DART=yearly), इसलिए इन्हें अलग-अलग schedules पर collect किया जाता है.

मैं इसे अकेले बना रहा हूँ, इसलिए कमियां बहुत होंगी. इस्तेमाल करके feedback देंगे तो मैं उसे शामिल करूँगा (site के नीचे 'Issues and inquiries' → GitHub issue के रूप में register होता है)

1 टिप्पणियां

 
baeba 6 시간 전

ओह.. धन्यवाद। आप बहुत नेक इंसान हैं.. इससे बहुत लोगों को मदद मिलेगी। आपने बहुत मेहनत की।