- arXiv के 12,750 शोधपत्रों के पूरे मुख्य पाठ का विश्लेषण करने पर पाया गया कि नवीनतम शोधपत्रों में लगभग एक-तिहाई मशीन-लिखित जैसे लगे, और हाल की पूर्ण तिमाही में यह दर लगभग 32% थी
- 2021~2022 के शोधपत्रों को मानव-लिखित control group मानकर 0.4% false positive rate पर threshold सेट किया गया, और version 1 PDF तथा bootstrap 95% confidence interval का उपयोग किया गया
- ChatGPT के आने के बाद यह दर दो बार बढ़ी और 2026 की शुरुआत में लगभग 39% पर पहुँची; 2026 जुलाई तक पिछले 12 महीनों के आधार पर computer science 65.0% और mathematics 0.7% था
- जिन mathematics शोधपत्रों में formulas तथा theorem·proof संरचना अधिक होती है, वे detector के training distribution से अलग होने के कारण कम मापे जा सकते हैं, और वास्तविक लेखकों द्वारा उपयोग किए गए private model·prompt combinations पर इसकी performance भी आंकी नहीं जा सकती
- यह निष्कर्ष लेखक या AI-जनित हिस्से की पहचान नहीं कर सकता, और न ही हल्के editing तथा full generation में अंतर कर सकता है; इसलिए इसे किसी व्यक्ति को दोष देने के आधार के बजाय मशीन-शैली वाले लेखन के निचले अनुमान के रूप में पढ़ना चाहिए
false positive rate को आधार बनाने वाला measurement design
- “कंटेंट का N% AI है” जैसी संख्या तब तक ज्यादा उपयोगी नहीं होती जब तक यह न देखा जाए कि detector असली मानव दस्तावेज़ों को किस दर से गलत तौर पर AI बताता है
- अगर नए शोधपत्रों के 40% को मशीन-लिखित बताया जाए, लेकिन ChatGPT से पहले के 20% शोधपत्रों पर भी वही नतीजा आए, तो पहले समझाने वाली संख्या 20% false positive rate होगी
- detector को अकादमिक शैली के अनुरूप calibrate किया गया है
- 0.4% false positive rate पर यह LLM-पूर्व वास्तविक वैज्ञानिक दस्तावेज़ों के 99.6% को सामान्य रूप से pass होने देता है
- AI द्वारा लिखे गए अकादमिक दस्तावेज़ों में से 85% को detect करता है
- 2021~2022 में submit हुए शोधपत्रों को मानव-लिखित ground truth data मानकर threshold इस तरह सेट किया गया कि ठीक 0.4% ही flagged हों
- सभी परिणाम उन शोधपत्रों का अनुपात हैं जो उस threshold से ऊपर गए, जिसे design के अनुसार LLM-पूर्व दस्तावेज़ों के लिए 0.4% पर रखा गया था
- ChatGPT से पहले के वर्ष built-in control group की तरह काम करते हैं
- यदि बढ़त detector की अपनी कृत्रिम artifact होती, तो 2021~2022 भी 2026 जितना ऊँचा दिखना चाहिए था, लेकिन वास्तव में ऐसा नहीं था
sample और analysis method
- 10 field groups में 2023 जनवरी से 2026 जुलाई तक field और month के आधार पर लगभग 25-25 शोधपत्र sample किए गए, और 2021~2022 के control group के 8 महीने जोड़कर कुल 12,750 शोधपत्रों का विश्लेषण किया गया
- हर शोधपत्र का version 1 PDF इस्तेमाल किया गया ताकि 2026 में संशोधित भाषा 2023 के sample में न मिल जाए
- abstract के बजाय पूरा मुख्य पाठ विश्लेषित किया गया
- एक ही शोधपत्र में abstract में 20% से कम और main text में 70% से अधिक का मामला मिला, इसलिए केवल abstract देखने पर signal कम हो सकता है
- सभी आँकड़ों पर bootstrap पद्धति के 95% confidence interval लागू किए गए
समग्र रुझान और क्षेत्रों के बीच अंतर
- यह दर 2021~2022 के दौरान 0.4% पर बनी रही, फिर ChatGPT आने के कुछ महीनों के भीतर बढ़ने लगी
- इसके बाद दो बार उछाल आया, हाल की पूर्ण तिमाही में यह लगभग 32% रही, और 2026 की शुरुआत में लगभग 39% पर शिखर पर पहुँची
- 2026 जुलाई तक पिछले 12 महीनों के क्षेत्रवार परिणाम इस प्रकार हैं
| क्षेत्र | LLM-पूर्व control group | हालिया detection ratio | 95% confidence interval |
|---|---|---|---|
| computer science | 0.2% | 65.0% | 59.3~70.3% |
| quantitative biology | 3.5% | 56.3% | 51.0~61.7% |
| electrical engineering and systems | 1.7% | 51.3% | 46.0~57.0% |
| economics and finance | 2.5% | 47.0% | 41.3~52.7% |
| applied physics | 1.3% | 34.0% | 29.0~39.7% |
| statistics | 1.8% | 31.3% | 26.0~36.7% |
| condensed matter physics | 0.0% | 24.0% | 19.3~29.0% |
| high energy physics | 0.5% | 14.0% | 10.0~18.0% |
| astrophysics | 0.0% | 10.7% | 7.3~14.3% |
| mathematics | 0.0% | 0.7% | 0.0~1.7% |
- computer science लगभग 65% के साथ सबसे ऊपर है और mathematics लगभग 0.7% के साथ सबसे नीचे, लेकिन mathematics के निम्न आँकड़े की व्याख्या करना कठिन है
- control group वाला कॉलम हर क्षेत्र की 2021~2022 detection rate का तीन sensitivity settings पर निकाला गया औसत है
- जिन क्षेत्रों में बढ़त अधिक है और जिनमें LLM-पूर्व control group स्तर ऊँचा है, वे एक जैसे नहीं हैं; इसलिए सिर्फ ऊँचा शुरुआती स्तर बाद की बढ़त को नहीं समझा सकता
क्षेत्रवार control group की सांख्यिकीय सीमाएँ
- ChatGPT-पूर्व क्षेत्रवार control group में प्रत्येक में 200 शोधपत्र हैं
- 0.4% false positive rate पर 10 क्षेत्रों के 2,000 control शोधपत्रों में केवल 8 शोधपत्र flagged होते हैं, इसलिए single threshold पर क्षेत्रवार अनुपात मोटे तौर पर ही मापा जा सकता है
- पूरे dataset को मिलाकर false positive का lower bound पर्याप्त रूप से अनुमानित किया गया है, और शोध-डिज़ाइन भी इसी पर आधारित है, लेकिन क्षेत्रवार control group के आँकड़े केवल approximate हैं
- क्षेत्रवार 1% से कम दर को सटीक रूप से स्थिर करने के लिए हर क्षेत्र में हज़ारों control शोधपत्र चाहिए, लेकिन 2023 से पहले के arXiv में इतने शोधपत्र उपलब्ध नहीं हैं
कम scores और detection blind spots
- कम score का मतलब AI adoption कम है यह भी हो सकता है, या यह detector के blind spots को भी दिखा सकता है
- mathematics शोधपत्र formulas तथा theorem·proof संरचना पर आधारित होते हैं; formulas और references हटाने पर prose कम बचती है, और वह detector द्वारा सीखी गई scientific English से भी अलग होती है
- मॉडल की काफी मदद से लिखे गए mathematics शोधपत्र भी कम score पा सकते हैं क्योंकि उनकी prose detector के distribution से बाहर हो सकती है
- इसलिए केवल mathematics के परिणाम से कम adoption और कम detection sensitivity में फर्क करना कठिन है
- जिन क्षेत्रों में prose का अनुपात अधिक है और जो detector के training distribution से सबसे अधिक मेल खाते हैं, वहीं सबसे अधिक बढ़त दिखी; इसलिए केवल यह confounder पूरे upward trend को नहीं समझा सकता
- कम score वाले क्षेत्रों की ranking को AI adoption के lower bound के रूप में पढ़ना चाहिए
- detector की sensitivity हर generative model के अनुसार अलग होती है, और लेखक वास्तव में जिन private models और prompts के combinations का उपयोग करते हैं, उनका सटीक मूल्यांकन नहीं किया जा सकता
- अपूर्ण detection coverage detection rate को नीचे लाती है, इसलिए मापा गया अनुपात वास्तविक मशीन-शैली लेखन के lower bound हैं; generator-वार performance detector explanation में देखी जा सकती है
इस detection result से क्या नहीं जाना जा सकता
- detector ज्ञात error rates और calibrated probability के आधार पर यह अनुमान लगाता है कि कोई दस्तावेज़ मशीन-लिखित जैसा पढ़ा जाता है या नहीं
- यह हल्के रूप से edit किए गए दस्तावेज़ और पूरी तरह generated दस्तावेज़ में अंतर नहीं कर सकता, और एक single score किसी खास व्यक्ति को दोष देने का आधार नहीं हो सकता
- माप का लक्ष्य लेखक की पहचान या generation ratio नहीं, बल्कि मशीन-शैली लेखन का अनुपात है, जिसमें AI की भारी मदद से की गई editing भी शामिल है
- arXiv शोधपत्र free check page पर, और सामान्य text text check page पर देखे जा सकते हैं; detector के संचालन से कोई राजस्व नहीं कमाया जाता
1 टिप्पणियां
Hacker News की रायें
2011 में लिखे PyHPC workshop paper को 27% machine-written, और 2012 की doctoral dissertation को benchmark 42% से ठीक नीचे 40% आंका गया
अब मैं papers publish नहीं करता, लेकिन समझ नहीं आता कि मैं LLM जैसा लिखता था या LLM ने मेरी writing से सीखा। 2015 के IEEE CLUSTERS paper में तो पूरे 74% निकला
ज्यादा खतरनाक बात यह है कि जिन लोगों को इनके principles नहीं पता, वे इन्हीं के आधार पर AI use मानकर students को गंभीर नुकसान पहुंचाते हैं, और यह पहले से ही education के हर level पर हो रहा है
2021~2026 के arXiv papers के 12,750 full texts analyze करके machine-written माने जाने की दर और ChatGPT launch के बाद की बढ़ोतरी की जांच की गई
false positives से बचने के लिए detector को जानबूझकर tune किया गया था, इसलिए ChatGPT से पहले detection rate करीब 0.4% था। जनवरी 2026 में कुल papers के करीब 39%, और computer science में अधिकतम 65% तक AI-written माने गए, जबकि mathematics 0.7% से लगभग हिली नहीं, हालांकि हो सकता है कि proof-centric writing style को ठीक से capture न किया गया हो। यह सिर्फ statistical signal का estimate है, किसी specific author ने AI इस्तेमाल किया इसका evidence नहीं; और machine-written में strong AI-assisted editing भी शामिल हो सकती है
ChatGPT से पहले के documents positive training data में शामिल होने जैसी leakage भी हो सकती है
यह भी जानना है कि LLM आने से पहले भी क्या बहुत थोड़े authors LLM की तरह लिखते थे
बहुत सारे papers check करते हुए server पर overload नहीं डालना चाहता
कंपनियों में LLM use के लिए सच में game-theoretic incentives काम करते हैं
Developers Claude Code को अंधाधुंध इस्तेमाल करके दिखने में बेहतर code और documentation बड़े पैमाने पर produce करते हैं, और management को तुरंत कोई downside नहीं दिखती इसलिए वे इसे encourage करते हैं। Structural quality uncertain है, लेकिन गलत metrics में सिर्फ output volume दिखता है, इसलिए cognitive decline का risk लेना worth है या नहीं, यह तय करने में सालों लगेंगे। जो लोग पूरा दिन LLM इस्तेमाल नहीं करते, वे output volume में पीछे रहेंगे ही, और publication count को महत्व देने वाली science world में भी वही pressure काम करने की संभावना ज्यादा है
फिर भी ढेरों startups और नए assistant professors “AI” से नया क्षेत्र खोलने का दावा करते हैं, लेकिन असल में सबसे effective approach LLM से ज्यादा machine learning का use करती है
duplication minimize करने और code shrink करने का लक्ष्य देकर लगातार निर्देश दिए, लेकिन result “भले ही घटिया हो, मेरे लिए useful है” के करीब है। इस level की usefulness को ignore नहीं किया जा सकता, लेकिन overflowing toilet देखकर value maximize हो गई समझने वाली management डराती है
असली मुश्किल सवाल time/cost input के मुकाबले quality है, और फिलहाल subscription price के आधार पर opus/fable generated code काफी advantageous लगता है
नया tool अपने-आप में अच्छा है, लेकिन management metrics पूरा करने के लिए किसी specific tool का use force किया जाना पसंद नहीं है
जब इंसान AI पर depend करने लगेंगे, तो companies को laws अपने पक्ष में बदलवाने का influence मिलेगा। अगर citizens city centers में massive data centers का विरोध करें, तो companies दबाव बना सकती हैं कि उन data centers से मिलने वाले AI के बिना वे कुछ नहीं कर सकते; इसलिए इंसानों को incapable और dependent बनाना ही key हो सकता है
सिर्फ text इस्तेमाल करने वाली सभी AI detection methods की तरह accuracy चिंता की बात है
खासकर आखिर में तीन detector scores को combine करने की प्रक्रिया bias नहीं बनाती, इसका भरोसा कैसे करें, समझ नहीं आता; और source न होने से working review करना या study reproduce करना भी मुश्किल है। LLM से पहले खुद लिखी गई private research को भी high score मिला, और दूसरे paper में लगभग हर sentence लाल “machine-leaning” के रूप में mark था, फिर भी score पर असर नहीं पड़ा। वही text LaTeX formatting के होने या न होने पर काफी अलग score देता था। conclusion यह होना चाहिए कि “generated text detection मुश्किल है, और results को सिर्फ इसलिए accept नहीं करना चाहिए कि वे hypothesis confirm करते हैं।” यह comment भी अभी मैंने खुद लिखा है, फिर भी machine-written score high आता है
अकादमिक माहौल में इसी समस्या को देखने पर निष्कर्ष निकला कि सिर्फ टेक्स्ट के आधार पर AI लेखन को भरोसेमंद तरीके से पहचानना असंभव है
अगर किसी इंसान और LLM ने संयोग से बिल्कुल वही पैराग्राफ लिख दिया हो, तो उसी एक input को synthetic और human-written में अलग करने का कोई तरीका नहीं है। वास्तव में LLM-विशिष्ट निशान होते हैं, लेकिन वे समय और model के साथ बदलते रहते हैं, इसलिए synthetic जैसा दिखने वाला मानव लेखन और मानव जैसा दिखने वाला synthetic लेखन अलग नहीं किया जा सकता। अधिक रोचक तरीका यह है कि essay corpus में शब्दावली, भाषाई विशेषताएँ, style embeddings, general embeddings, typos, errors और references LLM आने के बाद कैसे बदले हैं, इसका विश्लेषण किया जाए। group level पर academic style बदला है, यह साफ है, लेकिन कारण को trace करना कठिन है
Chomsky के शब्दों में, इंसान जो लगभग हर वाक्य बोलता या समझता है, वह शब्दों का ऐसा combination होता है जो ब्रह्मांड के इतिहास में पहली बार सामने आ रहा है। बड़ी कठिनाई यह है कि LLM कोई एक fixed expression नहीं बनाता, और text की information density कम होती है, इसलिए narrow confidence interval के साथ statistical test करने के लिए काफी मात्रा में text चाहिए
अगर पढ़े जाने वाले papers में से 65% AI-written characteristics दिखाते हैं, तो सीधे AI इस्तेमाल न करने पर भी AI style का असर पड़ेगा
खासकर उन नए researchers पर इसका असर ज्यादा हो सकता है जिनकी writing style अभी बन ही रही है
किसी इंसान को AI के syntax patterns लंबे समय तक बनाए रखने हों, तो उसे ऐसे patterns समझने होंगे जिन्हें अभी कोई पूरी तरह नहीं जानता, और हर clause को painting forgery की तरह बारीकी से adjust करना होगा। साथ ही AI style भी बदलती है; जो delve कभी प्रमुख संकेत था, वह 2024 के मध्य के बाद तेजी से घटा और अब LLM outputs में लगभग गायब हो गया है। इसे देखकर सीखने वाले इंसानों का लेखन उलटे मौजूदा AI style से कम मिलता-जुलता हो जाता है
AI से पहले भी slop लिखने वाले लोग मौजूद थे
English native speaker न होने के कारण यह नतीजा आश्चर्यजनक नहीं लगता कि ज्यादातर papers AI detector में पकड़े जाते हैं
ऐसा इसलिए नहीं कि लोग LLM से पूरा paper लिखवाते हैं, बल्कि इसलिए कि वे scientific style के आदी नहीं हैं और American editors इसकी मांग करते हैं। basic sentences में ideas लिखकर LLM से उन्हें smooth कराया जा सकता है। हर paragraph खुद लिखकर उसे अधिक scientific बनवाएँ, तो content पूरी तरह अपना होने पर भी उसे LLM-generated माना जाएगा। इसके उलट, English को पर्याप्त अच्छी तरह polish कर दें तो LLM-written paper भी human writing जैसा दिख सकता है
अगर फिर से paper लिखना पड़ा तो सब कुछ हाथ से लिखने का इरादा नहीं है; अगर content intention से मेल खाता है या नहीं, यह verify कर लिया जाए और गलत हिस्से सुधार दिए जाएँ, तो समस्या नहीं है। English native speakers के लिखे papers में भी बहुत कुछ ऐसा होता है जो LLM से rewrite कराने पर काफी बेहतर हो सकता है
हर paragraph की बारीक अभिव्यक्ति इस पर बड़ा असर डालती है कि क्या और कैसे संप्रेषित होता है, इसलिए इसे पूरी तरह अपना paper कहना कठिन है। शुरुआत में ही scientific दिखने वाली style के पीछे भागने की वजह भी संदिग्ध है; सबसे अच्छे papers बिना दिखावे के बातचीत जैसे पढ़े जाते हैं। बाहरी दबाव है, यह समझ में आता है, लेकिन author के basic sentences शायद LLM sentences से बेहतर होंगे
ऐसे papers में बहुत verbose और clichéd हिस्से होते हैं, इसलिए AI ने 90% लिखा हो और असल में नया content व महत्व की explanation ही इंसान ने लिखी हो सकती है
शायद सच में यह तरीका फैल रहा हो
कुछ लोग writing artists हो सकते हैं, लेकिन ज्यादातर नहीं हैं
संभव है detector ने 2022 के बाद literature में बढ़े words और jargon को AI characteristics के रूप में सीख लिया हो
उदाहरण के लिए LLM और उन्हें इस्तेमाल करने वाले लोग LLM पर अक्सर चर्चा करते हैं, इसलिए “large language model” expression खुद AI जैसा माना जा सकता है। यह expression 2022 से पहले दुर्लभ था और आज तथा AI-generated text में बहुत आता है, लेकिन modern human writing और AI writing को अलग करने की अच्छी feature नहीं है। 2023 के बाद भी जिस control group को reasonably लगभग LLM-generated text से मुक्त माना जा सके, उसमें arXiv की तुलना में detection rate बहुत कम दिखना चाहिए। Nature और Science भी पूरी तरह मुक्त नहीं होंगे, लेकिन 2026 तक check किया जाए तो arXiv की तुलना में बहुत कम बढ़ोतरी वाली curve आनी चाहिए
detector update करते समय इसे mitigate करने के तरीके देखूँगा, लेकिन 2023 के बाद का clean dataset हासिल करना कठिन है। अगर किसी दूसरे AI detector से बनाया जाए, तो अंततः वह उस detector से बेहतर नहीं हो सकता
consensus protocols आदि पर research करने वाले कई researchers से पूछा कि वे paper writing और research में से क्या पसंद करते हैं, तो लगभग सभी ने research itself चुना
अगर उन्हें writing ज्यादा पसंद होती तो वे शायद कोई और profession चुनते। अगर LLM research charts और code आदि को paper या draft में बदल दे, तो high-quality research papers उलटे बढ़ सकते हैं, क्योंकि “research करना चाहता हूँ लेकिन paper लिखना झंझट है” वाली friction कम हो जाएगी। research ability और writing aversion को दो axes मानें, तो जिन researchers में दोनों values high हैं, उनके output को LLM सामने ला सकता है। खराब papers भी बढ़ेंगे, लेकिन long term में net effect positive होने की संभावना है