- 7 frontier models में 1,008 SVG की तुलना के नतीजे में, मशहूर prompt के हिसाब से performance बढ़ाने वाले pelicanmaxxing का कोई स्पष्ट सबूत नहीं मिला
- 8 तरह के जानवरों और 6 तरह के वाहनों को मिलाकर 48 prompts बनाए गए, हर मॉडल पर उन्हें 3 बार चलाया गया, और GPT-5.6 Luna ने जानवर, वाहन और क्रिया की consistency को अलग-अलग 1~5 अंक दिए
- पेलिकन 8 जानवरों में 6वें स्थान पर रहा, bicycle 6 वाहनों में 5वें स्थान पर, और pelican-bicycle संयोजन भी कुल 48 में 42वें स्थान पर रहा
- कठिनाई को समायोजित करने वाले regression analysis में भी लैब-वार प्रभाव सांख्यिकीय रूप से महत्वपूर्ण नहीं थे, और केवल Gemini 3.5 Flash का bicycle effect ही महत्वपूर्ण दिखा, लेकिन वह भी multiple comparison correction पार नहीं कर सका
- pelican-bicycle की 21 images सभी दाईं ओर थीं, लेकिन कुल images में 60% भी उसी दिशा में थीं; इस experiment से पूरे SVG generation को मजबूत करने वाले SVGmaxxing की मौजूदगी तय नहीं की जा सकती
‘साइकिल चलाते पेलिकन’ बेंचमार्क
- Simon Willison कई वर्षों से हर बड़े LLM के रिलीज़ पर एक ही prompt आज़मा रहे हैं: “साइकिल चलाते पेलिकन का SVG बनाओ”
- मज़ाक में शुरू हुआ यह test अब एक मशहूर अनौपचारिक AI benchmark बन गया है, और नए models को पेश करने वाले Hacker News threads में भी इसके नतीजों को बहुत upvotes मिलते हैं
- benchmaxxing का मतलब है AI models को लोकप्रिय benchmarks पर ऊँचे scores पाने के लिए optimize करना
- चूँकि model performance यूज़र की पसंद को प्रभावित कर सकती है, इस बात की जाँच की गई कि कहीं लैब्स इस खास test के लिए pelicanmaxxing तो नहीं कर रही हैं
- experiment code और data processing pipeline GitHub repository में सार्वजनिक हैं
1,008 SVG बनाने वाला experiment design
- 8 तरह के जानवरों और 6 तरह के वाहनों को मिलाकर 48 prompts बनाए गए
- जानवर: pelican, flamingo, heron, otter, raccoon, antelope, whale, cat
- वाहन: bicycle, unicycle, skateboard, scooter, plane, boat
- सभी prompts में Simon Willison की मूल पंक्ति से केवल जानवर और वाहन बदले गए
- जानवरों और वाहनों का चयन किसी कड़े formal process से नहीं हुआ, लेकिन उन्हें इस तरह रखा गया कि मूल prompt से समानता और कठिनाई दोनों में विविधता रहे
- flamingo और heron, pelican से मिलते-जुलते हैं
- cat, raccoon, otter को आसान examples के रूप में चुना गया
- antelope कठिन है, और whale pelican से बहुत अलग example है
- OpenRouter के जरिए इन 7 models को test किया गया
- GPT-5.6 Terra
- Claude Sonnet 5
- Gemini 3.5 Flash
- Grok 4.5
- Qwen3.7-Max
- GLM-5.2
- DeepSeek V4 Pro
- हर prompt पर temperature 1.0 और समान reasoning effort setting के साथ 3 samples बनाए गए, जिससे कुल 1,008 SVG मिले
Rendering, evaluation और feature extraction pipeline
- generation results को तीन चरणों में process किया गया
- Rendering: SVG को PNG में बदला गया, और अगर SVG नहीं था या rendering fail हुई तो valid result मिलने तक फिर से generate किया गया
- 1,008 generation runs में 11 बार retry किया गया
- Evaluation: GPT-5.6 Luna ने जानवर, वाहन और क्रिया की consistency को अलग-अलग 1~5 अंक दिए
- जानवर और वाहन ranking में हर item के individual scores का इस्तेमाल किया गया
- जहाँ image के लिए एक single number चाहिए था, वहाँ तीनों scores के average यानी judge score का इस्तेमाल किया गया
- Feature extraction: Gemini 3.1 Flash-Lite ने पहचाने गए जानवर और वाहन, subject direction, और scene elements को दर्ज किया
- Rendering: SVG को PNG में बदला गया, और अगर SVG नहीं था या rendering fail हुई तो valid result मिलने तक फिर से generate किया गया
- मान लिया गया कि अगर किसी लैब ने इस benchmark के लिए training की है, तो pelican row, bicycle column, या pelican-bicycle cell को उसकी मूल कठिनाई से अधिक score मिलना चाहिए
Visual comparison में दिखे फर्क
- मॉडल-वार पूरी image grids की तुलना की गई, लेकिन ऐसा कोई मामला नहीं मिला जहाँ pelican-bicycle image उसी model के दूसरे results से साफ़ तौर पर बेहतर हो
- GLM-5.2 का पहला sample कुछ बेहतर लगा, लेकिन उसी batch में एक high-quality heron-skateboard image भी बनी, इसलिए इसे खास optimization का नतीजा मानना मुश्किल था
- जिन लैब्स ने अच्छी pelican-bicycle images बनाईं, वे दूसरे animal-vehicle combinations भी आम तौर पर अच्छी तरह बनाती थीं
- visual evaluation को दोहराना कठिन है और लोगों के हिसाब से judgment बदल सकती है, इसलिए quantitative analysis भी जोड़ा गया
पेलिकन और bicycle के अलग-अलग scores
- सभी models के animal scores जोड़ने पर, pelican 8 जानवरों में 6वें स्थान पर रहा
- यह cat, whale, raccoon, heron, antelope से नीचे था
- सभी 7 लैब्स ने cat, whale, raccoon को pelican से बेहतर बनाया
- संभव है कि pelican को बनाना cat से स्वाभाविक रूप से कठिन हो, इसलिए सिर्फ इस ranking से अलग training की संभावना को पूरी तरह खारिज नहीं किया जा सकता
- bicycle 6 वाहनों में नीचे से दूसरा था, और सबसे नीचे वाले plane के लगभग बराबर था
- bicycle में दो मेल खाते पहिए, दोनों axles को जोड़ने वाला frame, handlebar, seat, और pedals चाहिए होते हैं
- evaluation model ने माना कि लगभग दो-तिहाई bicycle images में इनमें से कोई न कोई हिस्सा गायब था या सही तरह से जुड़ा नहीं था
- bicycle भी skateboard जैसे सरल वाहन की तुलना में अधिक कठिन है, इसलिए अलग training होने पर भी इसकी relative ranking कम रह सकती है
‘plane’ prompt से बनी ambiguity
- “airplane” की जगह “plane” इस्तेमाल करने पर कुछ models ने इसे aircraft नहीं बल्कि geometric plane के रूप में समझा
- नतीजतन, जानवर के विमान पर सवार होने की बजाय, वह किसी समतल सतह पर खड़ा दिखा
- ऐसे cases जहाँ feature extractor कोई वाहन पहचान ही नहीं पाया, केवल plane में दिखे
- 168 plane images में 25 में कोई वाहन पहचाना नहीं गया
- बाकी 5 वाहनों में ऐसा एक भी मामला नहीं था
- plane images में 20% को vehicle score 1 या 2 मिला
- bicycle में यह 5% था
- boat, scooter, skateboard में 1~2 score वाली images नहीं थीं
संयोजन-वार ranking और कठिनाई adjustment
- pelican-bicycle combination का औसत score 48 combinations में 42वें स्थान पर था
- चूँकि हर combination की मूल कठिनाई अलग हो सकती है, 1,008 images पर fixed-effects regression analysis लगाया गया
- base formula था
score ~ lab + animal × vehicle - इसमें लैब-वार pelican, bicycle, pelican-bicycle interaction terms जोड़े गए
- robust standard errors का इस्तेमाल हुआ
- base formula था
animal × vehicleterms ने 48 combinations की अलग-अलग intrinsic difficulty को absorb किया- लैब-वार interaction terms से औसत लैब के मुकाबले benchmark-specific uplift और confidence intervals मापे गए
Regression analysis में कोई महत्वपूर्ण effect नहीं मिला
- लैब-वार pelican effect -0.11 से +0.14 points के बीच रहे और कोई भी सांख्यिकीय रूप से महत्वपूर्ण नहीं था
- सबसे छोटा p-value भी 0.25 था
- लैब-वार bicycle effect, Grok 4.5 के -0.18 points (p=0.11) से Gemini 3.5 Flash के +0.27 points (p=0.022) तक फैले थे
- 7 effects की दिशा positive और negative, दोनों में बंटी हुई थी
- p<0.05 पूरा करने वाला एकमात्र model Gemini 3.5 Flash था
- हर लैब के pelican और bicycle effects हटाने के बाद, किसी खास pelican-bicycle combination से मिलने वाला अतिरिक्त uplift भी कहीं p<0.05 तक नहीं पहुँचा
- सबसे बड़ा positive effect GLM-5.2 का +0.35 points था, लेकिन p=0.12 रहा
- यह experiment में signal के सबसे क़रीब परिणामों में था, लेकिन फिर भी chance की सीमा में रहा
- pelican effect और pelican-bicycle cell effect के सभी confidence intervals में 0 शामिल था
- 21 tests को p<0.05 पर चलाने पर, केवल संयोग से भी लगभग 1 false positive की उम्मीद होती है
21 × 0.05 ≈ 1.05, और वास्तव में महत्वपूर्ण निकला भी सिर्फ Gemini का bicycle effect- Bonferroni correction threshold
0.05/21 ≈ 0.002था, इसलिए Gemini का p=0.022 इसे पार नहीं कर सका
- confidence interval की औसत चौड़ाई लगभग ±0.6 points थी, इसलिए इससे छोटे uplift effects को इस experiment में पकड़ना मुश्किल था
दाईं ओर मुड़ी image composition
- 7 लैब्स द्वारा बनाई गई pelican-bicycle images की 21 की 21 images दाईं ओर थीं
- 48 combinations में यह एकमात्र combination था जहाँ सभी images की दिशा एक जैसी थी
- लेकिन कुल 1,008 images में 60% वैसे भी दाईं ओर थीं, इसलिए दाईं दिशा अपने-आप में सामान्य है
- वाहन-वार दाईं दिशा का अनुपात scooter 83%, bicycle 81%, skateboard 60%, plane 58%, unicycle 45%, boat 35% था
- जानवर-वार दाईं दिशा का अनुपात antelope और pelican, दोनों में 78%, heron 77%, whale 65%, flamingo 64%, otter 45%, cat 40%, raccoon 36% था
- pelican या bicycle को सामने से बनाना कठिन होने के कारण models आम तौर पर बाएँ-दाएँ side view चुनते हैं, इसलिए direction-ambiguous images भी कम थीं
- दूसरे combinations में भी direction agreement ऊँचा दिखा
- antelope-scooter और pelican-scooter में 21 में 20 images एक ही दिशा में थीं
- heron-bicycle में 21 में 19 images एक ही दिशा में थीं
- 48 combinations में से सिर्फ एक में 21 images का पूरी तरह एक ही दिशा में होना, अपने-आप में किसी खास outlier का सबूत नहीं माना जा सकता
Scene elements में memorization के निशान ढूँढना
- Gemini 3.1 Flash-Lite ने images में दिखे scene elements को free-form में निकाला, और देखा गया कि क्या कोई memorized composition बार-बार दोहराई जा रही है
- कुछ combinations में कुछ elements बार-बार दिखाई दिए
- flamingo-boat images में हर बार सूरज दिखा
- otter-plane images के 38% में scarf था
- cat-bicycle images के 38% में basket शामिल थी
- pelican-bicycle में भी कुछ elements की frequency ऊँची थी, लेकिन ऐसा कोई खास repeating pattern नहीं मिला जो इसे दूसरे animal-vehicle combinations से अलग करे
एकल evaluation model और सीमित budget
- सभी scores एक ही evaluation model GPT-5.6 Luna ने, हर image को अलग-अलग देखकर दिए
- evaluation criteria को पर्याप्त रूप से align नहीं किया गया और re-evaluation पर consistency भी नहीं जाँची गई
- अगर evaluation model images का भरोसेमंद judgment नहीं कर पाता, तो quantitative results की value कम हो जाती है
- evaluation model और participant model GPT-5.6 Terra के एक ही product family से होने की सीमा भी है
- लेकिन हर लैब ने सभी 48 combinations बनाए, इसलिए अगर evaluation model किसी खास लैब की drawing style को पसंद भी करता हो, तो पूरी grid के scores साथ में ऊपर जाएँगे
- analysis लैब के भीतर combinations के बीच फर्क की तुलना करता है, इसलिए ऐसी preference मुख्य नतीजे को नहीं बदलती
- किसी खास prompt की बजाय पूरे SVG generation या ‘वाहन पर सवार जानवर’ जैसी category को optimize करने वाला SVGmaxxing detect नहीं किया जा सकता
- क्योंकि तब सभी cells की performance साथ बढ़ेगी, और इसे सिर्फ SVG अच्छे से बनाने वाले model से अलग नहीं किया जा सकेगा
- Google/DeepMind ने ऐसी optimization सार्वजनिक रूप से की है
- पूरे experiment की लागत लगभग 80 डॉलर की API credits थी
- यह प्रति cell 3 samples, 1 evaluation model, और 7 participant models तक सीमित था
- prompt और pipeline को बार-बार सुधारने का पर्याप्त मौका नहीं मिला, इसलिए “plane” और “airplane” जैसी समस्याएँ बनी रहीं
किसी खास prompt optimization का कोई सबूत नहीं
- pelican को दूसरे जानवरों से बेहतर नहीं बनाया गया, bicycle भी दूसरे वाहनों से श्रेष्ठ नहीं था, और किसी भी लैब ने individual pelican या bicycle performance से अपेक्षित स्तर से अधिक उस combination को महत्वपूर्ण रूप से बेहतर नहीं बनाया
- GLM-5.2 ने एक खास pelican-bicycle cell में सबसे बड़ा uplift दर्ज किया, लेकिन effect छोटा था और सांख्यिकीय रूप से महत्वपूर्ण नहीं था
- 21 की 21 images का दाईं ओर होना ध्यान खींचता है, लेकिन कुल मिलाकर right-facing composition आम थी और तीन दूसरे combinations में भी 90% से अधिक agreement था
- सिर्फ किसी एक benchmark को target करने वाले pelicanmaxxing की तुलना में SVG generation को व्यापक रूप से मजबूत करने वाला SVGmaxxing अधिक संभावित लगता है, लेकिन इस experiment से यह तय नहीं किया जा सकता कि कौन-सी लैब ऐसा कर रही है
1 टिप्पणियां
Hacker News राय
मैंने खाली समय में दूसरे जानवरों और वाहनों के संयोजन भी देखे थे; मेरा सपना था कि यह सबूत मिल जाए कि कोई खास AI lab केवल साइकिल चलाते पेलिकन को ही असाधारण रूप से अच्छा बनाती है
Dylan ने 8×6 संयोजनों से 1,008 SVG बनाने की जो methodology अपनाई, वह मेरी उम्मीद से कहीं ज्यादा मजबूत है। लेकिन किसी भी model में साइकिल चलाता पेलिकन दूसरे संयोजनों की तुलना में खास तौर पर बेहतर निकला हो, ऐसा नहीं मिला
भीड़भाड़ वाले market में benchmark पास करना entry fee है, लेकिन किसी खास scene को hardcode करके आसपास की समस्याओं को बेहतर न बनाना जैसी संकीर्ण optimization ठीक नहीं है। GPU क्षेत्र में ATI cards के लिए “Quack3” benchmark याद आता है
साइकिल चलाते पेलिकन का दाईं ओर देखना स्वाभाविक है। साइकिल का drivetrain दाईं तरफ होता है, इसलिए frame से ढके बिना उसे दिखाने के लिए right side बनाया जाता है, और training data में भी यह composition reflected होने की संभावना ज्यादा है
आधार: https://www.rei.com/c/bikes
ध्यान से देखें तो जानवर की दिशा चाहे जो हो, सभी साइकिलें दाईं ओर facing हैं, और whale को छोड़कर riders के दोनों पैर भी साइकिल के दाईं तरफ रखे गए हैं। यह संकेत देता है कि साइकिल कैसे काम करती है, इसकी वास्तविक समझ काफी कम है
Simon Willison जब भी SVG पोस्ट करते थे, तो “अब तो यह पक्का training में आ गया होगा” कहकर evaluation को ignore करने वाली reactions आती थीं, लेकिन एक लेख ने logically समझाया था कि ऐसी training को पकड़ना कितना आसान हो सकता है। छोटे जानवरों के साइकिल चलाने वाले outputs का quantitative analysis देखना अच्छा लगा
https://simonwillison.net/2025/Nov/13/training-for-pelicans-...
यह result दिखाता है कि अभी वह improvement भी नहीं हुआ। उल्टा online खराब results सीखकर performance गिरने की संभावना भी है
अगर ज्यादा plausible explanation SVG optimization है, तो यहां “optimization” का मतलब क्या है, यह भी देखना होगा। SVG बेहतर बनाना अपने आप में useful skill है
इसी तरह के experiment में एक और variant जोड़ा गया। जब कोई खास पक्षी या transport medium specify नहीं किया गया, तब भी model खुद साइकिल चलाते पेलिकन को चुनता है या नहीं, यह check किया
result: https://www.modelbias.ai/pelican-on-a-bicycle-test
original data GitHub पर public है: https://github.com/dylanjcastillo/blog/tree/main/_extras/pel...
LLM से SVG बनवाना किसी human painter को coordinates की list सुनाकर painting बनवाने जैसा है—बहुत कठिन और unnatural। आजकल image generation models perfect structure वाली bicycle और realistic pelican आसानी से बना लेते हैं, लेकिन output सिर्फ raster image होता है
image को SVG paths या brush-stroke commands में तोड़कर reproduce करने वाला step missing है, और इसे ठीक से करने के लिए scene structure की असली समझ चाहिए, जिसमें AI अभी कमजोर है
LLM output को score करने का तरीका जैसे ही known हो जाता है, funding decision-makers और labs उस metric में रुचि लेकर उसे calibrate करना शुरू कर देते हैं। best case में वे SVG capability overall improve करेंगे और साथ-साथ pelican generation को भी optimize करेंगे, लेकिन एक बार metric known हो जाने के बाद इसे भरोसेमंद independent evaluation की तरह इस्तेमाल करना मुश्किल हो जाता है