एक अनुक्रम मॉडल, जो ईमानदारी से कहें तो ख़राब है
एक भाषा मॉडल, जो बिल्कुल अलग तंत्र पर बना है — बाक़ी सब जिस अटेंशन के गणित पर चलते हैं, उससे कहीं ज़्यादा यह किसी सतह पर फैलते रसायन जैसा है। यह किसी ट्रांसफ़ॉर्मर से ख़राब चलता है, और यह उसका अपना मुखपृष्ठ ख़ुद कहता है। थोड़ा-सा ख़राब नहीं: मानक माप पर्प्लेक्सिटी (PPL) पर परिमाण के चार क्रम ख़राब, आधार-रेखा के तौर पर जनरेटिव पूर्व-प्रशिक्षित ट्रांसफ़ॉर्मर 2 (GPT-2) के मुक़ाबले, और यह किसी फ़ुटनोट में नहीं, इसी पृष्ठ पर छपा है। इसे अनुसंधान लॉग के रूप में छापा गया है, क्योंकि दर्ज की गई नाकामी की कोई क़ीमत होती है, मिटा दी गई की नहीं।
GPT-2 के 20 के मुक़ाबले 4,50,000 की प्रशिक्षण पर्प्लेक्सिटी कोई मामूली चूक नहीं है। यह परिमाण के चार क्रम का फ़र्क़ है, और उसे कैसे भी पेश किया जाए, वह बदलता नहीं।
असली क़ीमत E0–E26 की प्रयोग-सीढ़ी की है, जिसकी नाकामियाँ लिखी हुई हैं: कौन-से संरचनात्मक विचार ढह गए, कैसे, और निदान ने क्या कहा। जिस नकारात्मक नतीजे की वजह दर्ज हो, वह एक योगदान है। जो नकारात्मक नतीजा चुपचाप मिटा दिया जाए, वह की गई मेहनत की बर्बादी है।
यह क्या है, एक मिनट में
भाषा सँभालने वाला लगभग हर AI एक ही विचार पर बना है: हर शब्द को हर दूसरे शब्द को देखने दो। यह काम करता है। यह कोई नहीं जानता कि इसमें कितना इसलिए है कि यह उपलब्ध सबसे अच्छा विचार है, और कितना इसलिए कि यही वह विचार है जिसे सबने आज़माया।
Cell AI उसे निकालकर उसकी जगह कुछ और रख देता है: किसी सतह पर फैलते और आपस में क्रिया करते दो रसायन, जैसे किसी जानवर पर धारियाँ बनती हैं, और जुड़ाव पढ़ने के बाद नहीं, पढ़ते-पढ़ते बदलते रहते हैं। फिर इसे पूरे आकार में प्रशिक्षित किया गया और नापा गया। यह GPT-2 से परिमाण के चार क्रम ख़राब निकला। यही इस पृष्ठ की सुर्ख़ी है, किसी परिशिष्ट की एक पंक्ति नहीं।
वे शोधकर्ता जो जानना चाहते हैं कि जिस रास्ते पर कोई नहीं गया, उस पर होता क्या है। वे वैज्ञानिक जो पहले से जीवित तंत्रों के मॉडल बनाते हैं, क्योंकि नीचे का तंत्र वही है जो रसायन में पैटर्न और जानवरों पर निशान बनाता है। शिक्षक, क्योंकि छपा हुआ अनुसंधान लगभग पूरा सफलताओं का ही होता है, और किसी नाकामी का सावधान ब्यौरा दुर्लभ भी है और ज़्यादा काम का भी।
संरचना के नीचे की गतिकी
यह एक Gray–Scott अभिक्रिया-विसरण तंत्र है — उसी वर्ग की गतिकी, जिस पर CellularPDE का मूल बना है। दो रसायन अलग-अलग दरों से फैलते हैं और आपस में अभिक्रिया करते हैं; फ़ीड और किल की दरें तय करती हैं कि आपको धब्बे मिलेंगे, धारियाँ, बँटती हुई कोशिकाएँ, या कुछ भी नहीं। इस संरचना का दाँव यह है कि इस तरह का स्वयं-संगठित क्षेत्र गणना ढो सकता है। इसे चलते देखिए और ख़ुद तय कीजिए कि यह कितना मुमकिन लगता है।
CellularPDE — अभिक्रिया-विसरण मूल
रसायन B डालने और पैटर्न को छेड़ने के लिए क्षेत्र पर क्लिक कीजिए या घसीटिए।
विभाजन की अवस्था
क्षेत्र के N = 4 विभाजन, ठीक जैसे CellularPDE के मूल में हैं। ऊँचाई हर विभाजन का औसत सक्रियण है; रिसाव λ = 0.01 उन्हें आपस में जोड़ता है।
Gray–Scott, जिसमें Da=1.0, Db=0.5, नौ-बिंदु लाप्लासियन, स्पष्ट Euler। यह गतिकीय आधार है, प्रशिक्षित मॉडल नहीं — प्रशिक्षित मॉडल 125.8M पैरामीटर का है और किसी ब्राउज़र टैब में नहीं समाता।
CellularPDE बना है। संरचना ख़ुद PyTorch में है।
अटेंशन की जगह क्या आता है
CellularPDE
D = 256-विमीय अवस्था के N = 4 विभाजन, रिसाव λ = 0.01, सिग्मॉइड अभिक्रिया पद — यानी एक विविक्त अभिक्रिया-विसरण तंत्र, वहीं खड़ा जहाँ सेल्फ़-अटेंशन होता।
MetaplasticityLayer
Bienenstock–Cooper–Munro (BCM) शैली की हेब्बियन सीख, α = 0.1, β = 0.01 के साथ, जो फ़ॉरवर्ड पास के दौरान लगाया जाता है, उसके बाद नहीं। यह इस संरचना का सबसे साहसी विचार है और उसकी दर्ज ग्रेडिएंट-भुखमरी वाली समस्या की जड़ भी।
SpectralPDE & SparseHebbian
SpectralPDE जटिलता को O(D²) से घटाकर O(D log D) कर देता है। SparseHebbian अद्यतन को 65,536 वेट से घटाकर 1,024 कर देता है। MultiScalePartitions तेज़ और धीमी धाराएँ चलाता है; AnnealedRouter Gumbel-Softmax शेड्यूलिंग इस्तेमाल करता है।
पूरा स्टैक
cl100k_base एम्बेडिंग → CellularPDE → MetaplasticityLayer → MemoryFormation → ResonanceSystem → CrystalLattice (K = 3) → वैकल्पिक Kuramoto युग्मन → MultiModalModel रूटिंग → logits। अनुनाद चरण द्रुत फ़ूरिये रूपांतर (FFT) से कलाओं को युग्मित करता है।
E0 से E26 तक, नाकामियाँ लिखी हुई
असली चीज़ यहाँ संरचना-खोज का कार्यक्रम है। सत्ताईस प्रयोग, हर एक के साथ यह दर्ज कि क्या आज़माया गया और क्या ग़लत हुआ, उन प्रयोगों समेत जो उलटे पड़ गए।
| निष्कर्ष | नतीजा |
|---|---|
| PerFreqResonance | दर्ज दिक़्क़तें, नतीजा नहीं दिया |
| रूटिंग | कुछ विन्यासों में ढहकर क्लास डीजेनरेसी में बदल गया |
| E26 बनाम E25 | पीछे खिसका — बाद वाला प्रयोग ज़्यादा ख़राब था |
| ResonanceSystem | ग्रेडिएंट में बेहद कम योगदान |
| जनरेशन (v1) | ढंग का स्वप्रतिगामी नमूनाकरण नहीं है |
| v3 Cell-Fungal Harmonic | अटकल भर, जोड़ा नहीं गया |
फ़ासला, साफ़-साफ़
AI को बिलकुल अलग तरीक़े से बनाने का एक प्रयोग
आज लगभग हर AI एक ही बुनियादी विचार पर बना है। Cell AI एक दूसरे विचार को पूरे पैमाने पर आज़माने की कोशिश है, जो इस बात से उधार लिया गया है कि प्रकृति में पैटर्न कैसे बनते हैं — और उसे उसकी नाकामियों समेत प्रकाशित किया गया है।
मौजूदा तरीक़े से आगे देखने वाले शोधकर्ता
आगे बढ़ने के लिए किसी को वह रास्ता आज़माना होता है जो नहीं लिया गया, और फिर लिखना होता है कि क्या हुआ। यह वही कोशिश है, पूरे आकार में, और इसमें बंद गलियाँ चुपचाप छोड़ी नहीं, दर्ज की गई हैं।
जीवित तंत्रों का मॉडल बनाने वाले वैज्ञानिक
नीचे का तंत्र वही है जो जानवरों पर धारियाँ और रसायन शास्त्र में पैटर्न बनाता है। अगर आपकी दुनिया यही है, तो यह मॉडल आपकी भाषा बोलता है।
वे शिक्षक जिन्हें एक ईमानदार नाकामी चाहिए
प्रकाशित शोध का बड़ा हिस्सा उन्हीं चीज़ों के बारे में होता है जो काम कर गईं। यह उस चीज़ का सावधान ब्यौरा है जो काम नहीं आई, और सीखने के लिए यह एक और कामयाबी की कहानी से कहीं ज़्यादा काम का है।
ये विचार इसके बजाय कहाँ गए
Cell AI वह अनुसंधान-रेखा है जो अभिसरित नहीं हुई। उसके भाई-बंद बेहतर निकले: Cypha मूल सिद्धांतों पर चलती-फिरती संरचना बन गया, और लंबे संदर्भ की स्मृति वाला काम एकीकृत हैश-पूर्वानुमानी स्मृति (UHPM) बन गया।