এমন একটি সিকোয়েন্স মডেল, যা সৎভাবেই খারাপ
সম্পূর্ণ ভিন্ন একটি কলকব্জার উপরে গড়া একটি ভাষা-মডেল — বাকি সবাই যে মনোযোগের গণিত ব্যবহার করে তার চেয়ে বরং একটি তলের উপরে ছড়িয়ে পড়া রসায়নের কাছাকাছি। এটি ট্রান্সফর্মারের চেয়ে খারাপ ফল দেয়, আর তার নিজের প্রথম পাতাই তা বলে। সামান্য খারাপ নয়: আদর্শ মাপকাঠি পারপ্লেক্সিটিতে (PPL) দশের চার ঘাতের তফাত, ভিত্তিমান হিসেবে জেনারেটিভ প্রি-ট্রেইনড ট্রান্সফর্মার 2-এর (GPT-2) বিপরীতে — আর তা ছাপা আছে পাদটীকায় নয়, এই পাতাতেই। এটি গবেষণার দিনলিপি হিসেবে প্রকাশিত, কারণ নথিভুক্ত ব্যর্থতার দাম আছে, মুছে ফেলা ব্যর্থতার নেই।
GPT-2-র ২০-এর বিপরীতে ৪,৫০,০০০ প্রশিক্ষণ-পারপ্লেক্সিটি অল্পের জন্য ফসকে যাওয়া নয়। এটি দশের চার ঘাতের তফাত, আর কীভাবে উপস্থাপন করা হলো তাতে সেটা বদলায় না।
আসল মূল্য হলো E0–E26 পরীক্ষার সিঁড়ি, তার ব্যর্থতাগুলি টুকে রাখা অবস্থায়: কোন কোন স্থাপত্য-ভাবনা ভেঙে পড়ল, কীভাবে, আর ডায়াগনস্টিক কী বলল। কারণ নথিভুক্ত করা একটি নেতিবাচক ফল একটি অবদান। চুপচাপ মুছে ফেলা নেতিবাচক ফল কাজটারই অপচয়।
এটি কী, এক মিনিটে
ভাষা সামলায় এমন প্রায় প্রতিটি AI একই ভাবনার উপরে গড়া: প্রতিটি শব্দকে বাকি প্রতিটি শব্দের দিকে তাকাতে দাও। এটা কাজ করে। এর কতটা এই কারণে যে এটিই সেরা ভাবনা আর কতটা এই কারণে যে সবাই এটাই চেষ্টা করেছে, তা কেউ জানে না।
Cell AI সেটা তুলে নিয়ে অন্য কিছু বসায়: একটি তলের উপরে দুটি রাসায়নিক ছড়াচ্ছে আর বিক্রিয়া করছে, ঠিক যেভাবে কোনো প্রাণীর গায়ে ডোরা তৈরি হয়, আর পড়ার পরে নয়, পড়ার সময়েই সংযোগগুলি বদলাচ্ছে। তারপর একে পুরো মাপে প্রশিক্ষণ দিয়ে মেপে দেখা হয়েছে। ফল দাঁড়াল GPT-2-র চেয়ে দশের চার ঘাত খারাপ। এটাই এই পাতার শিরোনাম, পরিশিষ্টের কোনো লাইন নয়।
যেসব গবেষক জানতে চান কেউ যে পথে যায়নি সেই পথের শেষে কী আছে। যেসব বিজ্ঞানী আগে থেকেই জীবন্ত ব্যবস্থার মডেল গড়েন, কারণ নিচের কলকব্জাটিই রসায়নে নকশা আর প্রাণীর গায়ে দাগ তৈরি করে। শিক্ষকেরা, কারণ প্রকাশিত গবেষণা প্রায় পুরোটাই সাফল্যের, আর ব্যর্থতার একটি যত্নে লেখা বিবরণ দুর্লভ ও বেশি কাজের।
স্থাপত্যের নিচে থাকা গতিবিদ্যা
এটি একটি Gray–Scott বিক্রিয়া-ব্যাপন ব্যবস্থা — CellularPDE কোর যে শ্রেণির গতিবিদ্যার উপরে গড়া, সেই একই শ্রেণি। দুটি রাসায়নিক আলাদা হারে ছড়ায় আর বিক্রিয়া করে; ফিড আর কিল হার ঠিক করে দেয় আপনি ফোঁটা পাবেন, ডোরা পাবেন, ভাগ হতে থাকা কোষ পাবেন, নাকি কিছুই পাবেন না। স্থাপত্যের বাজি হলো, এই ধরনের স্বয়ংসংগঠিত ক্ষেত্র গণনা বইতে পারে। দেখুন, আর কতটা বিশ্বাসযোগ্য তা নিজেই বিচার করুন।
CellularPDE — বিক্রিয়া-ব্যাপন কোর
রাসায়নিক B ঢেলে ধরনটা নাড়িয়ে দিতে ক্ষেত্রের উপরে ক্লিক করুন বা টেনে নিন।
বিভাজনের অবস্থা
ক্ষেত্রের N = ৪টি বিভাজন, CellularPDE কোরের মতোই। উচ্চতা হলো প্রতিটি বিভাজনের গড় সক্রিয়তা; ক্ষরণ λ = ০.০১ তাদের জুড়ে রাখে।
Gray–Scott, যেখানে Da=1.0, Db=0.5, নয়-বিন্দুর ল্যাপ্লাসীয়, সুস্পষ্ট অয়লার। এটি গতিবিদ্যার ভিত্তি, প্রশিক্ষিত মডেল নয় — প্রশিক্ষিত মডেলটি ১২.৫৮ কোটি প্যারামিটারের, আর সেটি ব্রাউজারের একটা ট্যাবে আঁটে না।
CellularPDE গড়া হয়েছে। স্থাপত্যটি নিজে PyTorch-এ।
মনোযোগের জায়গায় কী বসে
CellularPDE
D = ২৫৬ মাত্রার অবস্থার N = ৪টি বিভাজন, ক্ষরণ λ = ০.০১, সিগময়েড বিক্রিয়া-পদ — স্ব-মনোযোগ যেখানে থাকত সেখানে দাঁড়ানো একটি বিচ্ছিন্ন বিক্রিয়া-ব্যাপন ব্যবস্থা।
MetaplasticityLayer
Bienenstock–Cooper–Munro (BCM) ধাঁচের হেবীয় শিখন, α = ০.১, β = ০.০১ সহ, প্রয়োগ হয় সম্মুখ চলনের চলাকালীন সময়েই, তার পরে নয়। এটিই এই স্থাপত্যের সবচেয়ে সাহসী ভাবনা, আর এর নথিভুক্ত গ্রেডিয়েন্ট-অনাহারের সমস্যার উৎসও এটাই।
SpectralPDE ও SparseHebbian
SpectralPDE জটিলতা O(D²) থেকে নামিয়ে O(D log D) করে। SparseHebbian হালনাগাদ ৬৫,৫৩৬টি ওজন থেকে চেপে ১,০২৪-এ আনে। MultiScalePartitions দ্রুত ও ধীর ধারা চালায়; AnnealedRouter Gumbel-Softmax সময়সূচি ব্যবহার করে।
পুরো স্ট্যাক
cl100k_base এমবেডিং → CellularPDE → MetaplasticityLayer → MemoryFormation → ResonanceSystem → CrystalLattice (K = ৩) → ঐচ্ছিক Kuramoto কাপলিং → MultiModalModel রাউটিং → লজিট। অনুরণন ধাপটি দশাগুলিকে জোড়ে একটি ফাস্ট ফুরিয়ে ট্রান্সফর্ম (FFT) দিয়ে।
E0 থেকে E26, ব্যর্থতাগুলি টুকে রাখা
স্থাপত্য-অনুসন্ধানের কর্মসূচিটাই এখানে আসল নিদর্শন। সাতাশটি পরীক্ষা, প্রতিটিতে কী চেষ্টা করা হয়েছিল আর কী ভুল হলো তা লেখা, যেগুলি পিছিয়ে গিয়েছিল সেগুলিসহ।
| যা পাওয়া গেল | পরিণতি |
|---|---|
| PerFreqResonance | সমস্যা নথিভুক্ত, ফল দেয়নি |
| রাউটিং | কিছু বিন্যাসে শ্রেণি-অবক্ষয়ে ভেঙে পড়েছে |
| E26 বনাম E25 | রিগ্রেশন — পরের পরীক্ষাটি আরও খারাপ ছিল |
| ResonanceSystem | গ্রেডিয়েন্টে অবদান নামমাত্র |
| উৎপাদন (v1) | ঠিকঠাক অটোরিগ্রেসিভ নমুনায়ন নেই |
| v3 Cell-Fungal Harmonic | অনুমাননির্ভর, জোড়া হয়নি |
ব্যবধানটা, সোজা কথায়
একেবারে অন্যভাবে AI গড়ার একটি পরীক্ষা
আজকের প্রায় প্রতিটি AI একই মূল ভাবনার উপরে গড়া। Cell AI অন্য একটি ভাবনার উপরে পূর্ণ মাপের একটি চেষ্টা, যা ধার করা হয়েছে প্রকৃতিতে ধরন কীভাবে তৈরি হয় তার থেকে — ব্যর্থতাগুলি অক্ষত রেখেই প্রকাশিত।
বর্তমান পথের বাইরে তাকানো গবেষক
অগ্রগতির জন্য দরকার কারও না-নেওয়া রাস্তাটা ধরা আর কী ঘটল তা লিখে রাখা। এটি সেই চেষ্টাই, পূর্ণ মাপে, যেখানে অচল পথগুলি চুপচাপ ফেলে না দিয়ে লিখে রাখা হয়েছে।
জীবন্ত ব্যবস্থার মডেল গড়া বিজ্ঞানী
নিচের কলকব্জাটাই সেই জিনিস, যা প্রাণীর গায়ে ডোরা আর রসায়নে ধরন তৈরি করে। আপনি যদি সেই জগতেই কাজ করেন, মডেলটি আপনার ভাষাতেই কথা বলে।
যে শিক্ষকেরা একটি সৎ ব্যর্থতা চান
প্রকাশিত গবেষণা বেশিরভাগই যা কাজ করেছে তা নিয়ে। এটি এমন কিছুর যত্নে লেখা বিবরণ যা কাজ করেনি, আর শেখার জন্য সেটি আরেকটা সাফল্যের গল্পের চেয়ে অনেক বেশি কাজের।
এই ভাবনাগুলি বরং কোথায় গেল
Cell AI সেই গবেষণার ধারা যা অভিসারী হয়নি। এর সহোদরেরা ভালো করেছে: Cypha হয়ে উঠেছে মৌলিক নীতি থেকে গড়া একটি চালু স্থাপত্য, আর দীর্ঘ-প্রেক্ষাপটের স্মৃতি নিয়ে কাজটি হয়েছে ইউনিফায়েড হ্যাশ-প্রেডিক্টিভ মেমরি (UHPM)।