Модель последовательностей, которая честно хуже
Языковая модель на совсем другом механизме — ближе к химии, растекающейся по поверхности, чем к математике внимания, на которой стоит всё остальное. Она работает хуже трансформера, и её собственная первая страница это говорит. Не слегка хуже: на четыре порядка по перплексии (PPL), стандартной мере, против эталона в виде генеративного предобученного трансформера 2 (GPT-2) — и напечатано это здесь, а не в сноске. Она опубликована как исследовательский журнал, потому что задокументированная неудача чего-то стоит, а удалённая — нет.
Перплексия на обучении 450 000 против 20 у GPT-2 — это не «чуть-чуть не дотянули». Это четыре порядка, и никакая подача этого не меняет.
Ценность — в лестнице экспериментов E0–E26 с размеченными неудачами: какие архитектурные идеи развалились, как именно и что показала диагностика. Отрицательный результат с задокументированной причиной — это вклад. Отрицательный результат, тихо удалённый, — это выброшенная работа.
Что это такое за минуту
Почти весь ИИ, работающий с языком, построен на одной идее: пусть каждое слово смотрит на каждое другое. Это работает. Никто не знает, насколько это потому, что идея лучшая из доступных, и насколько потому, что её попробовали все.
Cell AI убирает это и ставит другое: два вещества, растекающиеся и реагирующие по поверхности, так же как на животном возникают полосы, причём связи меняются прямо во время чтения, а не после. Затем модель обучили в полном размере и измерили. Вышло на четыре порядка хуже GPT-2. Это заголовок этой страницы, а не строчка в приложении.
Исследователям, которые хотят знать, что лежит на дороге, по которой никто не пошёл. Учёным, которые уже моделируют живые системы, потому что механизм внизу — тот самый, что делает узоры в химии и отметины на животных. Преподавателям, потому что публикуют почти только успехи, а аккуратный разбор неудачи встречается реже и полезнее.
Динамика, лежащая под архитектурой
Это система реакции-диффузии Грея–Скотта — тот же класс динамики, на котором построено ядро CellularPDE. Два вещества диффундируют с разной скоростью и реагируют; скорости подачи и убыли решают, получатся ли пятна, полосы, делящиеся клетки или вообще ничего. Ставка этой архитектуры в том, что такое самоорганизующееся поле способно нести вычисление. Посмотрите и сами оцените, насколько это правдоподобно.
CellularPDE — ядро реакции-диффузии
Кликайте или тяните по полю, чтобы впрыснуть вещество B и возмутить картину.
Состояние разделов
N = 4 раздела поля, как в ядре CellularPDE. Высота — средняя активация каждого раздела; утечка λ = 0,01 связывает их между собой.
Грей–Скотт с Da=1.0, Db=0.5, девятиточечный лапласиан, явный Эйлер. Это динамический субстрат, а не обученная модель — в обученной 125,8 млн параметров, и она не влезает во вкладку браузера.
CellularPDE — а сама архитектура написана на PyTorch.
Что стоит вместо внимания
CellularPDE
N = 4 раздела состояния размерности D = 256, утечка λ = 0,01, сигмоидные реакционные члены — дискретная система реакции-диффузии стоит там, где было бы самовнимание.
MetaplasticityLayer
Хеббовское обучение в стиле Bienenstock–Cooper–Munro (BCM), с α = 0,1, β = 0,01, применяемое во время прямого прохода, а не после него. Это самая смелая идея архитектуры и источник её задокументированной проблемы голодания градиентов.
SpectralPDE и SparseHebbian
SpectralPDE снижает сложность с O(D²) до O(D log D). SparseHebbian сжимает обновления с 65 536 весов до 1024. MultiScalePartitions гоняет быстрый и медленный потоки; AnnealedRouter использует расписание Gumbel-Softmax.
Весь стек
эмбеддинг cl100k_base → CellularPDE → MetaplasticityLayer → MemoryFormation → ResonanceSystem → CrystalLattice (K = 3) → опциональная связь Курамото → маршрутизация MultiModalModel → логиты. Этап резонанса связывает фазы быстрым преобразованием Фурье (FFT).
От E0 до E26, неудачи размечены
Настоящий артефакт здесь — программа поиска архитектуры. Двадцать семь экспериментов, в каждом записано, что пробовали и что пошло не так, включая те, что дали откат назад.
| Находка | Итог |
|---|---|
| PerFreqResonance | Проблемы задокументированы, результата не дало |
| Маршрутизация | В некоторых конфигурациях схлопывалась в вырождение классов |
| E26 против E25 | Регресс — более поздний эксперимент оказался хуже |
| ResonanceSystem | Минимальный вклад в градиент |
| Генерация (v1) | Нет нормального авторегрессионного сэмплирования |
| v3 Cell-Fungal Harmonic | Умозрительно, не интегрировано |
Разрыв, сказанный прямо
Эксперимент: построить ИИ совершенно другим способом
Почти весь сегодняшний ИИ построен на одной и той же базовой идее. Cell AI — это полномасштабная попытка другой идеи, взятой из того, как в природе складываются узоры, — опубликованная вместе со всеми её неудачами.
Исследователи, смотрящие дальше нынешнего подхода
Прогрессу нужно, чтобы кто-то прошёл непройденной дорогой и записал, что получилось. Это и есть такая попытка, в полный рост, с записанными тупиками, а не тихо выброшенными.
Учёные, моделирующие живые системы
Механизм в основе — тот самый, что даёт полосы на животных и узоры в химии. Если вы работаете в этом мире, модель говорит на вашем языке.
Преподаватели, которым нужна честная неудача
Опубликованные исследования подавляющей частью про то, что сработало. Здесь аккуратный разбор того, что не сработало, а для обучения это куда полезнее очередной истории успеха.
Куда эти идеи ушли вместо этого
Cell AI — исследовательская линия, которая не сошлась. Её родственники вышли лучше: Cypha стала работающей архитектурой из первых принципов, а работа по памяти длинного контекста превратилась в единую хеш-предиктивную память (UHPM).