Искусственный интеллект (ИИ) · исследовательский журнал Cell AI

Модель последовательностей, которая честно хуже

Языковая модель на совсем другом механизме — ближе к химии, растекающейся по поверхности, чем к математике внимания, на которой стоит всё остальное. Она работает хуже трансформера, и её собственная первая страница это говорит. Не слегка хуже: на четыре порядка по перплексии (PPL), стандартной мере, против эталона в виде генеративного предобученного трансформера 2 (GPT-2) — и напечатано это здесь, а не в сноске. Она опубликована как исследовательский журнал, потому что задокументированная неудача чего-то стоит, а удалённая — нет.

ЯзыкPython
Параметры v1125.8M
PPL на обучении450 тыс.–1,18 млн
Эталон GPT-2~20
ЭкспериментыE0–E26
Зачем это публиковать

Перплексия на обучении 450 000 против 20 у GPT-2 — это не «чуть-чуть не дотянули». Это четыре порядка, и никакая подача этого не меняет.

Ценность — в лестнице экспериментов E0–E26 с размеченными неудачами: какие архитектурные идеи развалились, как именно и что показала диагностика. Отрицательный результат с задокументированной причиной — это вклад. Отрицательный результат, тихо удалённый, — это выброшенная работа.

Простыми словами

Что это такое за минуту

Проблема

Почти весь ИИ, работающий с языком, построен на одной идее: пусть каждое слово смотрит на каждое другое. Это работает. Никто не знает, насколько это потому, что идея лучшая из доступных, и насколько потому, что её попробовали все.

Решение

Cell AI убирает это и ставит другое: два вещества, растекающиеся и реагирующие по поверхности, так же как на животном возникают полосы, причём связи меняются прямо во время чтения, а не после. Затем модель обучили в полном размере и измерили. Вышло на четыре порядка хуже GPT-2. Это заголовок этой страницы, а не строчка в приложении.

Кому это нужно

Исследователям, которые хотят знать, что лежит на дороге, по которой никто не пошёл. Учёным, которые уже моделируют живые системы, потому что механизм внизу — тот самый, что делает узоры в химии и отметины на животных. Преподавателям, потому что публикуют почти только успехи, а аккуратный разбор неудачи встречается реже и полезнее.

Вам здесь ничего не продают. Cell AI хуже того, что у вас уже есть, и сказать это прямо — весь его смысл. Дальше на этой странице — доказательства: динамика, работающая вживую в вашем браузере, то, что стоит на месте внимания, и двадцать семь экспериментов с разобранными неудачами.
Интерактив

Динамика, лежащая под архитектурой

Это система реакции-диффузии Грея–Скотта — тот же класс динамики, на котором построено ядро CellularPDE. Два вещества диффундируют с разной скоростью и реагируют; скорости подачи и убыли решают, получатся ли пятна, полосы, делящиеся клетки или вообще ничего. Ставка этой архитектуры в том, что такое самоорганизующееся поле способно нести вычисление. Посмотрите и сами оцените, насколько это правдоподобно.

CellularPDE — ядро реакции-диффузии

Кликайте или тяните по полю, чтобы впрыснуть вещество B и возмутить картину.

Шагов
0
Среднее B
0.000
Активность
0.000
Режим
—

Состояние разделов

N = 4 раздела поля, как в ядре CellularPDE. Высота — средняя активация каждого раздела; утечка λ = 0,01 связывает их между собой.

Грей–Скотт с Da=1.0, Db=0.5, девятиточечный лапласиан, явный Эйлер. Это динамический субстрат, а не обученная модель — в обученной 125,8 млн параметров, и она не влезает во вкладку браузера.

Живой решатель Грея–Скотта, написанный для этой страницы, иллюстрирует класс динамики, из которого построен CellularPDE — а сама архитектура написана на PyTorch.
Архитектура

Что стоит вместо внимания

Путь сигнала в Cell AI от эмбеддинга токена через ядро реакции-диффузии, пластичность внутри прямого прохода, резонанс и решётку к выходным логитам, с указанным ниже разрывом в перплексии относительно GPT-2
прокрутите, чтобы увидеть всю схему →
Табло — часть схемы. Картинка этой архитектуры без разрыва в четыре порядка была бы рекламой, а не документацией.
Ядро

CellularPDE

N = 4 раздела состояния размерности D = 256, утечка λ = 0,01, сигмоидные реакционные члены — дискретная система реакции-диффузии стоит там, где было бы самовнимание.

Пластичность

MetaplasticityLayer

Хеббовское обучение в стиле Bienenstock–Cooper–Munro (BCM), с α = 0,1, β = 0,01, применяемое во время прямого прохода, а не после него. Это самая смелая идея архитектуры и источник её задокументированной проблемы голодания градиентов.

Оптимизация v3

SpectralPDE и SparseHebbian

SpectralPDE снижает сложность с O(D²) до O(D log D). SparseHebbian сжимает обновления с 65 536 весов до 1024. MultiScalePartitions гоняет быстрый и медленный потоки; AnnealedRouter использует расписание Gumbel-Softmax.

Путь сигнала

Весь стек

эмбеддинг cl100k_base → CellularPDE → MetaplasticityLayer → MemoryFormation → ResonanceSystem → CrystalLattice (K = 3) → опциональная связь Курамото → маршрутизация MultiModalModel → логиты. Этап резонанса связывает фазы быстрым преобразованием Фурье (FFT).

Лестница

От E0 до E26, неудачи размечены

Настоящий артефакт здесь — программа поиска архитектуры. Двадцать семь экспериментов, в каждом записано, что пробовали и что пошло не так, включая те, что дали откат назад.

НаходкаИтог
PerFreqResonanceПроблемы задокументированы, результата не дало
МаршрутизацияВ некоторых конфигурациях схлопывалась в вырождение классов
E26 против E25Регресс — более поздний эксперимент оказался хуже
ResonanceSystemМинимальный вклад в градиент
Генерация (v1)Нет нормального авторегрессионного сэмплирования
v3 Cell-Fungal HarmonicУмозрительно, не интегрировано
Цифры

Разрыв, сказанный прямо

450 тыс.–1,18 млн
Диапазон перплексии на обучении у Cell AI v1
~20
Эталонная перплексия GPT-2
125.8M
Параметры v1
O(D log D)
SpectralPDE, было O(D²)
Вопрос, который репозиторий задаёт сам себе: “что не работает, что работает и можем ли мы закрыть разрыв честно?” Пока ответ такой: разрыв не закрылся. Это написано в README, а не в сноске.
Кому это нужно

Эксперимент: построить ИИ совершенно другим способом

Почти весь сегодняшний ИИ построен на одной и той же базовой идее. Cell AI — это полномасштабная попытка другой идеи, взятой из того, как в природе складываются узоры, — опубликованная вместе со всеми её неудачами.

01

Исследователи, смотрящие дальше нынешнего подхода

Прогрессу нужно, чтобы кто-то прошёл непройденной дорогой и записал, что получилось. Это и есть такая попытка, в полный рост, с записанными тупиками, а не тихо выброшенными.

02

Учёные, моделирующие живые системы

Механизм в основе — тот самый, что даёт полосы на животных и узоры в химии. Если вы работаете в этом мире, модель говорит на вашем языке.

03

Преподаватели, которым нужна честная неудача

Опубликованные исследования подавляющей частью про то, что сработало. Здесь аккуратный разбор того, что не сработало, а для обучения это куда полезнее очередной истории успеха.

Узнаёте здесь свою ситуацию? Сейчас всё это открыто для бета-тестирования, и отзывы тех, для кого это делается, действительно меняют систему. Стать бета-тестировщиком →
Родственные проекты

Куда эти идеи ушли вместо этого

Cell AI — исследовательская линия, которая не сошлась. Её родственники вышли лучше: Cypha стала работающей архитектурой из первых принципов, а работа по памяти длинного контекста превратилась в единую хеш-предиктивную память (UHPM).