Intelligence artificielle (IA) · Journal de recherche Cell AI

Un modèle de séquences honnêtement moins bon

Un modèle de langage bâti sur un mécanisme complètement différent — plus proche d’une réaction chimique qui se propage sur une surface que des mathématiques de l’attention qu’emploie tout le reste. Il fait moins bien qu’un transformeur, et sa propre page d’accueil le dit. Pas un peu moins bien : quatre ordres de grandeur sur la perplexité (PPL), la mesure standard, face au transformeur génératif pré-entraîné 2 (GPT-2) comme référence, et imprimé sur cette page plutôt qu’en note de bas de page. C’est publié comme un journal de recherche parce qu’un échec documenté vaut quelque chose, et un échec effacé rien.

LangagePython
Paramètres v1125.8M
PPL d’entraînement450 k–1,18 M
Référence GPT-2~20
ExpériencesE0–E26
Pourquoi publier ça

Une perplexité d’entraînement de 450 000 contre 20 pour GPT-2, ce n’est pas passer à côté de peu. C’est quatre ordres de grandeur, et aucune présentation n’y change rien.

La valeur, c’est l’échelle d’expériences E0–E26 avec ses échecs annotés : quelles idées d’architecture se sont effondrées, comment, et ce que disaient les diagnostics. Un résultat négatif avec une cause documentée est une contribution. Un résultat négatif effacé en silence est du travail gâché.

En clair

Ce que c’est, en une minute

Le problème

Presque toutes les IA qui traitent le langage reposent sur la même idée : laisser chaque mot regarder tous les autres mots. Ça marche. Personne ne sait quelle part vient de ce que c’est la meilleure idée disponible et quelle part de ce que c’est celle que tout le monde a essayée.

La solution

Cell AI retire cela et met autre chose à la place : deux substances chimiques qui se propagent et réagissent sur une surface, comme se forment les rayures d’un animal, avec des connexions qui changent pendant la lecture plutôt qu’après. Il a ensuite été entraîné à pleine taille et mesuré. Il est ressorti quatre ordres de grandeur moins bon que GPT-2. C’est le titre de cette page, pas une ligne en annexe.

À qui cela s’adresse

Les chercheurs qui veulent savoir ce qu’il y a au bout du chemin que personne n’a pris. Les scientifiques qui modélisent déjà le vivant, parce que le mécanisme sous-jacent est celui qui fait les motifs en chimie et les marques sur les animaux. Les enseignants, parce que la recherche publiée n’est presque que des succès, et qu’un compte rendu soigneux d’un échec est plus rare et plus utile.

On ne vous vend rien ici. Cell AI est moins bon que ce que vous avez déjà, et le dire franchement, c’est tout l’intérêt. Le reste de cette page en est la preuve : la dynamique qui tourne en direct dans votre navigateur, ce qui tient la place de l’attention, et vingt-sept expériences avec leurs échecs annotés.
Interactif

La dynamique sous l’architecture

Ceci est un système de réaction-diffusion de Gray–Scott — la même classe de dynamiques sur laquelle repose le cœur CellularPDE. Deux produits chimiques diffusent à des vitesses différentes et réagissent ; les taux d’apport et de suppression décident si vous obtenez des taches, des rayures, des cellules qui se divisent ou rien du tout. Le pari de l’architecture, c’est que ce genre de champ auto-organisé peut porter du calcul. Regardez-le et jugez vous-même de la plausibilité.

CellularPDE — cœur de réaction-diffusion

Cliquez ou faites glisser sur le champ pour injecter le produit B et perturber le motif.

Pas
0
B moyen
0.000
Activité
0.000
Régime
—

État des partitions

N = 4 partitions du champ, comme dans le cœur CellularPDE. La hauteur est l’activation moyenne de chaque partition ; la fuite λ = 0,01 les couple.

Gray–Scott avec Da=1.0, Db=0.5, laplacien à neuf points, Euler explicite. Ceci est le substrat dynamique, pas le modèle entraîné — le modèle entraîné fait 125,8 M de paramètres et ne tient pas dans un onglet de navigateur.

Un solveur Gray–Scott en direct écrit pour cette page, illustrant la classe de dynamiques dont CellularPDE est fait. L’architecture elle-même est en PyTorch.
Architecture

Ce qui remplace l’attention

Le chemin du signal de Cell AI, de l’embedding des jetons aux logits de sortie, en passant par le cœur de réaction-diffusion, la plasticité en passe avant, les étages de résonance et de réseau, avec l’écart de perplexité face à GPT-2 indiqué en dessous
faites défiler pour voir tout le schéma →
Le tableau des scores fait partie du schéma. Une image de cette architecture qui laisserait de côté l’écart de quatre ordres de grandeur serait de la publicité, pas de la documentation.
Base

CellularPDE

N = 4 partitions d’un état de dimension D = 256, fuite λ = 0,01, termes de réaction sigmoïdes — un système de réaction-diffusion discret là où se trouverait l’auto-attention.

Plasticité

MetaplasticityLayer

Apprentissage hebbien à la Bienenstock–Cooper–Munro (BCM), avec α = 0,1, β = 0,01, appliqué pendant la passe avant plutôt qu’après elle. C’est l’idée la plus audacieuse de l’architecture et la source de son problème documenté de famine de gradient.

Optimisation v3

SpectralPDE & SparseHebbian

SpectralPDE ramène la complexité de O(D²) à O(D log D). SparseHebbian compresse les mises à jour de 65 536 poids à 1 024. MultiScalePartitions fait tourner des flux rapides et lents ; AnnealedRouter utilise un ordonnancement Gumbel-Softmax.

Chemin du signal

La pile complète

Embedding cl100k_base → CellularPDE → MetaplasticityLayer → MemoryFormation → ResonanceSystem → CrystalLattice (K = 3) → couplage de Kuramoto optionnel → routage MultiModalModel → logits. L’étage de résonance couple les phases par une transformation de Fourier rapide (FFT).

L’échelle

De E0 à E26, échecs annotés

Le programme de recherche d’architecture est ici le véritable artefact. Vingt-sept expériences, chacune avec ce qui a été tenté et ce qui a mal tourné, y compris celles qui ont reculé.

ConstatRésultat
PerFreqResonanceProblèmes documentés, n’a rien donné
RoutageS’est effondré en dégénérescence de classes dans certaines configurations
E26 vs E25Régression — l’expérience la plus récente était moins bonne
ResonanceSystemContribution au gradient minime
Génération (v1)Pas de véritable échantillonnage autorégressif
v3 Cell-Fungal HarmonicSpéculatif, non intégré
Les chiffres

L’écart, dit simplement

450 k–1,18 M
Plage de perplexité d’entraînement de Cell AI v1
~20
Perplexité de référence de GPT-2
125.8M
Paramètres v1
O(D log D)
SpectralPDE, contre O(D²) auparavant
La question que le dépôt se pose : “qu’est-ce qui échoue, qu’est-ce qui marche, et peut-on combler l’écart honnêtement ?” La réponse, jusqu’ici, est que l’écart ne s’est pas comblé. C’est écrit dans le README, pas dans une note de bas de page.
À qui cela s’adresse

Une tentative de construire l’IA d’une tout autre façon

Presque toutes les IA d’aujourd’hui reposent sur la même idée de fond. Cell AI est une tentative à pleine échelle d’en suivre une autre, empruntée à la façon dont les motifs se forment dans la nature — publiée avec ses échecs intacts.

01

Chercheurs qui regardent au-delà de l’approche actuelle

Le progrès demande que quelqu’un prenne la route non empruntée et note ce qui s’est passé. C’est cette tentative, en taille réelle, avec les impasses consignées au lieu d’être discrètement abandonnées.

02

Scientifiques qui modélisent les systèmes vivants

Le mécanisme sous-jacent est celui qui produit les rayures des animaux et les motifs en chimie. Si c’est le monde dans lequel vous travaillez, le modèle parle votre langue.

03

Enseignants qui veulent un échec honnête

La recherche publiée porte massivement sur ce qui a marché. Ceci est un compte rendu soigné de quelque chose qui n’a pas marché, bien plus utile pour apprendre qu’une réussite de plus.

Vous reconnaissez votre situation ? C’est ouvert aux tests bêta dès maintenant, et ce sont les retours des gens pour qui c’est construit qui le font réellement changer. Devenir bêta-testeur →
Projets frères

Où ces idées sont allées à la place

Cell AI est la ligne de recherche qui n’a pas convergé. Ses voisines s’en sont mieux tirées : Cypha est devenue une architecture par premiers principes qui fonctionne, et le travail sur la mémoire à long contexte est devenu Unified Hash-Predictive Memory (UHPM).