Inteligencia artificial (IA) · Diario de investigación de Cell AI

Un modelo de secuencia que es honestamente peor

Un modelo de lenguaje construido sobre un mecanismo completamente distinto — más cerca de la química extendiéndose por una superficie que de las matemáticas de atención que usa todo lo demás. Rinde peor que un transformer, y su propia portada lo dice. No un poco peor: cuatro órdenes de magnitud en perplejidad (PPL), la medida estándar, frente al Transformador Generativo Preentrenado 2 (GPT-2) como línea base, e impreso en esta página y no en una nota al pie. Se publica como diario de investigación porque un fracaso documentado vale algo y uno borrado no.

LenguajePython
Parámetros de v1125.8M
PPL de entrenamiento450k–1,18 M
Línea base GPT-2~20
ExperimentosE0–E26
Por qué publicar esto

Una perplejidad de entrenamiento de 450.000 frente a los 20 de GPT-2 no es quedarse cerca. Son cuatro órdenes de magnitud, y ninguna forma de contarlo cambia eso.

El valor está en la escalera de experimentos E0–E26 con sus fallos anotados: qué ideas arquitectónicas se vinieron abajo, cómo, y qué decían los diagnósticos. Un resultado negativo con una causa documentada es una aportación. Un resultado negativo borrado en silencio es tirar el trabajo.

En lenguaje llano

Qué es esto, en un minuto

El problema

Casi toda la IA que maneja lenguaje está construida sobre la misma idea: dejar que cada palabra mire a todas las demás. Funciona. Nadie sabe cuánto de eso se debe a que es la mejor idea disponible y cuánto a que es la que probó todo el mundo.

La solución

Cell AI quita eso y pone otra cosa: dos sustancias químicas que se extienden y reaccionan por una superficie, igual que se forman las rayas de un animal, con las conexiones cambiando mientras lee y no después. Luego se entrenó a tamaño completo y se midió. Salió cuatro órdenes de magnitud peor que GPT-2. Ese es el titular de esta página, no una línea en un apéndice.

Para quién es

Investigadores que quieren saber qué pasa por el camino que nadie tomó. Científicos que ya modelan sistemas vivos, porque el mecanismo de debajo es el que hace los patrones en química y las marcas de los animales. Docentes, porque la investigación publicada es casi toda éxitos, y un relato cuidadoso de un fracaso es más raro y más útil.

Aquí no se te está vendiendo nada. Cell AI es peor que lo que ya tienes, y decirlo claramente es su razón de ser. El resto de esta página son las pruebas: la dinámica funcionando en directo en tu navegador, qué hay donde estaría la atención y veintisiete experimentos con sus fracasos anotados.
Interactivo

La dinámica que hay debajo de la arquitectura

Esto es un sistema de reacción-difusión de Gray–Scott — la misma clase de dinámica sobre la que está construido el núcleo CellularPDE. Dos sustancias químicas difunden a velocidades distintas y reaccionan; las tasas de alimentación y de eliminación deciden si salen manchas, rayas, células que se dividen o nada en absoluto. La apuesta de la arquitectura es que un campo autoorganizado así puede sostener computación. Míralo y juzga tú mismo si es plausible.

CellularPDE — núcleo de reacción-difusión

Haz clic o arrastra sobre el campo para inyectar la sustancia B y perturbar el patrón.

Pasos
0
B media
0.000
Actividad
0.000
Régimen
—

Estado de las particiones

N = 4 particiones del campo, como en el núcleo CellularPDE. La altura es la activación media de cada partición; la fuga λ = 0,01 las acopla.

Gray–Scott con Da=1.0, Db=0.5, laplaciano de nueve puntos, Euler explícito. Este es el sustrato dinámico, no el modelo entrenado — el modelo entrenado tiene 125,8 M de parámetros y no cabe en una pestaña de navegador.

Un solucionador de Gray–Scott en vivo escrito para esta página, que ilustra la clase de dinámica a partir de la que CellularPDE está construido. La arquitectura en sí es PyTorch.
Arquitectura

Lo que sustituye a la atención

La ruta de señal de Cell AI desde la incrustación de tokens, pasando por el núcleo de reacción-difusión, la plasticidad en el paso hacia delante y las etapas de resonancia y retículo, hasta los logits de salida, con la brecha de perplejidad frente a GPT-2 declarada debajo
desplaza para ver el diagrama completo →
El marcador forma parte del diagrama. Una imagen de esta arquitectura que dejara fuera la brecha de cuatro órdenes de magnitud sería publicidad, no documentación.
Base

CellularPDE

N = 4 particiones de un estado de dimensión D = 256, fuga λ = 0,01, términos de reacción sigmoides — un sistema de reacción-difusión discreto puesto donde estaría la autoatención.

Plasticidad

MetaplasticityLayer

Aprendizaje hebbiano al estilo de Bienenstock–Cooper–Munro (BCM), con α = 0,1, β = 0,01, aplicado durante el paso hacia delante y no después. Esta es la idea más atrevida de la arquitectura y el origen de su documentado problema de inanición de gradiente.

Optimización v3

SpectralPDE y SparseHebbian

SpectralPDE reduce la complejidad de O(D²) a O(D log D). SparseHebbian comprime las actualizaciones de 65.536 pesos a 1.024. MultiScalePartitions ejecuta flujos rápidos y lentos; AnnealedRouter usa planificación con Gumbel-Softmax.

Ruta de señal

La pila completa

Incrustación cl100k_base → CellularPDE → MetaplasticityLayer → MemoryFormation → ResonanceSystem → CrystalLattice (K = 3) → acoplamiento Kuramoto opcional → enrutado de MultiModalModel → logits. La etapa de resonancia acopla fases con una transformada rápida de Fourier (FFT).

La escalera

De E0 a E26, con los fallos anotados

El programa de búsqueda de arquitectura es aquí el verdadero artefacto. Veintisiete experimentos, cada uno con lo que se probó y lo que salió mal, incluidos los que fueron hacia atrás.

HallazgoResultado
PerFreqResonanceProblemas documentados, no dio resultado
EnrutadoColapsó en degeneración de clases en algunas configuraciones
E26 vs E25Regresión — el experimento posterior fue peor
ResonanceSystemContribución mínima al gradiente
Generación (v1)Le falta un muestreo autorregresivo en condiciones
v3 Cell-Fungal HarmonicEspeculativo, sin integrar
Números

La brecha, dicha sin rodeos

450k–1,18 M
Banda de perplejidad de entrenamiento de Cell AI v1
~20
Perplejidad de la línea base GPT-2
125.8M
Parámetros de v1
O(D log D)
SpectralPDE, bajando desde O(D²)
La pregunta que se hace el repositorio: “¿qué falla, qué funciona, y podemos cerrar la brecha honestamente?” La respuesta hasta ahora es que la brecha no se ha cerrado. Eso está escrito en el README y no en una nota al pie.
Para quién es

Un experimento de construir IA de una forma completamente distinta

Casi toda la IA de hoy está construida sobre la misma idea de fondo. Cell AI es un intento a escala completa con otra distinta, tomada prestada de cómo se forman los patrones en la naturaleza — publicado con sus fallos intactos.

01

Investigadores que miran más allá del enfoque actual

El progreso necesita que alguien pruebe el camino que no se tomó y escriba lo que pasó. Este es ese intento, a tamaño completo, con los callejones sin salida registrados en lugar de abandonados en silencio.

02

Científicos que modelan sistemas vivos

El mecanismo que hay debajo es el que produce las rayas de los animales y los patrones en química. Si ese es el mundo en el que trabajas, el modelo habla tu idioma.

03

Docentes que quieren un fracaso honesto

La investigación publicada trata de forma abrumadora sobre cosas que funcionaron. Esto es un relato cuidadoso de algo que no funcionó, lo que es mucho más útil para aprender que otra historia de éxito.

¿Reconoces aquí tu situación? Esto está abierto a pruebas beta ahora, y las personas para las que está hecho son aquellas cuyos comentarios de verdad lo cambian. Hazte probador beta →
Proyectos hermanos

Adónde fueron estas ideas en su lugar

Cell AI es la línea de investigación que no convergió. A sus hermanos les fue mejor: Cypha se convirtió en una arquitectura funcional desde primeros principios, y el trabajo de memoria de contexto largo se convirtió en Memoria Unificada Hash-Predictiva (UHPM).