人工智能(AI)· Cell AI 研究日志

一个序列模型,它 老老实实地更差

一个建立在完全不同机制上的语言模型 — 比起别人都在用的那套注意力数学,它更接近化学物质在一个表面上扩散。它的表现比 transformer 差,它自己的首页就是这么写的。不是差一点:在标准度量困惑度(PPL)上差四个数量级,基线是生成式预训练变换器 2(GPT-2),而且这话印在本页上,不是印在脚注里。它作为研究日志发布,因为一次被记录下来的失败是有价值的,被删掉的那种没有。

语言Python
v1 参数量125.8M
训练困惑度450k–1.18M
GPT-2 基线~20
实验E0–E26
为什么要把这个发出来

450,000 的训练困惑度,对 GPT-2 的 20,这不是差一点。这是四个数量级,怎么措辞都改不了。

有价值的是那条 E0–E26 的实验阶梯,以及上面标注出来的失败:哪些架构想法垮了、怎么垮的、诊断结果说了什么。一个有记录成因的负面结果是一份贡献。一个被悄悄删掉的负面结果,是把这些工作白做了。

大白话

一分钟说清这是什么

问题所在

几乎所有处理语言的 AI 都建在同一个想法上:让每个词去看所有别的词。它管用。至于其中有多少是因为这是现有最好的想法,有多少只是因为这是大家都试了的那一个,没人知道。

解决办法

Cell AI 把那个想法拿掉,换上另一个:两种化学物质在一个表面上扩散并反应,就像动物身上长出条纹那样,而且连接是在它读的过程中改变,不是读完之后。然后它按完整规模训练并做了测量。结果比 GPT-2 差四个数量级。这是本页的头条,不是附录里的一行。

这是给谁用的

想知道没人走的那条路尽头是什么的研究者。已经在给生命系统建模的科学家,因为底下这套机制,正是在化学里造出花纹、在动物身上造出斑纹的那一套。还有教师,因为发表出来的研究几乎全是成功,而一份认真写下的失败记录更少见,也更有用。

这里没有任何东西在卖给你。 Cell AI 比你手上已经有的东西更差,而把这话直说出来就是它的意义所在。本页余下的部分是证据:在你浏览器里实时跑的动力学、在注意力本该在的位置上站着的是什么,以及二十七个实验,失败之处都做了标注。
交互演示

架构底下的那套动力学

这是一个 Gray–Scott 反应扩散系统 — 和 CellularPDE 核心所建立在其上的是同一类动力学。两种化学物质以不同的速率扩散并发生反应;投料率和消耗率决定你得到的是斑点、条纹、分裂的细胞,还是什么都没有。这个架构押的注是:这种自组织的场能够承载计算。看着它,自己判断这有多可信。

CellularPDE — 反应扩散核心

在场上点击或拖动,可以注入化学物质 B,扰动这个图案。

步数
0
B 的均值
0.000
活跃度
0.000
所处区间
—

分区状态

把这个场分成 N = 4 个分区,和 CellularPDE 核心里一样。高度是每个分区的平均激活;泄漏 λ = 0.01 把它们耦合在一起。

Gray–Scott,Da=1.0, Db=0.5,九点拉普拉斯算子,显式欧拉法。这是动力学基底,不是训练好的模型 — 训练好的模型有 125.8M 个参数,塞不进一个浏览器标签页。

为这个页面写的实时 Gray–Scott 求解器,用来展示 CellularPDE 所建立在其上的那一类动力学。架构本身是 PyTorch。
架构

拿什么取代注意力

Cell AI 的信号通路,从 token 嵌入经过反应扩散核心、前向传播内的可塑性、共振和晶格阶段,直到输出 logits,下面写着它与 GPT-2 之间的困惑度差距
滑动查看完整示意图 →
记分牌是这张图的一部分。 一张略掉那四个数量级差距的架构图,那是广告,不是文档。
核心

CellularPDE

把 D = 256 维的状态分成 N = 4 个分区,泄漏 λ = 0.01,反应项用 sigmoid — 一个离散的反应扩散系统,站在本该是自注意力的位置上。

可塑性

MetaplasticityLayer

Bienenstock–Cooper–Munro(BCM)式的赫布学习,α = 0.1,β = 0.01,作用在前向传播 过程中 ,而不是在它之后。这是这个架构里最大胆的想法,也是它那个被记录在案的梯度饥饿问题的来源。

v3 优化

SpectralPDE & SparseHebbian

SpectralPDE 把复杂度从 O(D²) 降到 O(D log D)。SparseHebbian 把更新从 65,536 个权重压到 1,024 个。MultiScalePartitions 跑快慢两条流;AnnealedRouter 用的是 Gumbel-Softmax 调度。

信号通路

完整的栈

cl100k_base 嵌入 → CellularPDE → MetaplasticityLayer → MemoryFormation → ResonanceSystem → CrystalLattice(K = 3)→ 可选的 Kuramoto 耦合 → MultiModalModel 路由 → logits。共振这一级用快速傅里叶变换(FFT)耦合相位。

阶梯

E0 到 E26,失败都标注出来

这里真正的产物是那套架构搜索方案。二十七个实验,每个都写了试了什么、出了什么问题,包括那些越做越差的。

发现结果
PerFreqResonance问题有记录,没做出效果
路由在某些配置下塌成了类别退化
E26 对 E25回退 — 后做的那个实验更差
ResonanceSystem梯度贡献极小
生成(v1)缺少像样的自回归采样
v3 Cell-Fungal Harmonic属于推测,未整合
数字

那个差距,直说

450k–1.18M
Cell AI v1 训练困惑度区间
~20
GPT-2 基线困惑度
125.8M
v1 参数量
O(D log D)
SpectralPDE,从 O(D²) 降下来
这个仓库问自己的问题是: “什么失败了,什么管用,以及我们能不能老老实实地把差距补上?”到目前为止的答案是:差距没有补上。这句话写在 README 里,不是写在脚注里。
这是给谁用的

一次用完全不同的方式造 AI 的实验

今天几乎每一个 AI 都建立在同一个底层想法上。Cell AI 是对另一个想法的一次完整规模的尝试,这个想法借自自然界里图案是怎么形成的 — 发布时失败的部分原样保留。

01

把目光越过当前路线的研究者

进步需要有人去走那条没人走的路,然后把发生了什么写下来。这就是那次尝试,是完整规模的,而且那些死胡同是被记录下来的,不是被悄悄丢掉的。

02

为生命系统建模的科学家

底下那套机制,正是在动物身上产生条纹、在化学里产生图案的那一套。如果那就是你工作的世界,这个模型说的是你的语言。

03

想要一个诚实失败案例的教师

发表出来的研究绝大多数讲的是成功了的事。这是一份关于没成功的事的细致记录,对学习来说,这比再来一个成功故事有用得多。

在这里看到你自己的情况了吗? 它现在已经开放测试,而它是为哪些人做的,那些人的反馈才是真正会改变它的。 成为测试用户 →
姊妹项目

这些想法后来去了哪里

Cell AI 是那条没有收敛的研究线。它的兄弟项目走得更好:Cypha 成了一套能用的第一性原理架构,长上下文记忆那部分工作则成了统一哈希预测记忆(UHPM)。