这个理论的数学基础是之前贴的那个视频,就是N维embedding空间只有N个正交基,但是如果放宽到几乎正交,则基的数量可以随维度指数增长,也就是智能存储的基础,打比方1万的维度,就可以存储几百万上千万的近乎独立方向。
最早的智能来自于视觉,或者比视觉更原始的感官输入。下面仅以视觉为例。最底层的输入是pixel,pixel之上又可以构建更高层的抽象,人的神经网络可能是类似transformer或者类似架构,当每一层往上走的时候,信息会进行压缩,比如我们看到两棵树,用数量2和树表示,比存储两棵树的pixel要更高效,所以神经网络在自我训练中会逐渐产生整数的概念,在embedding里面用一个独立方向来表示。这点人和动物都有,所以任何动物在说话之前就有某种原始的语言要素。
好了等到人类语言出来之后,语言起了什么作用呢?每个人都有自己的神经网络训练过程,可以想象同一个物种由于神经网络的架构,底层抽象是类似的,但是高层抽象则不然。大概只要是人都有整数的抽象,但是整数的加减乘除则并不是所有人都会自然产生,或者每个人产生的embedding并不一致。又或者某些人是区分7中颜色,有的人只区分五种。自然语言的作用就是起了一个规整化的作用,通过强化学习强迫人在一些基础的概念使用类似的embedding,强行规定几百个几千个基是什么,这样已便于交流和进一步发展。
也就是说语言不仅是人类的工具,而是会深深影响人脑的神经网络的权重。
语言是应用层的protocol.
底层大道,就是信息,最高效的就是光量子。 灵光, 可以罐顶,相当于信息传输。
易经总结过这些问题。 图像滞后于数字。而数字无法描述 此在dasein,即神。 排序是神数象形。1到4。
几年前我还在说:一个人只要开始认真思考“人类理解”,就离AI的前沿不远了。
现在不知道还能不能这么说。
但是那些所谓高维降低维信息表示的,都是用老旧的数学套AI,离AI的前沿更远了。
我是借用你贴里的一句话:“高维几何给出一个关键直觉:”。这个直觉是对的。
我就喜欢瞎想,没时间看书
不是直觉,是看了一个视频,有一个数学定理
Johnson-Lindenstrauss Lemma
你对这个主题有严肃的态度和兴趣。
给你推荐一本书。看了这本书,你就不需要从零开始。
Learning Deep Representations of Data Distributions
https://ma-lab-berkeley.github.io/deep- ... ning-book/
你这个近正交几何的直觉是对的。我感觉这和高维空间很稀疏类似。
llm这玩意儿就是个噱头。现在的AI真的理解文字吗?我看不见得。不过是个有用的工具,跟计算器一样。
语言的作用就是工具,就是交流工具,其它的作用都是你想象出来的。
用gpt严格化了一下
高维近正交、表征容量与语言的规范性
在一个 N 维内积空间中,严格正交的向量组的规模至多为 N。这是线性代数的基本事实:若 \(\langle v_i,v_j\rangle=0\ (i\neq j)\),则 \({v_i}\) 线性无关,故个数不超过维数。
然而,“智能的存储”并不依赖严格正交,而依赖一种更弱的、但在高维中更丰饶的结构:近正交(almost orthogonality)。形式化地说,我们考虑单位向量集合 \({u_k}_{k=1}^M\subset S^{N-1}\),满足
\(|\langle u_i,u_j\rangle|\le \delta,\quad i\neq j\)
其中 \(0<\delta<1\) 表示允许的相关性上界。此时问题变成一个球面编码(spherical code)/packing 问题:在维数 \(N\) 给定、最小夹角(或最大内积)给定时,最大可容纳点数 \(M\) 的量级如何?
高维几何给出一个关键直觉:当 \(N\) 很大时,“随机向量几乎正交”,并且可以构造出规模随 \(N\) 快速增长的近正交集合。粗略地说,在固定 \(\delta\) 下,最大 \(M\) 可以达到
\(M \approx \exp\big(c(\delta),N\big)\)
(常数 \(c(\delta)\) 与容许的相关性 \(\delta\) 有关)。这意味着:维度并不是“只能存 \(N\) 个方向”的瓶颈;相反,在允许小相关性的现实条件下,高维空间具有一种“指数级容量”。当 \(N\) 达到上万量级时,可区分的、近乎互不干扰的方向数目在直觉上确实可以达到百万甚至更高量级——前提是我们明确了 \(\delta\)(容忍的混叠程度)以及检索/判别机制的噪声模型。
哲学上,这一点重要在于:表征的多样性不是来自“更多的符号”,而是来自“几何可分性”。 概念可以不是离散原子,而是连续空间中一簇稳定可分的区域;可分性由近正交几何保证。
⸻
以视觉为例,最底层输入可视为像素强度张量 \(x\)。若仅存储 \(x\) 的细节,我们得到的是高维、冗余且脆弱的记忆:对旋转、遮挡、光照扰动非常敏感。所谓学习的核心,是构造一个映射
\(f: x \mapsto z\)
其中 \(z\) 是更低维或更结构化的表征,使得对任务相关的变量保持稳定(不变性),对任务无关的扰动压缩(丢弃)。这并非简单“压缩率越高越好”,而更像一种最小描述长度(MDL)意义下的择优:在保持可预测性/可行动性的前提下,使描述尽可能简洁。
因此,当我们看到“两棵树”,更有效的编码不是像素级复刻,而是由更高层的因子化表示构成,例如“树”这一类别表征与“数量=2”这一数量结构的组合。这里的关键并不是某个概念必然对应 embedding 中“一条独立方向”,而是:训练会推动出现一组可复用、可组合、且在语境中稳定的特征子空间。换言之,抽象的本质是把经验从“呈现”提升为“结构”:从 \(x\) 的表象统计,过渡到关于对象、关系与数量等“可推理单位”的编码。
这也解释了为什么许多动物即使没有人类语言,也可能具有前语言的概念原语:对象恒常、类别化、粗略数量感、因果线索等。这些并不等于“语言”,但它们是语言得以落脚的认知底座。
⸻
若每个个体都是一个自我训练的网络,那么每个人都拥有一个内部表征空间 \(\mathcal{Z}_p\),它由各自经验塑造。即便同属一个物种、网络结构相近,底层感知特征可能相似;但高层抽象(例如精细颜色划分、数学运算概念、伦理分类等)可以显著不同。于是出现一个哲学—技术上的难题:
我们如何在不同主体之间建立可传递、可累积的知识?
自然语言的深层功能可以理解为一种“规范化协议层”(normative protocol layer)。它并不简单是给既有概念贴标签,而是在社会互动中通过奖惩、纠错、模仿、教育等机制(可类比为社会性的强化过程)引入一套共享的离散符号系统 \(\Sigma\),并把个体内部连续表征的某些区域稳定地锚定到这些符号上:
\(g_p:\ \mathcal{Z}_p \to \Sigma\)
这里 \(g_p\) 不必是严格函数(可能受语境影响),但其社会目标是:让不同个体的 \(g_p\) 在关键概念上足够一致,从而使沟通成为可能,文化得以累积。
因此,语言在哲学意义上并非中性的“工具”,而是一种规范性力量:它通过公共规则约束私人表征,把“我如何切分世界”部分转化为“我们应该如何切分世界”。颜色词数量、数的概念、甚至因果与责任的语法结构,都在不同程度上塑造了可思之物的边界。
⸻
由此可见,因果方向不是单向的。不是“先有清晰概念—再用语言表达”;更常见的是:
1. 个体在感知—行动闭环中形成连续表征;
2. 社会语言系统施加对齐压力,使某些表征边界被强化、某些被抑制;
3. 长期训练改变网络权重,使“可说之物”更易被稳定编码与检索;
4. 进一步扩大可学习的抽象层级(数学、法则、道德、科学概念)。
因此可以得出结论:语言不仅是人类的工具,更是塑造人类心智结构的机制。 它把高维几何里的“可分方向”转化为可共享的概念坐标系,使得个体的智能从私人适应走向公共可累积的理性
图像和语言有本质区别。任意一串字母,它成语言的概率为0,但它成一幅图像。当这一串字母放在桌子上,它们的图像就有意义。
抽象出基本的逻辑概念很重要,
有了‘与或非(门电路)’就有‘自然数’,有了自然数,就有加法器,有了加法器,就有了单板机,有了单板机,就有了C语言和操作系统,有了操作系统,就有了‘变压器’,有了‘变压器’就有了大模型,有了大模型,我们就可以让他通过摄像头,通过自己观察,抽象出‘与或非’,进而发明单板机。

通过修行,有意修改神经系统,特别是植物神经系统,感觉也是可能的
对内的描述,与对外的描述相比,所成之字词也太少了。
民国年间,东土出现了一本太乙金华秘录,你查查wikipedia,以及AI,
看看其背后的故事。看下吕洞宾的所谓内丹派的语言。非常有意思。
人类奋力向外界索取的过程中,已经把关于自身的语言----也就是自身,毁的差不多了。