作者 博主 chatgpt
AI开始解决长期开放的数学问题,无疑值得肯定。把巨大的计算资源用于数学研究,本身也是非常有价值的方向。但评价的重点不应只是最终证明是否正确,还应该包括:这种发现能力能否被重复、能否被第三方验证?
生成式AI带有随机性。传统计算数学中,一个算法不能因为某次得到了正确答案,就被认为可靠;需要说明在什么条件下结果稳定,并随着计算过程收敛。AI数学推理也面临类似问题。它显然不可能是在全部文本组合中完全随机搜索,否则空间大到任何算力都毫无意义。因此需要挑选一个具体的、难度适中的开放数学问题,固定模型和输入,改变随机种子重复数百或数千次,展示成功证明在生成概率空间中的分布;再增加计算量、改变问题的等价表述,观察正确结果的概率是否稳定提高,并最终给出某种经验甚至理论上的收敛解释。
更重要的是第三方复现:这些结果是否必须依赖某个机构特有的模型、隐藏提示、私有工具和巨大算力环境?独立团队使用不同模型和独立环境,能否在不知道原证明路线的情况下再次进入相同或等价的数学解空间?
如果不能,目前至少还存在需要排除的实验自由度:人工挑选最容易成功的问题;失败后不断调整提示;根据中间结果给模型人工暗示;对少数问题投入远高于公开平均值的算力;大量重复生成后只公布成功样本;甚至人工完成关键证明步骤再归入模型成果。这些并不意味着实际发生了作弊,但如果完整运行记录、失败样本、人工干预和独立复现均不可见,外界就无法排除这种可能。
数学证明可以验证一个答案是否正确;但要证明生成式AI真正获得了稳定的数学发现能力,还需要回答:它为什么会收敛到这个答案,以及别人能不能独立重复这一过程。
核心只留三件事:随机生成为什么会收敛?第三方能不能复现?人工干预和选择性报告如何排除? Nobody got time for a 30-page AI-math methodology paper.
丘老了点,不过他懂流形的化,就应该理解数模转换的信息丢失理论
陶那么年轻看看EE I, EEII 就知道AI是什么玩意了,他娃上课自己跟着看看,AI不就是EEII的载波理论么,甚至都没有那么严谨
当然到了那个地位每天看二十封简历写两峰推荐信基本也干不了啥了
笑看以后
人类学家Al
与
Meta Al
下场打“烂泥仗”
一众神童陶们,第一看不懂,第二辨不赢而场外翻白眼。
我看的是背后的利益斗争,
本质是AI和AI背后的资本能消灭肉人,会毫不犹豫,人家也没打算隐藏这一动机,奇怪是聪明人成了傻子,以为人家会“请”你分饼。
如果你说的“都很严重“,我比较赞同。
我认为很多人都高估了自己,AI,所谓的科学,包括我个人。这是不快乐难以满足的源泉
佩雷尔曼不想做宠物的说法。
这个问题各学科现在都很严重- 把基本科学方法论/标准丢了。我讲的是"更高尚的"标准。超前了。
AI说不定提供了革革命,拨乱反正的机会。
我的一点浅见,就是陶,老秋,数学所以及美国的科研,院校(stanford和其它机构搞了hallucinnation bench)
你不出来有力的质疑,最后恒大几十万亿的烂尾就会annualize到你的退休金里。这个不是请客吃法。散户想混水摸鱼?华尔街是慈善家开周鹏么?
当然STEM还是承认科学方法,观察总结归纳改进。
但是象球赛一样,你来我往,才有卖点,有活干。
这个没有标准不是彻底无政府主义。是说所有已知标准都用一遍还承认可能还有我们未知的标准。
这个沉淀一下,大家可以看出所以然的。能给数学解决的问题吗不是问题。
至于大的层面上所谓verification(ism),大家都不兴谈了。科学史上太多反例了,现在没有标准就是标准
数学是找到可能性
不是把棋子摆在棋盘上
我的一点浅见
我觉得OAI 写个文档,Deepseek或阿里某个团队重复一下,最少意思一下。中科院数学所我最少还是想信的。
这个见的太多天花乱坠的framework,啥工程问题也解决不了
我个人私下嘀咕几句
抬杠最后还是“Gowers 等人的 human verification“并不是正式发表的文章,本身也没有过peer review.当然王虹也没有过,就拿了菲尔兹。
所有放在一起,不禁让人遐想连篇
这还是个以人能理解为否的标准。可是为何要竖这个标准?背后有个复杂的逻辑线条,一个我们百分百相信的机器判定其正确了,就成功了咯?以往我们用我们百分百相信的杂志主编。
大量科学定律我们都不知道为什么会收敛到那样。至于重复,现在大家不是在做吗?
当然你如果质疑的是这些AI公司造假,比如把人已经证好的题目拿出来冒充(包括那些晃过守门员就差打空门的题目),那是合理的。