AI 正在接手一项特殊的工作:研发 AI。
目前 AI 已经能帮研究者写训练代码、跑实验、压榨计算效率。但人们的野心不止于此:用这一代 AI 造出更强的下一代,下一代再接手更多研发工作,一代代往上推。
这就是 RSI(Recursive Self-Improvement,递归自我改进)。它关心的不是 AI 今天能干多少活,而是这一轮研究的成果能不能带进下一个系统——能力提升之后,系统是否也更擅长制造下一次提升。
9 月 6 日,OpenAI 发布内部研究加速报告,宣称已达到"自动化研究实习生"的目标:系统能够在人类指导下执行边界清晰的研究任务,其中一些原本需要熟练研究员花好几天完成。
Anthropic 一如既往的克制。Claude 确实在接手更多工程实现和实验执行。至于那种能完全自主设计、开发后继系统的 RSI,还没到那一步。
通往 RSI 的路其实已经很明确了:AI 能否找到更好的训练方法,减少计算中的浪费,并把验证过的经验留给后面的研发。
每一项都可以先从一个有限的任务做起。做完再看它能走多远。
让 AI 动手改进训练流程
超衍智能(Apex Intelligence)此次发布的研究成果,就处在这条路径上。
9 月 8 日,公司发布《What Happens When AI Starts Improving AI?》,公布其自动化 AI 研究系统的首批系统性评测成果。
这些评测围绕三个实际问题展开:训练开始前,怎样判断钱和算力该花在哪里;训练过程中,怎样减少资源浪费;执行计算时,怎样让 GPU 跑得更快。
(https://x.com/apexin_ai/status/2097179115396718698)
大模型训练开始之前,研究人员就要作出一系列昂贵的决定:模型做多大,用多少数据,投入多少算力。
每种组合都完整训练一遍,成本难以承受。因此,研究人员通常先做较小规模的实验,再据此预测扩大规模后的表现。预测越可靠,团队越有可能把预算用在有效的方案上。
超衍参与的 SLDBench 评测,就在检验 AI 能不能把这件事做得更好。它基于超过 5000 组已发表的语言模型训练实验构建,要求系统从已知数据中找出规律,再预测未参与拟合的规模区间。
难点在于,小规模实验呈现的趋势,未必会一直延续。
在其中一项任务里,实验曲线会出现转折。如果顺着眼前的变化一路推算,就可能把后面的方向判断错。按照公司的技术说明,AI 将这条曲线拆开处理:一部分描述长期趋势,另一部分描述只在某个阶段出现、随后逐渐消退的影响。这样,短期变化就不会被直接当成长期规律。
在采用的四项任务中,超衍披露的平均得分达到 0.8846,比报告采用的参照结果 0.8613 提高约 2.71%。
进入训练阶段,问题变成了:硬件和时间都有限,怎样把模型训练得更好?
NanoChat Autoresearch 给出的测试条件是:一张 B200 显卡,每个候选方案只能训练 300 秒。AI 可以修改模型架构、优化器、超参数和训练代码,最后用验证集上的表现检验改动是否有效。
超衍智能发现这套训练方案使用了一张很大的 n-gram 记忆表。每批训练数据只会访问表中的少量条目,但原有实现仍承担着大范围梯度计算带来的开销。相当于一本很厚的账簿,这次只改了几页,处理更新时却仍要为整本账簿占用大量资源。
AI 的改法,是把更新集中到当前批次真正访问过的条目,再合并查表和索引操作,减少重复处理。
相比采用的 ScienceGuru 参照实现,这些改动将峰值训练显存从约 177.7 GiB 降至 140.6 GiB,下降约 20.9%,同时保持了接近该任务公开领先水平的模型质量。
在相同的 300 秒内,它处理的 token 数量还少了约 4.5%。这说明,接近领先水平的训练效果,也可以在更低的显存占用和更少的训练 token 下实现。
其初始三次不同随机种子实验的平均成绩为 0.892426,补充到十次后为 0.892792。与 Recursive SuperIntelligence、腾讯混元 Hyra 和 AutoTrust AI 的 ScienceGuru 等公开方案比较,超衍智能已经接近这一任务的前沿水平。
除了改训练方案,超衍还让 AI 继续往下找,检查 GPU 执行具体计算时,有哪些步骤可以做得更快。
其中一项是 TriMul,也就是 AlphaFold 类蛋白质结构模型使用的一类计算。这项任务已经有不少人类工程师和自动化研究系统参与,继续优化的空间并不好找。
系统最初尝试把更多计算步骤合在一起执行,但实验发现,这会增加寄存器的使用压力,收益逐渐减小,有些输入尺寸下效果也不稳定。
它随后换了一个方向:检查前一道计算产生的数据,是否方便后一道计算读取。
按照官方介绍,系统在矩阵乘法与后续层归一化的衔接处找到了改进空间。新的实现沿连续的存储位置读取数据,再在寄存器中完成所需的排列调整,提高了后续处理效率。
最终,在 H100 上的七种固定输入尺寸中,其几何平均延迟为 1036.1 微秒,比同机测试的人类参照实现 stashuk-olek 的 1064.9 微秒降低约 2.71%。
值得一提的是其研究过程:原来的改法效果不好,AI 根据实验结果换了方向,并找到了新的优化位置。
另一项 GPU 优化,发生在大模型常用的注意力计算中。
这类计算为了保证数值稳定,通常需要在计算过程中反复调整数值尺度。这些操作有明确用途,也会消耗算力。
在 MLS-Bench 的融合因果注意力任务中,超衍智能系统发现,评测给定的输入数值范围比较窄。在这些条件下,可以省去反复缩放,先累计中间结果,最后再统一归一化,同时满足最大绝对误差低于 0.01 的要求。
少做这些步骤,再配合调度和数据搬运优化,系统在三个指定配置下的吞吐量分别达到 430.7、468.4 和 451.7 TFLOP/s,相比报告采用的参照结果提高 27.18%、15.63% 和 17.11%。
换句话说,在这三组测试条件下,同一张 GPU 每秒能完成更多计算。
让一次发现,成为下一轮的起点
四项评测共同检验了一种能力:AI 能否根据实验结果找出问题、调整方案,再验证改动是否有效。
发现显存浪费,就修改更新方式。继续融合计算收效有限,就转向检查数据读取。确认输入条件允许,就尝试简化计算步骤。
超衍智能将这一过程概括为 Discover → Verify → Learn → Improve:发现问题、验证方案、积累经验,再据此继续改进。这也延续了创始人陈勇超此前 CodeSteer、TUMIX 等研究的思路,让模型提出的想法接受代码执行和实验结果的检验。
对研发团队而言,这种能力的价值很具体。训练前少作一次错误判断,训练中降低显存占用,执行时缩短计算耗时,都可能让同样的预算支持更多有效实验。如果一项优化能在真实任务中反复使用,最初的研究投入就有机会换来持续的资源节省。
更进一步的问题是,这次研究积累的经验,下次还能不能用。
超衍在报告中将下一步指向迁移:这次学会了减少大型记忆表的无效更新,换一张表能否用上。这次发现计算速度受制于数据读取,优化另一个内核时,能否更早检查这个环节。如果这些经验能帮助系统更快找到问题、减少无效尝试,一次任务的成果就能转化为后续的研究能力,逐步接近 RSI 所描述的循环。
超衍已通过 Apex-Tune 仓库公开训练脚本、GPU 内核实现和评估材料,供其他研究者检查、复现和拓展
当 AI 参与研发 AI,人们期待的循环是:更有效的训练方法帮助产生更强的模型,更强的模型又能找到新的改进方法。
一轮实验的价值,也在于它能让下一轮少走多少弯路。




0 条评论
请「登录」后评论