
明星创业公司 Thinking Machines,第二篇辩论论文热乎出炉!
公司创举东说念主、OpenAI 前 CTO Mira Murati 依旧切身站台,翁荔等一众大佬也纷纷转发扶持:

论文主题为" Modular Manifolds ",通过让所有汇注的不同层 / 模块在结伴框架下进行不休和优化,来擢升考验的雄厚性和成果。
之是以进行这项辩论,主如若为了处罚神经汇注考验中的一个基本挑战:
汇注里面的张量(如权重、激活、梯度)若数值过大或过小,会激励不雄厚、梯度爆炸 / 灭绝、考验成果低下第问题。
因此,论文独一作家 Jeremy Bernstein建议了一种新的优化想路——模块化流形(Modular Manifolds),不仅对单个权重张量施加不休,还能把所有汇注目为组合的流形结构,从而结伴盘算学习率、不休方式与优化逻辑。

网友们的响应 be like:
对神经汇注考验有深远的视力。

将权重更新收尾在流形上不错带来雄厚性和可评释性,意思能否彭胀到相等大的模子?

带着这些确定和猜疑,我们接着看这到底是一项若何的辩论——
从向量在球面上优化→建议模块化流形
为什么需要流形不休?
原因正如发轫所提到的,在考验大模子时,如果权重、激活值、梯度太大或太小,就会出现考验不雄厚(溢出、灭绝、管理速率慢等问题)。
之前为了处罚这些问题,归一化方法迟缓成为"黄金秩序",包括激活归一化(如层归一化 LayerNorm)、梯度归一化(优化器里面的规范化)等,但很少径直对权重矩阵自己进行归一化处理。
而作家以为,对权重矩阵进行归一化处理具有特别价值,其平允可能包括:
更容易把抓优化经由中更新量的大小;
概况幸免权重的范数变得过大,也即是防患权重"爆炸"的问题;
让辩论员不错把调养超参数的元气心灵,更多地放在那些对模子影响最大的张量上;
让矩阵的要求数变小,这么矩阵的活动就会愈加雄厚和可瞻望;
……
一句话,给权重矩阵归一化,不错让模子考验更雄厚、更容易调养、活动更可瞻望,而况对外界侵略更有抵牾力。
基于此,作家但愿盘算一个几何化框架,把神经汇注的权重参数不休在特定的Stiefel 流形上,从而在考验时概况鸠合优化器与这些不休。
其中枢辩论经由大要有以下几个要领:
Step 1:提供一个基础示例
假定要考验的参数是一个向量 W开yun体育网,而况强制它遥远在单元球面上:
