英伟达发布新nGPT架构撬动AI未来-AET-电子技术应用

英伟达发布新nGPT架构撬动AI未来

超球面学习提效，训练模型时间可缩短至 1/20

日期： 2024-10-22

来源：IT之家

关键词： 英伟达 nGPT架构超球面学习

10 月 22 日消息，科技媒体 dataconomy 昨日（10 月 21 日）发布博文，报道称英伟达在训练 AI 模型方面取得重大突破，发布了最新的 Normalized Transformer（nGPT）新架构，保持模型的稳定性和准确性的前提下，可以将训练 AI 时间缩短至 1/4 或者 1/20。

nGPT 架构提升效率的秘诀在于“超球面学习”（Hyperspherical learning）这个概念。

传统的变换器模型通常缺乏一致的几何框架，而 nGPT 通过将嵌入、注意力矩阵和隐藏状态等关键组件映射到超球面表面，确保模型各层在训练过程中保持平衡。

这种几何结构有助于创造更稳定高效的学习过程：

减少训练步骤：nGPT 不再直接对模型权重应用权重衰减，而是依赖学习到的缩放参数，优化模型在训练中的调整方式。

简化过程：此方法消除了对 LayerNorm 或 RMSNorm 等归一化技术的需求，使训练过程更为简单和快速。

英伟达团队使用 OpenWebText 数据集进行测试，nGPT 在速度和效率上均优于传统的 GPT 模型。对于长达 4000 个 tokens 的文本输入，nGPT 所需的训练轮次远少于传统模型，显著缩短了训练时间。

nGPT 的一个关键优势是将归一化（normalization）和表示学习（representation learning）结合成一个统一框架，这种设计简化了模型架构，便于扩展和适应更复杂的混合系统。未来，nGPT 的方法可能被整合进其他类型的模型和架构，从而开发出更强大的 AI 系统。

Magazine.Subscription.jpg

版权声明：本站内容除特别声明的原创文章之外，转载内容只为传递更多信息，并不代表本网站赞同其观点。转载的所有的文章、图片、音/视频文件等资料的版权归版权所有权人所有。本站采用的非本站原创文章及图片等内容无法一一联系确认版权者。如涉及作品内容、版权和其它问题，请及时通过电子邮件或电话通知我们，以便迅速采取适当措施，避免给双方造成不必要的经济损失。联系电话：010-82306118；邮箱：aet@chinaaet.com。

英伟达发布新nGPT架构撬动AI未来

日期： 2024-10-22

来源：IT之家

相关内容