英伟达推全新视觉语音模型NVEagle-AET-电子技术应用

英伟达推全新视觉语音模型NVEagle

可以看图聊天

日期： 2024-09-03

来源：硅星人

关键词： 英伟达 NVEagle 视觉语音模型看图聊天

9月2日讯，据英伟达官方消息，英伟达联合 Georgia Tech、UMD 和 HKPU 的研究团队推出了全新的视觉语言模型 —— NVEagle。

据悉，NVEagle 能够理解复杂的现实场景，通过视觉输入进行更好的解读和回应。它的设计核心在于将图像转化为视觉标记，再与文本嵌入相结合，进而提升了对视觉信息的理解。NVEagle 包括了三个版本 :Eagle-X5-7B、Eagle-X5-13B 以及 Eagle-X5-13B-Chat。其中，7B 和 13B 版本主要用于一般的视觉语言任务，而 13B-Chat 版本则专门针对对话式 AI 进行了微调，能够更好地进行基于视觉输入的互动。

NVEagle 的一个亮点在于采用了混合专家（MoE）机制，能够根据不同任务动态选择最合适的视觉编码器，这极大提升了对复杂视觉信息的处理能力。该模型已在 Hugging Face 上发布，方便研究人员和开发者使用。

Magazine.Subscription.jpg

版权声明：本站内容除特别声明的原创文章之外，转载内容只为传递更多信息，并不代表本网站赞同其观点。转载的所有的文章、图片、音/视频文件等资料的版权归版权所有权人所有。本站采用的非本站原创文章及图片等内容无法一一联系确认版权者。如涉及作品内容、版权和其它问题，请及时通过电子邮件或电话通知我们，以便迅速采取适当措施，避免给双方造成不必要的经济损失。联系电话：010-82306118；邮箱：aet@chinaaet.com。

英伟达推全新视觉语音模型NVEagle

日期： 2024-09-03

来源：硅星人

相关内容