斯坦福20亿参数端测多模态AI Agent模型大升级，手机汽车机器人都能用-人工智能-PHP中文网

首页

科技周边

人工智能

斯坦福20亿参数端测多模态AI Agent模型大升级，手机汽车机器人都能用

王林

May 07, 2024 pm 04:25 PM

ai训练

全球首个超小型多模态AI Agent模型Octopus V3，来自斯坦福大学的NEXA AI团队，让Agent更加智能、快速、能耗及成本降低。

斯坦福20亿参数端测多模态AI Agent模型大升级，手机汽车机器人都能用

今年四月份初，NEXA AI推出了备受瞩目的Octopus V2，该模型在函数调用性能上超越了GPT -4，减少了95%的推理时所需的文本量，为端侧AI应用带来了新的可能性。其专利性核心技术“functional token”通过创新的函数调用方式显着减少推理时所需的文本长度。

这种方法使得模型能够在只有20亿参数的情况下实现高效训练，并在精度和延迟方面超越了GPT-4，适应了各种端设备的部署需求。

自Octopus V2在LLM社区发布以来，受到了广泛关注，吸引了大量人工智能领域专家和研究者的赞赏，如Hugging Face的CTO Julien Chaumond、知名AI新闻通讯AI的创始人Rowan Cheung以及Figure AI的创始人Brett Adcock、OPPO边缘人工智能团队负责人Manoj Kumar等。他们被誉为“开创了端侧AI技术新纪元”。

在知名开源AI平台Hugging Face上，Octopus V2下载量已经超过12000次。

斯坦福20亿参数端测多模态AI Agent模型大升级，手机汽车机器人都能用

在不到一个月的时间里，NEXA AI团队发布下一代多模态AI Agent模型Octopus V3，展现进一步突破：具有图像处理和多语言文本处理能力，为智能手机等端侧设备真正走向AI时代铺平了道路。

斯坦福20亿参数端测多模态AI Agent模型大升级，手机汽车机器人都能用

首个参数量小于10亿的多模态AI Agent模型

Octopus V3不仅拥有多模式能力，在函数调用性能上远超同类模型，可媲美GPT-4V GPT4；而模型参数量不达10亿，具有多语言能力。

也就是说，相比传统的大型语言模型，它体积更小，能耗更低，能够更加轻松地在各种小型端设备上运行，比如树莓派，并做到高速且准确的函数调用。

这意味着，未来AI Agent能够广泛应用于智能手机、AR/VR、机器人、智能汽车等端侧设备，为用户交互体验更加流畅、智能。

另一方面，由于V3具有多模态处理能力，可同时处理文本和图像输入，再加上多语言能力，也将让用户体验更加丰富。

例如，在Instacart购物应用中，用户可以通过一张菠萝的图片及简单的对话指令，让AI Agent自动为他们搜索商品，提高了效率和用户的体验。

斯坦福20亿参数端测多模态AI Agent模型大升级，手机汽车机器人都能用

再比如，在发送邮件等场景中，Octopus V3可以根据一张具有文字的图像，自动提取信息并填写邮件内容，为用户提供更加智能、便捷的服务。

斯坦福20亿参数端测多模态AI Agent模型大升级，手机汽车机器人都能用

从软件交互到智能汽车，端侧AI潜力巨大

基于这些特性，Octopus V2及V3的应用场景丰富多样，具有广泛的应用前景。

除上文提到的手机场景，当Octopus V2应用在智能汽车上时，也能带来新的交互体验。目前的语音助手往往难以帮助车主完成较为复杂的任务，如在驾驶途中临时改变目的地、加入额外停靠点等。应用Octopus V3后，AI助手能够基于较为模糊简单的指令快速、精准地完成相应任务。

结合V2、V3的能力，从信息检索、到基于指令完成设计，用户可以在虚拟场景下获得流畅的AI体验：在一个社区用户的VR场景demo中，输入简单的语音指令后，AI Agent能够帮助用户快速完成一个客厅设计，在弹指间替换沙发、改变颜色灯光等。在用户输入旅行指令后，用户快速来到了日本，而AI Agent同样可以在简单的对话式交流中帮助用户搜索相应景点，提供丰富的信息。

数据显示，全球大型语言模型市场规模正在快速增长。Granview Research报告显示，全球大型语言模型市场规模估计为43.5亿美元，并预计从2024年到2030年的复合年增长率为35.9%。同样，边缘人工智能市场也呈现出蓬勃发展的势头——预计从2023年到2030年，全球边缘人工智能市场的复合年增长率为21.0%，到2030年将达到664.78亿美元。

NEXA AI团队由斯坦福大学的杰出研究人员创立。

创始人兼首席科学家Alex Chen（陈伟）正在攻读斯坦福大学的博士学位，拥有丰富的人工智能研究经验，并且曾担任斯坦福华人创业协会（Stanford Chinese Entrepreneurs Organization）的主席。

联合创始人兼首席技术官Zack Li（李志远）也是斯坦福大学的毕业生，并在Google和Amazon Lab126实验室拥有4年端侧AI的一线研发经验，同样曾经担任斯坦福华人创业协会的主席。

斯坦福大学副教授、斯坦福技术创业项目副主任Charles (Chuck) Eesley担任顾问，为团队提供指导和支持。

斯坦福20亿参数端测多模态AI Agent模型大升级，手机汽车机器人都能用 △左：李志远；右：陈伟

目前，NEXA AI的独创性技术已申请专利保护。

NEXA AI的创始团队表示，他们将继续致力于推动端侧AI技术的发展，通过开源模型提升其创新技术的影响力，为用户创造更智能、高效的未来生活。

论文地址：https://arxiv.org/abs/2404.11459

以上是斯坦福20亿参数端测多模态AI Agent模型大升级，手机汽车机器人都能用的详细内容。更多信息请关注PHP中文网其他相关文章！

声明

本文转载于：51CTO.COM。如有侵权，请联系admin@php.cn删除

AI内部部署的隐藏危险：治理差距和灾难性风险Apr 28, 2025 am 11:12 AM

Apollo Research的一份新报告显示，先进的AI系统的不受检查的内部部署构成了重大风险。在大型人工智能公司中缺乏监督，普遍存在，允许潜在的灾难性结果

构建AI测谎仪Apr 28, 2025 am 11:11 AM

传统测谎仪已经过时了。依靠腕带连接的指针，打印出受试者生命体征和身体反应的测谎仪，在识破谎言方面并不精确。这就是为什么测谎结果通常不被法庭采纳的原因，尽管它曾导致许多无辜者入狱。相比之下，人工智能是一个强大的数据引擎，其工作原理是全方位观察。这意味着科学家可以通过多种途径将人工智能应用于寻求真相的应用中。一种方法是像测谎仪一样分析被审问者的生命体征反应，但采用更详细、更精确的比较分析。另一种方法是利用语言标记来分析人们实际所说的话，并运用逻辑和推理。俗话说，一个谎言会滋生另一个谎言，最终

AI是否已清除航空航天行业的起飞？Apr 28, 2025 am 11:10 AM

航空航天业是创新的先驱，它利用AI应对其最复杂的挑战。现代航空的越来越复杂性需要AI的自动化和实时智能功能，以提高安全性，降低操作

观看北京的春季机器人比赛Apr 28, 2025 am 11:09 AM

机器人技术的飞速发展为我们带来了一个引人入胜的案例研究。来自Noetix的N2机器人重达40多磅，身高3英尺，据说可以后空翻。Unitree公司推出的G1机器人重量约为N2的两倍，身高约4英尺。比赛中还有许多体型更小的类人机器人参赛，甚至还有一款由风扇驱动前进的机器人。数据解读这场半程马拉松吸引了超过12,000名观众，但只有21台类人机器人参赛。尽管政府指出参赛机器人赛前进行了“强化训练”，但并非所有机器人均完成了全程比赛。冠军——由北京类人机器人创新中心研发的Tiangong Ult

镜子陷阱：人工智能伦理和人类想象力的崩溃Apr 28, 2025 am 11:08 AM

人工智能以目前的形式并不是真正智能的。它擅长模仿和完善现有数据。我们不是在创造人工智能，而是人工推断 - 处理信息的机器，而人类则

新的Google泄漏揭示了方便的Google照片功能更新Apr 28, 2025 am 11:07 AM

一份报告发现，在谷歌相册Android版7.26版本的代码中隐藏了一个更新的界面，每次查看照片时，都会在屏幕底部显示一行新检测到的面孔缩略图。新的面部缩略图缺少姓名标签，所以我怀疑您需要单独点击它们才能查看有关每个检测到的人员的更多信息。就目前而言，此功能除了谷歌相册已在您的图像中找到这些人之外，不提供任何其他信息。此功能尚未上线，因此我们不知道谷歌将如何准确地使用它。谷歌可以使用缩略图来加快查找所选人员的更多照片的速度，或者可能用于其他目的，例如选择要编辑的个人。我们拭目以待。就目前而言