大模型竞赛,又杀出一匹黑马——
Inflection-2.5,由DeepMind联创Mustafa Suleyman的大模型初创公司打造。
只用40%的计算资源训练,表现就超过了GPT-4的九成,尤其擅长代码和数学。
而早期的Inflection模型,训练时只消耗了4%的计算资源,就达到了GPT-4表现的72%。
以Inflection模型为基础,该公司还推出了网页端对话机器人Pi,主打“高情商”和“个性化”,还支持中文。
自诞生以来,Pi的最高日活达到了100万,累计产生了40亿条消息,平均对话时长来到了33分钟。
而随着这次基础模型的升级,Pi也迎来了它的新版本。
图片
那么,Inflection,或者说Pi,表现到底有没有那么强,量子位进行了一番实测。
无需登录即可使用
打开Pi的页面,映入眼帘的是这样一个极简界面,而且还可以不用登录,直接点击Next。
图片
连续Next几次后,输入希望Pi称呼我们的方式。
图片
之后是选择声音和推荐话题,直接跳过就可以了,然后就进入正式的聊天界面了。
图片
简单测试发现,Pi支持中文对话,既然如此那就先把弱智吧Benchmark给安排上。
第一题,老鼠生病了可以吃老鼠药治好吗,Pi成功解答。
图片
再来一道“陷阱”题,这次依旧没有上当。
图片
两道问题过后,虽然没有出现什么戏剧性效果,但看起来对中文也是有一定的理解了。
接下来就重点看看官方宣称“尤其擅长”的数学和代码能力。
首先是一道涉及动态规划的编程题目。
图片
Pi给出的代码成功解决了这个问题,并且配有清晰的解释。
图片
接下来再提升一下难度看看,让其分析一个数字的阶乘中末尾有多少个0。
图片
Pi给出的代码不仅正确,而且简洁高效,运行速度超过了LeetCode上73.8%的用户。
图片
最后再来增加一下难度,以一道47.5%通过率的题目结束代码部分的测试。
图片
看完代码,再来测测Pi的数学能力怎么样,让它做做关于导数的题目:
求出函数f(x)=x³+2x²-1的极值点
解答完全正确,而是十分详细。
当然要想数学好,逻辑思维是必不可少的,所以我们在常规的数学题之外,又用一道经典的题目考验了一下的Pi逻辑思维,结果还不错。
通过Pi的表现,可以看出其背后的Inflection-2.5模型的确可圈可点。
而从官方自己公布的测试数据来看,无论是综合能力还是各个子项,Inflection-2.5的表现都紧随GPT-4。
以数学和代码为例,Inflection-2.5在MATH、HumanEval等测试中都比1.0版本都有大幅飞跃。
在这些常规的数据集之外,Inflection还挑战了匈牙利高考数学试题和GRE物理测试,结果几乎与GPT-4打成平手。
更“刁钻”的,还有人专门用大模型难以理解的问题构建了一个BIG-Bench数据集,而Inflection-2.5挑战了其中的Hard子集,结果和GPT-4的差距不到一分。
那么,Inflection-2.5的背后,是怎样的一家公司呢?
DeepMind联创大模型创业
这家公司名叫Inflection AI,由DeepMind联创Mustafa Suleyman等人于2022年创立,目前共有70余人。
同样来自DeepMind的,还有资深研究员Karen Simonyan,现担任Inflection AI的首席科学家。
此外,LinkedIn联创Reid Hoffman也参与了Inflection AI的创立。
创立以来,Inflection AI已经获得了来自英伟达、微软、比尔盖茨等巨头的共计15亿美元的融资。
目前,基于Inflection的Pi还是免费的,但CEO Suleyman也表示,一直用爱发电不现实,长久地看以后还是要收费。
想要体验的朋友,可能要抓紧时间了~
传送门:https://pi.ai
以上是40%算力训练效果比肩GPT-4,实测DeepMind联创大模型创业新成果的详细内容。更多信息请关注PHP中文网其他相关文章!

拥抱Face的OlympicCoder-7B:强大的开源代码推理模型 开发以代码为中心的语言模型的竞赛正在加剧,拥抱面孔与强大的竞争者一起参加了比赛:OlympicCoder-7B,一种产品

你们当中有多少人希望AI可以做更多的事情,而不仅仅是回答问题?我知道我有,最近,我对它的变化感到惊讶。 AI聊天机器人不仅要聊天,还关心创建,研究

随着智能AI开始融入企业软件平台和应用程序的各个层面(我们必须强调的是,既有强大的核心工具,也有一些不太可靠的模拟工具),我们需要一套新的基础设施能力来管理这些智能体。 总部位于德国柏林的流程编排公司Camunda认为,它可以帮助智能AI发挥其应有的作用,并与新的数字工作场所中的准确业务目标和规则保持一致。该公司目前提供智能编排功能,旨在帮助组织建模、部署和管理AI智能体。 从实际的软件工程角度来看,这意味着什么? 确定性与非确定性流程的融合 该公司表示,关键在于允许用户(通常是数据科学家、软件

参加Google Cloud Next '25,我渴望看到Google如何区分其AI产品。 有关代理空间(此处讨论)和客户体验套件(此处讨论)的最新公告很有希望,强调了商业价值

为您的检索增强发电(RAG)系统选择最佳的多语言嵌入模型 在当今的相互联系的世界中,建立有效的多语言AI系统至关重要。 强大的多语言嵌入模型对于RE至关重要

特斯拉的Austin Robotaxi发射:仔细观察Musk的主张 埃隆·马斯克(Elon Musk)最近宣布,特斯拉即将在德克萨斯州奥斯汀推出的Robotaxi发射,最初出于安全原因部署了一支小型10-20辆汽车,并有快速扩张的计划。 h

人工智能的应用方式可能出乎意料。最初,我们很多人可能认为它主要用于代劳创意和技术任务,例如编写代码和创作内容。 然而,哈佛商业评论最近报道的一项调查表明情况并非如此。大多数用户寻求人工智能的并非是代劳工作,而是支持、组织,甚至是友谊! 报告称,人工智能应用案例的首位是治疗和陪伴。这表明其全天候可用性以及提供匿名、诚实建议和反馈的能力非常有价值。 另一方面,营销任务(例如撰写博客、创建社交媒体帖子或广告文案)在流行用途列表中的排名要低得多。 这是为什么呢?让我们看看研究结果及其对我们人类如何继续将


热AI工具

Undresser.AI Undress
人工智能驱动的应用程序,用于创建逼真的裸体照片

AI Clothes Remover
用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool
免费脱衣服图片

Clothoff.io
AI脱衣机

Video Face Swap
使用我们完全免费的人工智能换脸工具轻松在任何视频中换脸!

热门文章

热工具

SublimeText3 英文版
推荐:为Win版本,支持代码提示!

记事本++7.3.1
好用且免费的代码编辑器

SublimeText3汉化版
中文版,非常好用

mPDF
mPDF是一个PHP库,可以从UTF-8编码的HTML生成PDF文件。原作者Ian Back编写mPDF以从他的网站上“即时”输出PDF文件,并处理不同的语言。与原始脚本如HTML2FPDF相比,它的速度较慢,并且在使用Unicode字体时生成的文件较大,但支持CSS样式等,并进行了大量增强。支持几乎所有语言,包括RTL(阿拉伯语和希伯来语)和CJK(中日韩)。支持嵌套的块级元素(如P、DIV),

禅工作室 13.0.1
功能强大的PHP集成开发环境