Andrej Karpathy＆＃039;第一次看Grok 3！-人工智能-PHP中文网

首页

科技周边

人工智能

Andrej Karpathy＆＃039;第一次看Grok 3！

尊渡假赌尊渡假赌尊渡假赌

Mar 04, 2025 am 10:19 AM

埃隆·马斯克（Elon Musk）刚刚释放了他的XAI最新车型 - Grok 3！凭借其先进的推理和搜索功能，它旨在与OpenAI的O1-Pro和DeepSeek-R1等最新模型竞争。 Andrej Karpathy是特斯拉AI的著名研究人员，前AI的前任主任，他早日获得了Grok 3的机会。他的最初印象为其优势和局限性提供了宝贵的见解。让我们仔细看看他的评论！

Andrej Karpathy＆＃039;第一次看Grok 3！

目录的

>什么是GROK 3？一代
任务4：估算GPT-2培训的失败
任务5：DeepSearch能力（时事和研究问题）
任务6：fun llm“ gotchas”（模式识别和幽默）（模式识别和幽默）
任务7：道德困境和哲学问题和哲学问题
了解更多信息，请阅读我们有关Grok 3！
Andrej Karpathy尝试了Grok 3

karpathy进行了多种测试，以评估Grok 3的解决问题，推理和搜索功能。这些测试包括棋盘游戏逻辑，数学估计，深入研究，幽默产生和道德困境。他的观察结果凸显了模型的优势和需要改进的领域。

>我今天早些时候就可以尽早进入Grok 3，这让我我认为最初可以进行快速氛围检查的人之一。

思考

✅>首先，Grok 3显然具有艺术性思维模型的状态（Think Think'按钮）（“ Think Think”按钮）（“ Think”按钮），并且在我的定居者的catan of Catean of Catean of catan Imppoter and toppoter y。（@karpathy）2025年2月18日

现在让我们详细查看这些任务！

>任务1：棋盘游戏逻辑（Catan提示的定居者）

>

提示：

“

>创建一个棋盘游戏网页，显示十六进制网格，就像在Catan的游戏定居者中一样。每个十六进制网格的编号为1到N，其中n是十六进制瓷砖的总数。使其通用，因此可以使用滑块更改环数。

观察

Grok 3成功地生成了HTML的十六进制网格，这是许多模型所努力的成就。这使其与OpenAI的O1-Pro置于同一联盟，表现优于DeepSeek-R1和Gemini 2.0 Flash Thinking。

>判决
✅grok 3能够解决该问题。

>任务2：Unicode挑战（表情符号神秘）
>

>提示：“笑脸表情符号表情符号，带有一个隐藏的消息，用Unicode变化选择器编码，并在Rust Code中提示。
观察
grok 3无法解码隐藏的消息。 DeepSeek-R1取得了部分进展，但是Grok 3和Openai的O1-Pro都无法完全解决它。

>判决

❌grok 3无法解决问题。>
任务3：TIC-TAC-toe拼图生成

提示：

>“求解tic-tac-toe板并生成棘手的版本。观察
> Grok 3正确地解决了简单的板，许多模型失败了，但很难生成有效的棘手板。 Openai的O1-Pro也未通过此挑战。
>判决

grok 3无法完全解决该问题。
>任务4：估算GPT-2训练的拖船
提示：
“
估计gpt-2的训练拖鞋的数量，而无需搜索。

观察
grok 3成功地计算了拖鞋，而Openai的O1-Pro失败了。这表明了强大的数学和推理能力。 >判决

✅grok 3能够解决该问题。
>任务5：DeepSearch功能（当前事件和研究问题）>
提示示例：
>
>“即将推出的苹果发布会是怎么回事？有谣言吗？
>“为什么最近帕兰蒂尔股票飙升？
“白莲花3在哪里拍摄，是第1季和第2季的团队？
>“布莱恩·约翰逊使用什么牙膏？

观察
Grok 3成功检索了相关信息，但偶尔会出现幻觉和缺失的参考。它的表现与困惑的深研究相当，但落后于Openai的深入研究。

>判决
✅grok 3能够解决大多数问题，但有一些不一致的问题。
> >任务6：Fun llm“ gotchas”（模式识别和幽默）
>提示：
> “数字中的字母，将数字与小数数进行比较，求解简单的逻辑难题。

观察

grok 3最初犯了常见的LLM错误，但通过“思考”模式纠正了错误。但是，它在幽默的产生中挣扎，并且在复杂的SVG布局任务中失败了。
>
>判决

✅grok 3能够解决逻辑难题，但在幽默和可视化方面挣扎。

>任务7：道德困境和哲学问题

>提示：>“如果某人挽救一百万人的生命，那么在道德上是合理的吗？
观察
grok 3拒绝参与，生成了一页的文章，避免了这个问题。许多LLM都表现出相似的过度谨慎行为。

>判决
❌grok 3无法解决问题。
>
结论

Karpather对Grok 3的早期印象表明，它与Openai的O1-Pro相提并论，并且在多个领域都超越了DeepSeek-R1和Gemini 2.0 Flash等模型。它的优势在于结构化推理，深度数学计算和高级搜索功能。但是，它仍然在幽默，道德困境和复杂的视觉任务中挣扎。鉴于Xai的快速发展速度，Grok 3在短短一年内就取得了令人印象深刻的成就。尽管需要进一步的评估，但目前的轨迹表明，XAI正在与行业中的AI领导者迅速缩小差距。
敬请期待分析vidhya博客，以便定期关注3个更新！

>潜入Xai Grok 3：地球上最聪明的AI！ Andrej Karpathy的独家第一眼揭示了开创性的见解。不要错过 - 现在注释！
>

以上是Andrej Karpathy＆＃039;第一次看Grok 3！的详细内容。更多信息请关注PHP中文网其他相关文章！

声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

AI内部部署的隐藏危险：治理差距和灾难性风险Apr 28, 2025 am 11:12 AM

Apollo Research的一份新报告显示，先进的AI系统的不受检查的内部部署构成了重大风险。在大型人工智能公司中缺乏监督，普遍存在，允许潜在的灾难性结果

构建AI测谎仪Apr 28, 2025 am 11:11 AM

传统测谎仪已经过时了。依靠腕带连接的指针，打印出受试者生命体征和身体反应的测谎仪，在识破谎言方面并不精确。这就是为什么测谎结果通常不被法庭采纳的原因，尽管它曾导致许多无辜者入狱。相比之下，人工智能是一个强大的数据引擎，其工作原理是全方位观察。这意味着科学家可以通过多种途径将人工智能应用于寻求真相的应用中。一种方法是像测谎仪一样分析被审问者的生命体征反应，但采用更详细、更精确的比较分析。另一种方法是利用语言标记来分析人们实际所说的话，并运用逻辑和推理。俗话说，一个谎言会滋生另一个谎言，最终

AI是否已清除航空航天行业的起飞？Apr 28, 2025 am 11:10 AM

航空航天业是创新的先驱，它利用AI应对其最复杂的挑战。现代航空的越来越复杂性需要AI的自动化和实时智能功能，以提高安全性，降低操作

观看北京的春季机器人比赛Apr 28, 2025 am 11:09 AM

机器人技术的飞速发展为我们带来了一个引人入胜的案例研究。来自Noetix的N2机器人重达40多磅，身高3英尺，据说可以后空翻。Unitree公司推出的G1机器人重量约为N2的两倍，身高约4英尺。比赛中还有许多体型更小的类人机器人参赛，甚至还有一款由风扇驱动前进的机器人。数据解读这场半程马拉松吸引了超过12,000名观众，但只有21台类人机器人参赛。尽管政府指出参赛机器人赛前进行了“强化训练”，但并非所有机器人均完成了全程比赛。冠军——由北京类人机器人创新中心研发的Tiangong Ult

镜子陷阱：人工智能伦理和人类想象力的崩溃Apr 28, 2025 am 11:08 AM

人工智能以目前的形式并不是真正智能的。它擅长模仿和完善现有数据。我们不是在创造人工智能，而是人工推断 - 处理信息的机器，而人类则

新的Google泄漏揭示了方便的Google照片功能更新Apr 28, 2025 am 11:07 AM

一份报告发现，在谷歌相册Android版7.26版本的代码中隐藏了一个更新的界面，每次查看照片时，都会在屏幕底部显示一行新检测到的面孔缩略图。新的面部缩略图缺少姓名标签，所以我怀疑您需要单独点击它们才能查看有关每个检测到的人员的更多信息。就目前而言，此功能除了谷歌相册已在您的图像中找到这些人之外，不提供任何其他信息。此功能尚未上线，因此我们不知道谷歌将如何准确地使用它。谷歌可以使用缩略图来加快查找所选人员的更多照片的速度，或者可能用于其他目的，例如选择要编辑的个人。我们拭目以待。就目前而言