Transformer本可以深谋远虑，但就是不做-人工智能-PHP中文网

首页

科技周边

人工智能

Transformer本可以深谋远虑，但就是不做

PHPz

Apr 22, 2024 pm 05:22 PM

理论

语言模型是否会规划未来 token？这篇论文给你答案。

「别让 Yann LeCun 看见了。」

Transformer本可以深谋远虑，但就是不做

Yann LeCun 表示太迟了，他已经看到了。今天要介绍的这篇「LeCun 非要看」的论文探讨的问题是：Transformer 是深谋远虑的语言模型吗？当它在某个位置执行推理时，它会预先考虑后面的位置吗？

这项研究得出的结论是：Transformer 有能力这样做，但在实践中不会这样做。

我们都知道，人类会思考而后言。十年的语言学研究表明：人类在使用语言时，内心会预测即将出现的语言输入、词或句子。

不同于人类，现在的语言模型在「说话」时会为每个 token 分配固定的计算量。那么我们不禁要问：语言模型会和人类一样预先性地思考吗？

根据最近的一些研究已经表明：可以通过探查语言模型的隐藏状态来预测下一 token。有趣的是，通过在模型隐藏状态上使用线性探针，可以在一定程度上预测模型在未来 token 上的输出，并且可以对未来输出进行可预测的修改。近期的一些研究已经表明，可以通过探查语言模型的隐藏状态来预测下一 token。有趣的是，通过在模型隐藏状态上使用线性探针，可以在一定程度上预测模型在未来 token 上的输出，并且可以对未来输出进行可预测的修改。

这些发现表明在给定时间步骤的模型激活至少在一定程度上可以预测未来输出。

但是，我们还不清楚其原因：这只是数据的偶然属性，还是因为模型会刻意为未来时间步骤准备信息（但这会影响模型在当前位置的性能）？

为了解答这一问题，近日科罗拉多大学博尔德分校和康奈尔大学的三位研究者发布了一篇题为《语言模型是否会规划未来 token？》的论文。

Transformer本可以深谋远虑，但就是不做

论文标题：Do Language Models Plan for Future Tokens?

论文地址：https://arxiv.org/pdf/2404.00859.pdf

研究概览

他们观察到，在训练期间的梯度既会为当前 token 位置的损失优化权重，也会为该序列后面的 token 进行优化。他们又进一步问：当前的 transformer 权重会以怎样的比例为当前 token 和未来 token 分配资源？

他们考虑了两种可能性：预缓存假设（pre-caching hypothesis）和面包屑假设（breadcrumbs hypothesis）。

Transformer本可以深谋远虑，但就是不做

预缓存假设是指 transformer 会在时间步骤 t 计算与当前时间步骤的推理任务无关但可能对未来时间步骤 t τ 有用的特征，而面包屑假设是指与时间步骤 t 最相关的特征已经等同于将在时间步骤 t τ 最有用的特征。

为了评估哪种假设是正确的，该团队提出了一种短视型训练方案（myopic training scheme），该方案不会将当前位置的损失的梯度传播给之前位置的隐藏状态。

对上述假设和方案的数学定义和理论描述请参阅原论文。

实验结果

为了了解语言模型是否可能直接实现预缓存，他们设计了一种合成场景，其中只能通过显式的预缓存完成任务。他们配置了一种任务，其中模型必须为下一 token 预先计算信息，否则就无法在一次单向通过中准确计算出正确答案。

Transformer本可以深谋远虑，但就是不做

^{该团队构建的合成数据集定义。}

在这个合成场景中，该团队发现了明显的证据可以说明 transformer 可以学习预缓存。当基于 transformer 的序列模型必须预计算信息来最小化损失时，它们就会这样做。

之后，他们又探究了自然语言模型（预训练的 GPT-2 变体）是会展现出面包屑假设还是会展现出预缓存假设。他们的短视型训练方案实验表明在这种设置中，预缓存出现的情况少得多，因此结果更偏向于面包屑假设。

Transformer本可以深谋远虑，但就是不做

^{基于 token 位置的原始 GPT-2 模型与短视型 GPT-2 模型的交叉熵损失及其差异。}

Transformer本可以深谋远虑，但就是不做

^{GPT-2 通过原始和短视型训练获得的验证交叉熵损失。}

于是该团队声称：在真实语言数据上，语言模型并不会在显着程度上准备用于未来的信息。相反，它们是计算对预测下一个 token 有用的特征 —— 事实证明这对未来的步骤也很有用。

Transformer本可以深谋远虑，但就是不做

该团队表示：「在语言数据中，我们观察到贪婪地针对下一token 损失进行优化与确保未来预测性能之间并不存在显着的权衡。」

因此我们大概可以看出来，Transformer 能否深谋远虑的问题似乎本质上是一个数据问题。

Transformer本可以深谋远虑，但就是不做

可以想象，也许未来我们能通过合适的数据整理方法让语言模型具备人类一样预先思考的能力。

以上是Transformer本可以深谋远虑，但就是不做的详细内容。更多信息请关注PHP中文网其他相关文章！

声明

本文转载于：机器之心。如有侵权，请联系admin@php.cn删除

大多数使用的10个功率BI图 - 分析VidhyaApr 16, 2025 pm 12:05 PM

用Microsoft Power BI图来利用数据可视化的功能在当今数据驱动的世界中，有效地将复杂信息传达给非技术观众至关重要。数据可视化桥接此差距，转换原始数据i

AI的专家系统Apr 16, 2025 pm 12:00 PM

专家系统：深入研究AI的决策能力想象一下，从医疗诊断到财务计划，都可以访问任何事情的专家建议。这就是人工智能专家系统的力量。这些系统模仿Pro

三个最好的氛围编码器分解了这项代码中的AI革命Apr 16, 2025 am 11:58 AM

首先，很明显，这种情况正在迅速发生。各种公司都在谈论AI目前撰写的代码的比例，并且这些代码的比例正在迅速地增加。已经有很多工作流离失所

跑道AI的Gen-4：AI蒙太奇如何超越荒谬Apr 16, 2025 am 11:45 AM

从数字营销到社交媒体的所有创意领域，电影业都站在技术十字路口。随着人工智能开始重塑视觉讲故事的各个方面并改变娱乐的景观

如何注册5天ISRO AI免费课程？ - 分析VidhyaApr 16, 2025 am 11:43 AM

ISRO的免费AI/ML在线课程：通向地理空间技术创新的门户印度太空研究组织（ISRO）通过其印度遥感研究所（IIR）为学生和专业人士提供了绝佳的机会

AI中的本地搜索算法Apr 16, 2025 am 11:40 AM

本地搜索算法：综合指南规划大规模活动需要有效的工作量分布。当传统方法失败时，本地搜索算法提供了强大的解决方案。本文探讨了爬山和模拟

OpenAI以GPT-4.1的重点转移，将编码和成本效率优先考虑Apr 16, 2025 am 11:37 AM

该版本包括三种不同的型号，GPT-4.1，GPT-4.1 MINI和GPT-4.1 NANO，标志着向大语言模型景观内的特定任务优化迈进。这些模型并未立即替换诸如

提示：chatgpt生成假护照Apr 16, 2025 am 11:35 AM

Chip Giant Nvidia周一表示，它将开始制造AI超级计算机（可以处理大量数据并运行复杂算法的机器），完全是在美国首次在美国境内。这一消息是在特朗普总统SI之后发布的

See all articles

热AI工具

热工具

Transformer本可以深谋远虑，但就是不做

热AI工具

Undresser.AI Undress

AI Clothes Remover

Undress AI Tool

Clothoff.io

AI Hentai Generator

热门文章

热工具

禅工作室 13.0.1

SublimeText3 Linux新版

Atom编辑器mac版下载

SublimeText3 Mac版

VSCode Windows 64位下载

热门话题

Transformer本可以深谋远虑，但就是不做

热AI工具

Undresser.AI Undress

AI Clothes Remover

Undress AI Tool

Clothoff.io

AI Hentai Generator

热门文章

热工具

禅工作室 13.0.1

SublimeText3 Linux新版

Atom编辑器mac版下载

SublimeText3 Mac版

VSCode Windows 64位 下载

热门话题

VSCode Windows 64位下载