搜索
首页科技周边人工智能这就是LLM分解语言的方式

揭示了大语言模型的秘密:深入探究令牌化

还记得2020年Openai的GPT-3周围的嗡嗡声吗? GPT-3的出色文本生成功能虽然不是第一个,但它使它成名。从那时起,就出现了无数的大型语言模型(LLM)。但是,LLMS如何像Chatgpt Decipher语言?答案在于一个称为令牌化的过程。

本文从Andrej Karpathy的洞察力YouTube系列中汲取了灵感,“深入研究LLM,例如Chatgpt,”,这是任何寻求更深入了解LLM的人的必看。 (强烈建议!)

在探索令牌化之前,让我们简要检查LLM的内部工作。如果您已经熟悉神经网络和LLM,则跳过前进。

大语言模型内部

llms利用变压器神经网络 - 复杂的数学公式。输入是通过嵌入层处理的令牌(单词,短语或字符)的序列,将其转换为数值表示。这些输入以及网络的参数(权重)被馈入大型数学方程。

现代神经网络拥有数十亿个参数,最初是随机设置的。该网络最初做出随机预测。训练迭代地调整了这些权重,以使网络的输出与培训数据中的模式保持一致。因此,培训涉及找到最佳反映培训数据的统计属性的最佳权重集。

vaswani等人在2017年论文“关注您需要的一切”中引入的变压器体系结构是一个专门为序列处理而设计的神经网络。它最初用于神经机器翻译,现在是LLM的基石。

以目视了解生产级变压器网络,请访问 https://www.php.cn/link/link/link/link/link/link/link/link/link/link/f45333333333333333333361f291b6c11b56.1b74d4d4d4d4d4d4d4d4d。该站点提供了GPT体系结构及其推理过程的交互式3D可视化。

“这是llms的架构,

Tokenization: Breaking Down Text

Training a cutting-edge LLM like ChatGPT or Claude involves several sequential stages. (有关培训管道的更多详细信息,请参见我的上一篇有关幻觉的文章。)

预处理,初始阶段,需要大量的高质量数据集(Terabytes)。这些数据集通常是专有的。作为一个例子,我们将使用拥抱面(在“开放数据共享归因许可证”下可用)的开源FineWeb数据集。 (有关FineWeb创建的更多详细信息。 src =“ https://img.php.cn/upload/article/000/000/000/000/174166081948412.jpg” alt =“这就是LLMS分解语言的方式”/> farce f ins from face f ince of file face f infine> src =“ https://img.php.cn/upload/article/000/000/000/174166082170272.jpg” alt =“这是LLMS分解语言的方式”/>我们的目标是我们的目标是训练神经网络以复制此文本。神经网络需要有限集的一维符号序列。这需要将文本转换为这样的序列。

我们从一维文本序列开始。 UTF-8编码将其转换为原始的位序列。

“

<p “这就是LLMS的方式,就是如何分解语言”/这些数字是任意的识别器。

src =“ https://img.php.cn/upload/article/000/000/000/174166083192550.jpg” alt =“这就是LLMS分解语言的方式”/>此转换是标记。使用字节对编码(BPE)。

bpe识别频繁的连续字节对,并用新符号替换它们。例如,如果经常出现“ 101 114”,则将其替换为新符号。这个过程重复,缩短顺序并扩展词汇。 GPT-4 uses BPE, resulting in a vocabulary of around 100,000 tokens.

Explore tokenization interactively with Tiktokenizer, which visualizes各种模型的令牌化。使用GPT-4的 cl100k_base 在前四个句子上编码:

 <code> 11787,499,21815,369,90250,763,763,14689,14689,30,30,7694 701, 4832, 2457, 13, 9359, 1124, 323, 6642, 264, 3449, 709, 3010, 18396, 13, 1226, 617, 9214, 315, 1023, 3697, 430, 1120, 649, 10379, 83, 3868, 311, 3449, 18570, 1120, 1093,499,0 </code> 

“这就是LLMS的使用方式, cl100k_base 。

这就是LLM分解语言的方式令牌化对于LLMS至关重要,将原始文本转换为神经网络的结构化格式。平衡序列长度和词汇大小是计算效率的关键。像GPT这样的现代LLM使用BPE进行最佳性能。 Understanding tokenization provides valuable insights into the inner workings of LLMs.

Follow me on X (formerly Twitter) for more AI insights!

References

  • Deep Dive into LLMs Like ChatGPT
  • Andrej Karpathy
  • Attention Is All You Need
  • llm可视化(https://www.php.cn/link/f4a75336b061f291b6c11f5e4d6ebf7d)
  • llm幻觉(link_to_to_hallucination_article)
  • huggingfacefw/fineweb·hugging face的数据集(link_to_to_huggingface_fineweb)
  • fineweb:fineweb:fine fineweb:在规模上脱下最佳的文本数据,以下是一个最佳的文本数据, (https://www.php.cn/link/271df68653f0b3c70d446bdcbc6a2715)
  • Open Data Commons Attribution License (ODC-By) v1.0 – Open Data Commons: legal tools for open data (link_to_odc_by)
  • Byte-Pair Encoding tokenization - 拥抱面孔NLP课程(link_to_huggingface_bpe)
  • tiktokenizer(https://wwwwwwwww.php.cn/link/3b8d8348348318987a2f1a39d69d690463a8f)我试图根据要求维护原始格式和图像放置。

以上是这就是LLM分解语言的方式的详细内容。更多信息请关注PHP中文网其他相关文章!

声明
本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn
特斯拉的Robovan是2024年的Robotaxi预告片中的隐藏宝石特斯拉的Robovan是2024年的Robotaxi预告片中的隐藏宝石Apr 22, 2025 am 11:48 AM

自2008年以来,我一直倡导这辆共享乘车面包车,即后来被称为“ Robotjitney”,后来是“ Vansit”,这是城市运输的未来。 我预见这些车辆是21世纪的下一代过境解决方案Surpas

Sam俱乐部在AI上押注以消除收据检查并增强零售Sam俱乐部在AI上押注以消除收据检查并增强零售Apr 22, 2025 am 11:29 AM

革新结帐体验 Sam's Club的创新性“ Just Go”系统建立在其现有的AI驱动“扫描和GO”技术的基础上,使会员可以在购物旅行期间通过Sam's Club应用程序进行扫描。

Nvidia的AI Omniverse在GTC 2025扩展Nvidia的AI Omniverse在GTC 2025扩展Apr 22, 2025 am 11:28 AM

NVIDIA在GTC 2025上的增强可预测性和新产品阵容 NVIDIA是AI基础架构的关键参与者,正在专注于提高其客户的可预测性。 这涉及一致的产品交付,达到绩效期望以及

探索Google的功能探索Google的功能Apr 22, 2025 am 11:26 AM

Google的Gemma 2:强大,高效的语言模型 Google的Gemma语言模型家族以效率和性能而庆祝,随着Gemma 2的到来而扩展。此最新版本包括两种模型:270亿个参数VER

下一波《 Genai:与Kirk Borne博士的观点》 -Analytics Vidhya下一波《 Genai:与Kirk Borne博士的观点》 -Analytics VidhyaApr 22, 2025 am 11:21 AM

这一领先的数据剧集以数据科学家,天体物理学家和TEDX演讲者Kirk Borne博士为特色。 Borne博士是大数据,AI和机器学习的著名专家,为当前状态和未来的Traje提供了宝贵的见解

AI适合跑步者和运动员:我们取得了出色的进步AI适合跑步者和运动员:我们取得了出色的进步Apr 22, 2025 am 11:12 AM

这次演讲中出现了一些非常有见地的观点——关于工程学的背景信息,这些信息向我们展示了为什么人工智能如此擅长支持人们的体育锻炼。 我将从每位贡献者的观点中概括出一个核心思想,以展示三个设计方面,这些方面是我们探索人工智能在体育运动中应用的重要组成部分。 边缘设备和原始个人数据 关于人工智能的这个想法实际上包含两个组成部分——一个与我们放置大型语言模型的位置有关,另一个与我们人类语言和我们的生命体征在实时测量时“表达”的语言之间的差异有关。 Alexander Amini 对跑步和网球都很了解,但他还

杰米·恩格斯特罗姆(Jamie Engstrom)关于卡特彼勒的技术,人才和转型杰米·恩格斯特罗姆(Jamie Engstrom)关于卡特彼勒的技术,人才和转型Apr 22, 2025 am 11:10 AM

卡特彼勒(Caterpillar)的首席信息官兼高级副总裁杰米·恩格斯特(Jamie Engstrom)领导了一支由28个国家 /地区的2200多名IT专业人员组成的全球团队。 在卡特彼勒(Caterpillar)工作了26年,其中包括她目前的四年半,Engst

新的Google照片更新使任何具有Ultra HDR质量的照片流行新的Google照片更新使任何具有Ultra HDR质量的照片流行Apr 22, 2025 am 11:09 AM

Google Photos的新Ultra HDR工具:快速指南 使用Google Photos的新型Ultra HDR工具增强照片,将标准图像转换为充满活力的高动态范围杰作。对于社交媒体而言,此工具可提高任何照片的影响,

See all articles

热AI工具

Undresser.AI Undress

Undresser.AI Undress

人工智能驱动的应用程序,用于创建逼真的裸体照片

AI Clothes Remover

AI Clothes Remover

用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool

Undress AI Tool

免费脱衣服图片

Clothoff.io

Clothoff.io

AI脱衣机

Video Face Swap

Video Face Swap

使用我们完全免费的人工智能换脸工具轻松在任何视频中换脸!

热工具

Atom编辑器mac版下载

Atom编辑器mac版下载

最流行的的开源编辑器

SublimeText3 英文版

SublimeText3 英文版

推荐:为Win版本,支持代码提示!

mPDF

mPDF

mPDF是一个PHP库,可以从UTF-8编码的HTML生成PDF文件。原作者Ian Back编写mPDF以从他的网站上“即时”输出PDF文件,并处理不同的语言。与原始脚本如HTML2FPDF相比,它的速度较慢,并且在使用Unicode字体时生成的文件较大,但支持CSS样式等,并进行了大量增强。支持几乎所有语言,包括RTL(阿拉伯语和希伯来语)和CJK(中日韩)。支持嵌套的块级元素(如P、DIV),

DVWA

DVWA

Damn Vulnerable Web App (DVWA) 是一个PHP/MySQL的Web应用程序,非常容易受到攻击。它的主要目标是成为安全专业人员在合法环境中测试自己的技能和工具的辅助工具,帮助Web开发人员更好地理解保护Web应用程序的过程,并帮助教师/学生在课堂环境中教授/学习Web应用程序安全。DVWA的目标是通过简单直接的界面练习一些最常见的Web漏洞,难度各不相同。请注意,该软件中

MinGW - 适用于 Windows 的极简 GNU

MinGW - 适用于 Windows 的极简 GNU

这个项目正在迁移到osdn.net/projects/mingw的过程中,你可以继续在那里关注我们。MinGW:GNU编译器集合(GCC)的本地Windows移植版本,可自由分发的导入库和用于构建本地Windows应用程序的头文件;包括对MSVC运行时的扩展,以支持C99功能。MinGW的所有软件都可以在64位Windows平台上运行。