搜索
首页科技周边人工智能这就是LLM分解语言的方式

揭示了大语言模型的秘密:深入探究令牌化

还记得2020年Openai的GPT-3周围的嗡嗡声吗? GPT-3的出色文本生成功能虽然不是第一个,但它使它成名。从那时起,就出现了无数的大型语言模型(LLM)。但是,LLMS如何像Chatgpt Decipher语言?答案在于一个称为令牌化的过程。

本文从Andrej Karpathy的洞察力YouTube系列中汲取了灵感,“深入研究LLM,例如Chatgpt,”,这是任何寻求更深入了解LLM的人的必看。 (强烈建议!)

在探索令牌化之前,让我们简要检查LLM的内部工作。如果您已经熟悉神经网络和LLM,则跳过前进。

大语言模型内部

llms利用变压器神经网络 - 复杂的数学公式。输入是通过嵌入层处理的令牌(单词,短语或字符)的序列,将其转换为数值表示。这些输入以及网络的参数(权重)被馈入大型数学方程。

现代神经网络拥有数十亿个参数,最初是随机设置的。该网络最初做出随机预测。训练迭代地调整了这些权重,以使网络的输出与培训数据中的模式保持一致。因此,培训涉及找到最佳反映培训数据的统计属性的最佳权重集。

vaswani等人在2017年论文“关注您需要的一切”中引入的变压器体系结构是一个专门为序列处理而设计的神经网络。它最初用于神经机器翻译,现在是LLM的基石。

以目视了解生产级变压器网络,请访问 https://www.php.cn/link/link/link/link/link/link/link/link/link/link/f45333333333333333333361f291b6c11b56.1b74d4d4d4d4d4d4d4d4d。该站点提供了GPT体系结构及其推理过程的交互式3D可视化。

“这是llms的架构,

Tokenization: Breaking Down Text

Training a cutting-edge LLM like ChatGPT or Claude involves several sequential stages. (有关培训管道的更多详细信息,请参见我的上一篇有关幻觉的文章。)

预处理,初始阶段,需要大量的高质量数据集(Terabytes)。这些数据集通常是专有的。作为一个例子,我们将使用拥抱面(在“开放数据共享归因许可证”下可用)的开源FineWeb数据集。 (有关FineWeb创建的更多详细信息。 src =“ https://img.php.cn/upload/article/000/000/000/000/174166081948412.jpg” alt =“这就是LLMS分解语言的方式”/> farce f ins from face f ince of file face f infine> src =“ https://img.php.cn/upload/article/000/000/000/174166082170272.jpg” alt =“这是LLMS分解语言的方式”/>我们的目标是我们的目标是训练神经网络以复制此文本。神经网络需要有限集的一维符号序列。这需要将文本转换为这样的序列。

我们从一维文本序列开始。 UTF-8编码将其转换为原始的位序列。

“

<p “这就是LLMS的方式,就是如何分解语言”/这些数字是任意的识别器。

src =“ https://img.php.cn/upload/article/000/000/000/174166083192550.jpg” alt =“这就是LLMS分解语言的方式”/>此转换是标记。使用字节对编码(BPE)。

bpe识别频繁的连续字节对,并用新符号替换它们。例如,如果经常出现“ 101 114”,则将其替换为新符号。这个过程重复,缩短顺序并扩展词汇。 GPT-4 uses BPE, resulting in a vocabulary of around 100,000 tokens.

Explore tokenization interactively with Tiktokenizer, which visualizes各种模型的令牌化。使用GPT-4的 cl100k_base 在前四个句子上编码:

 <code> 11787,499,21815,369,90250,763,763,14689,14689,30,30,7694 701, 4832, 2457, 13, 9359, 1124, 323, 6642, 264, 3449, 709, 3010, 18396, 13, 1226, 617, 9214, 315, 1023, 3697, 430, 1120, 649, 10379, 83, 3868, 311, 3449, 18570, 1120, 1093,499,0 </code> 

“这就是LLMS的使用方式, cl100k_base 。

这就是LLM分解语言的方式令牌化对于LLMS至关重要,将原始文本转换为神经网络的结构化格式。平衡序列长度和词汇大小是计算效率的关键。像GPT这样的现代LLM使用BPE进行最佳性能。 Understanding tokenization provides valuable insights into the inner workings of LLMs.

Follow me on X (formerly Twitter) for more AI insights!

References

  • Deep Dive into LLMs Like ChatGPT
  • Andrej Karpathy
  • Attention Is All You Need
  • llm可视化(https://www.php.cn/link/f4a75336b061f291b6c11f5e4d6ebf7d)
  • llm幻觉(link_to_to_hallucination_article)
  • huggingfacefw/fineweb·hugging face的数据集(link_to_to_huggingface_fineweb)
  • fineweb:fineweb:fine fineweb:在规模上脱下最佳的文本数据,以下是一个最佳的文本数据, (https://www.php.cn/link/271df68653f0b3c70d446bdcbc6a2715)
  • Open Data Commons Attribution License (ODC-By) v1.0 – Open Data Commons: legal tools for open data (link_to_odc_by)
  • Byte-Pair Encoding tokenization - 拥抱面孔NLP课程(link_to_huggingface_bpe)
  • tiktokenizer(https://wwwwwwwww.php.cn/link/3b8d8348348318987a2f1a39d69d690463a8f)我试图根据要求维护原始格式和图像放置。

以上是这就是LLM分解语言的方式的详细内容。更多信息请关注PHP中文网其他相关文章!

声明
本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn
[带AI的吉卜力风格图像]介绍如何使用Chatgpt和版权创建免费图像[带AI的吉卜力风格图像]介绍如何使用Chatgpt和版权创建免费图像May 13, 2025 am 01:57 AM

OpenAI发布的最新模型GPT-4o,不仅能生成文本,还具备图像生成功能,引发广泛关注。其中最受瞩目的功能便是“吉卜力风格插画”的生成。只需将照片上传至ChatGPT,并给出简单的指令,即可生成宛如吉卜力工作室作品般梦幻的图像。本文将详细解读实际操作流程、效果感受,以及需要注意的错误和版权问题。 OpenAI发布的最新模型“o3”详情请点击此处⬇️ OpenAI o3(ChatGPT o3)详解:特性、定价体系及o4-mini介绍 吉卜力风格文章的英文版请点击此处⬇️ 利用ChatGPT创作吉

解释在地方政府中使用和实施CANTGPT的示例!还介绍了禁止的地方政府解释在地方政府中使用和实施CANTGPT的示例!还介绍了禁止的地方政府May 13, 2025 am 01:53 AM

作为一种新的交流方法,在地方政府中使用和引入Chatgpt引起了人们的关注。尽管这种趋势在广泛的领域正在发展,但一些地方政府拒绝使用Chatgpt。 在本文中,我们将介绍地方政府中ChatGPT实施的示例。我们将通过各种改革实例,包括支持文件创建和与公民对话,从而探索如何通过各种改革实例来实现地方政府服务的质量和效率提高。 不仅旨在减少员工工作量并改善公民的便利性的地方政府官员,而且都对高级用例感兴趣。

chatgpt中的福卡式风格提示是什么?示例句子的详尽解释!chatgpt中的福卡式风格提示是什么?示例句子的详尽解释!May 13, 2025 am 01:52 AM

您是否听说过一个名为“福卡斯提示系统”的框架?诸如ChatGpt之类的语言模型非常出色,但是适当的提示对于发挥其潜力至关重要。福卡(Fukatsu)提示是旨在提高输出准确性的最受欢迎的提示技术之一。 本文解释了福卡式风格提示的原理和特征,包括特定的用法方法和示例。此外,我们还引入了其他众所周知的及时模板和有用的技术来及时设计,因此,根据这些设计,我们将介绍C。

什么是chatgpt搜索?解释主要功能,用法和费用结构!什么是chatgpt搜索?解释主要功能,用法和费用结构!May 13, 2025 am 01:51 AM

CHATGPT搜索:使用创新的AI搜索引擎有效获取最新信息! 在本文中,我们将彻底解释OpenAI提供的新的ChatGpt功能“ ChatGpt搜索”。让我们仔细研究一下功能,用法以及该工具如何根据实时网络信息和直观的易用性来帮助您提高信息收集效率。 chatgpt搜索提供了一种对话互动搜索体验,该体验在舒适,隐藏的环境中回答用户问题,以隐藏广告

易于理解的解释如何在Chatgpt和提示中创建构图!易于理解的解释如何在Chatgpt和提示中创建构图!May 13, 2025 am 01:50 AM

信息爆炸的现代社会,创作出令人信服的文章并非易事。如何在有限的时间和精力内,发挥创造力,撰写出吸引读者的文章,需要高超的技巧和丰富的经验。 这时,作为革命性的写作辅助工具,ChatGPT 备受瞩目。ChatGPT 利用庞大的数据训练出的语言生成模型,能够生成自然流畅、精炼的文章。 本文将介绍如何有效利用 ChatGPT,高效创作高质量文章的技巧。我们将逐步讲解使用 ChatGPT 的写作流程,并结合具体案例,详细阐述其优缺点、适用场景以及安全使用注意事项。ChatGPT 将成为作家克服各种障碍,

如何使用chatgpt创建图!还解释了插图的加载和插件如何使用chatgpt创建图!还解释了插图的加载和插件May 13, 2025 am 01:49 AM

使用AI创建图表的有效指南 视觉材料对于有效传达信息至关重要,但是创建它需要大量时间和精力。但是,由于AI技术(例如Chatgpt和dall-e 3)的兴起,图表创建过程正在发生巨大变化。本文使用这些尖端工具提供了有关有效而有吸引力的图创建方法的详细说明。它涵盖了从想法到完成的所有内容,并包含大量信息,可用于创建图表,从可以使用的特定步骤,提示,插件和API以及如何使用图像一代AI“ dall-e 3.”)

易于理解的解释Chatgpt加上定价结构和付款方式!易于理解的解释Chatgpt加上定价结构和付款方式!May 13, 2025 am 01:48 AM

解锁ChatGPT Plus:费用、支付方式及升级指南 全球瞩目的顶尖生成式AI,ChatGPT已广泛应用于日常生活和商业领域。虽然ChatGPT基本免费,但付费版ChatGPT Plus提供多种增值服务,例如插件、图像识别等,显着提升工作效率。本文将详细解读ChatGPT Plus的收费标准、支付方式及升级流程。 OpenAI最新图像生成技术“GPT-4o图像生成”详情请点击: GPT-4o图像生成详解:使用方法、提示词示例、商业应用及与其他AI的差异 目录 ChatGPT Plus费用 Ch

解释如何使用chatgpt创建设计!我们还介绍了使用和提示示例解释如何使用chatgpt创建设计!我们还介绍了使用和提示示例May 13, 2025 am 01:47 AM

如何使用Chatgpt简化您的设计工作并提高创造力 本文将详细说明如何使用ChatGpt创建设计。我们将介绍在各个设计领域中使用Chatgpt的示例,例如思想,文本生成和网页设计。我们还将介绍点,以帮助您提高各种创意作品的效率和质量,例如图形设计,插图和徽标设计。请看一下AI如何大大扩展您的设计可能性。 目录 chatgpt:设计创建的强大工具

See all articles

热AI工具

Undresser.AI Undress

Undresser.AI Undress

人工智能驱动的应用程序,用于创建逼真的裸体照片

AI Clothes Remover

AI Clothes Remover

用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool

Undress AI Tool

免费脱衣服图片

Clothoff.io

Clothoff.io

AI脱衣机

Video Face Swap

Video Face Swap

使用我们完全免费的人工智能换脸工具轻松在任何视频中换脸!

热门文章

热工具

Dreamweaver Mac版

Dreamweaver Mac版

视觉化网页开发工具

SublimeText3 Mac版

SublimeText3 Mac版

神级代码编辑软件(SublimeText3)

EditPlus 中文破解版

EditPlus 中文破解版

体积小,语法高亮,不支持代码提示功能

MinGW - 适用于 Windows 的极简 GNU

MinGW - 适用于 Windows 的极简 GNU

这个项目正在迁移到osdn.net/projects/mingw的过程中,你可以继续在那里关注我们。MinGW:GNU编译器集合(GCC)的本地Windows移植版本,可自由分发的导入库和用于构建本地Windows应用程序的头文件;包括对MSVC运行时的扩展,以支持C99功能。MinGW的所有软件都可以在64位Windows平台上运行。

SecLists

SecLists

SecLists是最终安全测试人员的伙伴。它是一个包含各种类型列表的集合,这些列表在安全评估过程中经常使用,都在一个地方。SecLists通过方便地提供安全测试人员可能需要的所有列表,帮助提高安全测试的效率和生产力。列表类型包括用户名、密码、URL、模糊测试有效载荷、敏感数据模式、Web shell等等。测试人员只需将此存储库拉到新的测试机上,他就可以访问到所需的每种类型的列表。