搜索
首页科技周边人工智能DeepGemm在DeepSeek开源周的第3天发布

> DeepSeek释放DeepGemm:AI

>的高性能FP8 GEMM库 作为#opensourceweek的一部分,DeepSeek揭开了DeepGemm,这是一个优化的尖端库,可为有效的FP8常规矩阵乘法(GEMMS)优化。 该库支持稠密和混合物(MOE)GEMM,证明对V3/R1型号训练和推理而言是无价的。 DeepGemm旨在显着提高AI工作量的性能和效率,从而加强了DeepSeek对开源创新的承诺。

? #opensourceweek的第3天:deepgemm

介绍DeepGemm - FP8 GEMM库支持密集和Moe Gemms,为V3/R1培训和推理提供动力。

⚡hopper gpus上的最多1350 fp8 tflops

✅最小依赖性,旨在易于使用
✅完全编译的时间……

- DeepSeek(@deepseek_ai)2025年2月26日

此版本是在DeepSeek FlashMl(第1天)和DeepSeek Deepep(第2天)的成功推出之后。 目录的

什么是Gemm?
  • 什么是fp8?
  • 需要deepgemm
  • DeepGemm
  • 的关键特征
  • >
  • >性能基准
  • >安装说明
  • 结论
什么是Gemm?

一般矩阵乘法(GEMM)是一种基本线性代数操作,可乘以两个矩阵以产生第三个矩阵。 它的公式广泛使用,是:

GEMM对于模型性能优化至关重要,尤其是在神经网络培训和推理的深度学习中。 DeepGEMM Released on Day 3 of DeepSeek Open Source Week

>此图表显示了GEMM,突出显示了瓷砖(将矩阵分为较小的块 - mtile,ntile,ktile),以优化加速使用。 这通过增强的数据局部性和并行性提高了性能。

> DeepGEMM Released on Day 3 of DeepSeek Open Source Week

什么是fp8?

> fp8(8位浮点)是一种高性能计算格式,可降低精度和有效的数值数据表示。 这对于处理机器学习中大型数据集的计算需求特别有益。 典型的FP8格式包括:

> 1个标志位

5个指数位

    2个分数位
  • >这种紧凑的结构可实现更快的计算和减少的内存使用情况,非常适合训练大型模型。 虽然精确度可能会略有损害,但这通常是可以接受的,即使是由于计算开销降低而导致性能提高。
  • 此图像将FP8(E4M3和E5M2格式)与FP16和BF16进行了比较,说明了不同浮点格式的精度和范围之间的权衡。

    >

    需要深gemmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmmm的 DeepGemm通过为各种GEMM操作提供轻巧,高性能和用户友好的库来解决矩阵乘法挑战。

    填补了在AI社区中优化FP8 GEMM的关键需求。

    高性能,具有较小的内存足迹。

      支持密集和MOE布局。
    • >对于大型AI模型培训和执行至关重要。
    • >用专门的GEMM类型优化MOE体系结构。
    • 直接增强了DeepSeek的AI模型。
    • 受益于更广泛的AI开发生态系统。
    • DeepGemmMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMMM
    • > DeepGemm的优势包括:
    • 高性能:
    • 在NVIDIA HOPPER GPU上最多可达到1350 FP8 TFLOPS。

    轻量级设计:简化用法的最小依赖项。

    即时汇编:

    在运行时编译内核,以进行简化的用户体验。
    • 简洁的核心逻辑:大约300行的核心代码,表现优于许多专家调整的内核。
    • 支持各种布局:支持密集和两个MOE布局。
    • 性能基准
    • DeepGemm在各种矩阵配置上的效率如下:
    /

    /的自定义样式/ .custom-table { 宽度:100%; 边界爆发:崩溃; /确保边界不要加倍

    / 保证金:20px 0; } .custom-table th,.custom-table TD 边界:1PX实心#000; /

    可见边框

    / 填充:12px; /

    舒适的填充/ 文字平衡:中心; /中心文本/ } .custom-table th { 背景色:#f8f9fa; /浅灰色,用于标头

    / 字体重量:大胆; } /响应式调整/ @Media(最大宽度:768px){ .custom-table th,.custom-table TD 字体大小:14px; /较小的屏幕上的较小文本/ 填充:8px; } } 表1:DeepGemm performance Benchmarks

    表1:

    >安装说明

    DeepGemm安装很简单:

    步骤1:先决条件

    >料斗架构GPU(SM_90A)
    • python 3.8
    • > cuda 12.3(推荐:12.8)
    • >
    • > pytorch 2.1
    • Cutlass 3.6(可以是git子模块)
    步骤2:克隆存储库

    >

    >
git clone --recursive [email protected]:deepseek-ai/DeepGEMM.git
步骤3:安装库

>

>
python setup.py install
步骤4:导入deepgemm

>

有关详细说明,请参见DeepGemm github存储库。
import deep_gemm

结论

DeepGemm是一个高性能的,用户友好的FP8 GEMM库,非常适合高级机器学习任务。 它的轻巧设计,速度和灵活性使其成为AI开发人员的宝贵工具。 检查Analytics Vidhya博客以获取有关DeepSeek的第4天版本的最新信息!

以上是DeepGemm在DeepSeek开源周的第3天发布的详细内容。更多信息请关注PHP中文网其他相关文章!

声明
本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn
特斯拉的Robovan是2024年的Robotaxi预告片中的隐藏宝石特斯拉的Robovan是2024年的Robotaxi预告片中的隐藏宝石Apr 22, 2025 am 11:48 AM

自2008年以来,我一直倡导这辆共享乘车面包车,即后来被称为“ Robotjitney”,后来是“ Vansit”,这是城市运输的未来。 我预见这些车辆是21世纪的下一代过境解决方案Surpas

Sam俱乐部在AI上押注以消除收据检查并增强零售Sam俱乐部在AI上押注以消除收据检查并增强零售Apr 22, 2025 am 11:29 AM

革新结帐体验 Sam's Club的创新性“ Just Go”系统建立在其现有的AI驱动“扫描和GO”技术的基础上,使会员可以在购物旅行期间通过Sam's Club应用程序进行扫描。

Nvidia的AI Omniverse在GTC 2025扩展Nvidia的AI Omniverse在GTC 2025扩展Apr 22, 2025 am 11:28 AM

NVIDIA在GTC 2025上的增强可预测性和新产品阵容 NVIDIA是AI基础架构的关键参与者,正在专注于提高其客户的可预测性。 这涉及一致的产品交付,达到绩效期望以及

探索Google的功能探索Google的功能Apr 22, 2025 am 11:26 AM

Google的Gemma 2:强大,高效的语言模型 Google的Gemma语言模型家族以效率和性能而庆祝,随着Gemma 2的到来而扩展。此最新版本包括两种模型:270亿个参数VER

下一波《 Genai:与Kirk Borne博士的观点》 -Analytics Vidhya下一波《 Genai:与Kirk Borne博士的观点》 -Analytics VidhyaApr 22, 2025 am 11:21 AM

这一领先的数据剧集以数据科学家,天体物理学家和TEDX演讲者Kirk Borne博士为特色。 Borne博士是大数据,AI和机器学习的著名专家,为当前状态和未来的Traje提供了宝贵的见解

AI适合跑步者和运动员:我们取得了出色的进步AI适合跑步者和运动员:我们取得了出色的进步Apr 22, 2025 am 11:12 AM

这次演讲中出现了一些非常有见地的观点——关于工程学的背景信息,这些信息向我们展示了为什么人工智能如此擅长支持人们的体育锻炼。 我将从每位贡献者的观点中概括出一个核心思想,以展示三个设计方面,这些方面是我们探索人工智能在体育运动中应用的重要组成部分。 边缘设备和原始个人数据 关于人工智能的这个想法实际上包含两个组成部分——一个与我们放置大型语言模型的位置有关,另一个与我们人类语言和我们的生命体征在实时测量时“表达”的语言之间的差异有关。 Alexander Amini 对跑步和网球都很了解,但他还

杰米·恩格斯特罗姆(Jamie Engstrom)关于卡特彼勒的技术,人才和转型杰米·恩格斯特罗姆(Jamie Engstrom)关于卡特彼勒的技术,人才和转型Apr 22, 2025 am 11:10 AM

卡特彼勒(Caterpillar)的首席信息官兼高级副总裁杰米·恩格斯特(Jamie Engstrom)领导了一支由28个国家 /地区的2200多名IT专业人员组成的全球团队。 在卡特彼勒(Caterpillar)工作了26年,其中包括她目前的四年半,Engst

新的Google照片更新使任何具有Ultra HDR质量的照片流行新的Google照片更新使任何具有Ultra HDR质量的照片流行Apr 22, 2025 am 11:09 AM

Google Photos的新Ultra HDR工具:快速指南 使用Google Photos的新型Ultra HDR工具增强照片,将标准图像转换为充满活力的高动态范围杰作。对于社交媒体而言,此工具可提高任何照片的影响,

See all articles

热AI工具

Undresser.AI Undress

Undresser.AI Undress

人工智能驱动的应用程序,用于创建逼真的裸体照片

AI Clothes Remover

AI Clothes Remover

用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool

Undress AI Tool

免费脱衣服图片

Clothoff.io

Clothoff.io

AI脱衣机

Video Face Swap

Video Face Swap

使用我们完全免费的人工智能换脸工具轻松在任何视频中换脸!

热工具

mPDF

mPDF

mPDF是一个PHP库,可以从UTF-8编码的HTML生成PDF文件。原作者Ian Back编写mPDF以从他的网站上“即时”输出PDF文件,并处理不同的语言。与原始脚本如HTML2FPDF相比,它的速度较慢,并且在使用Unicode字体时生成的文件较大,但支持CSS样式等,并进行了大量增强。支持几乎所有语言,包括RTL(阿拉伯语和希伯来语)和CJK(中日韩)。支持嵌套的块级元素(如P、DIV),

SublimeText3 英文版

SublimeText3 英文版

推荐:为Win版本,支持代码提示!

WebStorm Mac版

WebStorm Mac版

好用的JavaScript开发工具

SublimeText3 Mac版

SublimeText3 Mac版

神级代码编辑软件(SublimeText3)

SublimeText3 Linux新版

SublimeText3 Linux新版

SublimeText3 Linux最新版