3140개 매개변수 Grok-1 추론이 3.8배 가속화됨, PyTorch+HuggingFace 버전 출시-일체 포함-php.cn

집

기술 주변기기

일체 포함

3140개 매개변수 Grok-1 추론이 3.8배 가속화됨, PyTorch+HuggingFace 버전 출시

王林

Mar 25, 2024 pm 03:21 PM

ai모델

Musk는 자신이 말한 대로 Grok-1을 오픈소스화했고, 오픈소스 커뮤니티는 열광했습니다.

그러나 Grok-1을 기반으로 변경하거나 상용화하는 데는 여전히 몇 가지 어려움이 있습니다.

Grok-1은 Rust+JAX를 사용하여 구축되었으며 Python+와 같은 주류 소프트웨어 생태계에 익숙한 사용자에게는 임계값입니다. PyTorch+HuggingFace가 높습니다.

3140개 매개변수 Grok-1 추론이 3.8배 가속화됨, PyTorch+HuggingFace 버전 출시

Δ그림: Grok이 GitHub 인기 목록에서 세계 1위를 차지했습니다.

Colossal-AI 팀의 최신 성과는 모든 사람의 긴급한 요구를 해결합니다. 편리하고 사용하기 쉬운 Python+PyTorch+HuggingFace Grok을 제공합니다. -1, 추론을 구현할 수 있어 지연 시간이 거의 4배 빨라집니다!

이제 모델이 HuggingFace와 ModelScope에 게시되었습니다.

HuggingFace 다운로드 링크:
https://www.php.cn/link/335396ce0d3f6e808c26132f91916eae

ModelScope 다운로드 링크:
https://www.php.cn/link/7ae7778c9ae86d2ded133e8 91995dc9e

성능 최적화

AI 대형 모델 시스템 최적화 분야에서 Colossal-AI의 풍부한 축적이 결합되어 Grok-1의 텐서 병렬성을 신속하게 지원했습니다.

단일 8H800 80GB 서버에서 추론 성능을 JAX, HuggingFace의 자동 장치 맵 및 기타 방법과 비교하면 추론 지연 시간이 거의 4배 빨라집니다.

3140개 매개변수 Grok-1 추론이 3.8배 가속화됨, PyTorch+HuggingFace 버전 출시

사용 튜토리얼

Colossal-AI를 다운로드하고 설치한 후 추론 스크립트를 시작하면 됩니다.

./run_inference_fast.sh hpcaitech/grok-1

모델 가중치가 자동으로 다운로드 및 로드되며 추론 결과는 정렬된 상태로 유지됩니다. 아래 그림과 같이 Grok-1 탐욕 검색의 실행 테스트를 보여줍니다.

3140개 매개변수 Grok-1 추론이 3.8배 가속화됨, PyTorch+HuggingFace 버전 출시

자세한 내용은 grok-1 사용 사례를 참조하세요.
https://www.php.cn/link/e2575ed7d2c481c414c10e688bcbc4cf

이 오픈 소스인 xAI가 출시되었습니다. Grok-1 기본 모델 가중치 및 네트워크 아키텍처.

특히 2023년 10월 사전 훈련 단계의 원래 기본 모델은 특정 애플리케이션(예: 대화)에 맞게 미세 조정되지 않았습니다.

구조적으로 Grok-1은 혼합 전문가(MoE) 아키텍처를 채택하고

8명의 전문가를 포함

하며 총 매개변수 양은 314B(3140억)입니다. 토큰 처리 시 전문가 중 2명이 활성화되며 활성화 매개변수는 다음과 같습니다. 금액은 86B입니다. 활성화된 매개변수의 양만 보면 밀도가 높은 모델인 Llama 2의 70B를 넘어섰습니다. MoE 아키텍처에서는 이 정도의 매개변수를 거대괴수라고 불러도 과언이 아닙니다.

추가 매개변수 정보는 다음과 같습니다.

창 길이는 8192 토큰, 정확도는 bf16입니다.

Tokenizer 어휘 크기는 131072(2^17)로 GPT-4에 가깝습니다.
임베딩 크기는 6144입니다. (48×128);
Transformer 레이어 수는 64개이며, 각 레이어에는 멀티 헤드 어텐션 블록과 밀집 블록을 포함하는 디코더 레이어가 있습니다.
키 값 크기는 128입니다. 블록, 48개의 헤드가 쿼리에 사용되고 8은 KV에 사용되며 KV 크기는
dense block(dense Feed-forward block) 확장 계수는 8이고 숨겨진 레이어 크기는 32768

GitHub 페이지의 공식적인 팁은 모델의 대규모(314B 매개변수)로 인해 Grok을 실행하려면 충분한 GPU와 메모리를 갖춘 머신이 필요하다는 것입니다.

3140개 매개변수 Grok-1 추론이 3.8배 가속화됨, PyTorch+HuggingFace 버전 출시 여기서 MoE 계층의 구현 효율성은 높지 않습니다. 이 구현 방법은 모델의 정확성을 확인할 때 커널을 사용자 정의할 필요가 없도록 선택되었습니다.

모델의 체중 파일은

마그넷 링크

형태로 제공되며, 파일 크기는 300GB에 가깝습니다.

Grok-1이

상업 친화적인 3140개 매개변수 Grok-1 추론이 3.8배 가속화됨, PyTorch+HuggingFace 버전 출시 Apache 2.0 라이센스를 사용한다는 점은 언급할 가치가 있습니다.

현재 GitHub에서 Grok-1의 별점은 43.9k 별점에 도달했습니다. Qubit은 Colossal-AI가 가까운 미래에 병렬 가속 및 그래픽 메모리 비용의 정량적 절감과 같은 Grok-1 최적화를 추가로 출시할 것이라는 점을 이해하고 있습니다.

Colossal-AI 오픈 소스 주소:

https://www.php.cn/link/b9531e7d2a8f38fe8dcc73f58cae9530

위 내용은 3140개 매개변수 Grok-1 추론이 3.8배 가속화됨, PyTorch+HuggingFace 버전 출시의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

성명

이 기사는 51CTO.COM에서 복제됩니다. 침해가 있는 경우 admin@php.cn으로 문의하시기 바랍니다. 삭제

관련 기사

최고의 프롬프트 엔지니어링 기술의 최신 연간 편집Apr 10, 2025 am 11:22 AM

내 칼럼을 처음 접할 수있는 분들을 위해, 나는 구체화 된 AI, AI 추론, AI의 첨단 획기적인 혁신, AI 교육, AI의 수비, ai re

유럽의 AI 대륙 행동 계획 : 기가 팩토리, 데이터 실험실 및 녹색 AIApr 10, 2025 am 11:21 AM

유럽의 야심 찬 AI 대륙 행동 계획은 EU를 인공 지능의 글로벌 리더로 설립하는 것을 목표로합니다. 핵심 요소는 AI Gigafactories 네트워크를 만드는 것입니다. 각각 약 100,000 개의 고급 AI 칩을 보유하고 있습니다 - Capaci의 4 배

Microsoft의 간단한 에이전트 스토리가 더 많은 팬을 만들기에 충분합니까?Apr 10, 2025 am 11:20 AM

AI 에이전트 애플리케이션에 대한 Microsoft의 통합 접근 방식 : 비즈니스를위한 명확한 승리 새로운 AI 에이전트 기능에 관한 Microsoft의 최근 발표는 명확하고 통합 된 프레젠테이션에 깊은 인상을 받았습니다. 많은 기술 발표와는 달리 TE에서 멍청한 것입니다

직원에게 AI 전략 판매 : Shopify CEO의 선언문Apr 10, 2025 am 11:19 AM

Shopify CEO Tobi Lütke의 최근 메모는 AI 숙련도가 모든 직원에 대한 근본적인 기대를 대담하게 선언하여 회사 내에서 중요한 문화적 변화를 표시합니다. 이것은 도망가는 트렌드가 아닙니다. 그것은 p에 통합 된 새로운 운영 패러다임입니다

IBM은 전체 AI 통합으로 Z17 메인 프레임을 출시합니다Apr 10, 2025 am 11:18 AM

IBM의 Z17 메인 프레임 : 향상된 비즈니스 운영을 위해 AI를 통합합니다 지난 달, IBM의 뉴욕 본사에서 Z17의 기능을 미리 보았습니다. Z16의 성공을 기반으로 (2022 년에 시작되어 지속적인 수익을 보여주는 시연

5 Chatgpt가 다른 사람에 따라 멈추고 자신을 완전히 믿으라고 프롬프트Apr 10, 2025 am 11:17 AM

흔들리지 않는 자신감을 해제하고 외부 검증의 필요성을 제거하십시오! 이 다섯 개의 chatgpt 프롬프트는 완전한 자립과 자기 인식의 변형적인 변화로 당신을 안내 할 것입니다. 간단히 괄호를 복사, 붙여 넣기 및 사용자 정의하십시오

AI는 당신의 마음과 위험합니다Apr 10, 2025 am 11:16 AM

인공 지능 보안 및 연구 회사 인 Anthropic의 최근 [연구]는 이러한 복잡한 과정에 대한 진실을 밝히기 시작하여 우리 자신의인지 영역과 방해가되는 복잡성을 보여줍니다. 자연 지능과 인공 지능은 우리가 생각하는 것보다 더 유사 할 수 있습니다. 내부 스누핑 : 의인성 해석 가능성 연구 Anthropic이 수행 한 연구에서 얻은 새로운 연구 결과는 AI의 내부 컴퓨팅을 역 엔지니어링하는 것을 목표로하는 기계적 해석 성 분야에서 상당한 발전을 나타냅니다. AI가하는 일을 관찰 할뿐만 아니라 인공 뉴런 수준에서 어떻게 수행하는지 이해합니다. 누군가가 특정한 대상을 보거나 특정한 아이디어에 대해 생각할 때 어떤 뉴런이 발사하는지 그림으로 뇌를 이해하려고한다고 상상해보십시오. 에이

Dragonwing은 Qualcomm의 가장자리 모멘텀을 보여줍니다Apr 10, 2025 am 11:14 AM

Qualcomm 's Dragonwing : 기업 및 인프라로의 전략적 도약 Qualcomm은 새로운 Dragonwing 브랜드를 통해 전 세계적으로 엔터프라이즈 및 인프라 시장을 대상으로 모바일을 넘어 범위를 적극적으로 확장하고 있습니다. 이것은 단지 Rebran이 아닙니다

See all articles

핫 AI 도구

Undresser.AI Undress

사실적인 누드 사진을 만들기 위한 AI 기반 앱

AI Clothes Remover

사진에서 옷을 제거하는 온라인 AI 도구입니다.

Undress AI Tool

무료로 이미지를 벗다

Clothoff.io

AI 옷 제거제

AI Hentai Generator

AI Hentai를 무료로 생성하십시오.

뜨거운 도구

WebStorm Mac 버전

유용한 JavaScript 개발 도구

스튜디오 13.0.1 보내기

강력한 PHP 통합 개발 환경

SublimeText3 영어 버전

권장 사항: Win 버전, 코드 프롬프트 지원!

SublimeText3 Mac 버전

신 수준의 코드 편집 소프트웨어(SublimeText3)

DVWA

DVWA(Damn Vulnerable Web App)는 매우 취약한 PHP/MySQL 웹 애플리케이션입니다. 주요 목표는 보안 전문가가 법적 환경에서 자신의 기술과 도구를 테스트하고, 웹 개발자가 웹 응용 프로그램 보안 프로세스를 더 잘 이해할 수 있도록 돕고, 교사/학생이 교실 환경 웹 응용 프로그램에서 가르치고 배울 수 있도록 돕는 것입니다. 보안. DVWA의 목표는 다양한 난이도의 간단하고 간단한 인터페이스를 통해 가장 일반적인 웹 취약점 중 일부를 연습하는 것입니다. 이 소프트웨어는