처음부터 새로 제작된 DeepMind의 새 논문에서는 Transformer를 의사 코드로 자세히 설명합니다.-일체 포함-php.cn

집

기술 주변기기

일체 포함

처음부터 새로 제작된 DeepMind의 새 논문에서는 Transformer를 의사 코드로 자세히 설명합니다.

王林

Apr 09, 2023 pm 08:31 PM

암호deepmind

Transformer는 2017년에 탄생하여 Google이 "Attention is all you need"라는 논문에 소개했습니다. 이 논문에서는 이전 딥러닝 작업에 사용된 CNN과 RNN을 포기합니다. 이 획기적인 연구는 시퀀스 모델링과 RNN을 동일시하던 이전의 생각을 뒤집었고, 현재 NLP에서 널리 사용되고 있습니다. 널리 사용되는 GPT, BERT 등은 모두 Transformer를 기반으로 구축되었습니다.

Transformer 도입 이후 연구자들은 다양한 변형을 제안했습니다. 하지만 Transformer에 대한 모든 사람의 설명은 아키텍처를 구두 형식, 그래픽 설명 등으로 소개하는 것 같습니다. Transformer의 의사코드 설명에 사용할 수 있는 정보가 거의 없습니다.

다음 구절에 표현되어 있습니다. AI 분야의 매우 유명한 연구자가 자신이 생각하기에 매우 잘 쓰여진 논문을 유명한 복잡성 이론가에게 보낸 적이 있습니다. 이론가의 대답은 다음과 같습니다. 논문에서 어떤 정리도 찾을 수 없습니다. 논문이 무엇에 관한 것인지 모르겠습니다.

실무자의 경우 논문이 충분히 자세할 수 있지만 이론가의 경우 일반적으로 더 높은 정밀도가 필요합니다. 어떤 이유로 DL 커뮤니티는 신경망 모델에 의사 코드를 제공하는 것을 꺼려하는 것 같습니다.

현재 DL 커뮤니티에는 다음과 같은 문제가 있는 것 같습니다.

DL 출판물에는 과학적 정확성과 세부 사항이 부족합니다. 딥러닝은 지난 5~10년 동안 매년 수천 편의 논문이 출판될 정도로 큰 성공을 거두었습니다. 많은 연구자들은 이전 모델을 수정한 방법을 비공식적으로만 설명하며, 비공식적인 모델 설명 몇 줄만 포함된 100페이지가 넘는 논문을 사용합니다. 기껏해야 일부 고급 다이어그램, 의사 코드, 방정식, 모델의 정확한 해석에 대한 언급이 없습니다. 어느 누구도 유명한 Transformer와 그 인코더/디코더 변형에 대한 의사 코드를 제공하지 않습니다.

소스 코드 및 의사 코드. 오픈 소스 소스 코드는 매우 유용하지만 수천 줄의 실제 소스 코드와 비교할 때 잘 설계된 의사 코드는 일반적으로 한 페이지보다 적으며 여전히 본질적으로 완전합니다. 누구도 하고 싶지 않은 힘든 일 같았어요.

훈련 과정을 설명하는 것도 마찬가지로 중요하지만 때로는 논문에서 모델의 입력과 출력이 무엇인지, 잠재적인 부작용이 무엇인지 언급조차 하지 않습니다. 논문의 실험 섹션에서는 알고리즘에 무엇이 어떻게 입력되는지 설명하지 않는 경우가 많습니다. 방법 섹션에 몇 가지 설명이 있는 경우 실험 섹션에 설명된 내용과 연결이 끊어지는 경우가 많습니다. 아마도 작성자마다 다른 섹션을 작성했기 때문일 것입니다.

어떤 사람들은 다음과 같이 질문할 수 있습니다. 의사코드가 정말 필요한가요?

DeepMind 연구원들은 의사코드를 제공하면 기사를 읽거나 실제 코드 1000줄을 스크롤하는 것과 비교할 때 의사코드가 모든 중요한 내용을 한 페이지에 압축하여 새로운 변형을 더 쉽게 개발할 수 있다고 믿습니다. 이를 위해 그들은 최근 Transformer 아키텍처를 완전하고 수학적으로 정확한 방식으로 설명하는 "Transformal Algorithms for Transformers"라는 논문을 발표했습니다.

논문 소개

이 기사에서는 Transformer가 무엇인지, Transformer가 훈련되는 방법, Transformer가 사용되는 용도, Transformer의 주요 아키텍처 구성 요소 및 더 유명한 모델의 미리보기를 다룹니다.

처음부터 새로 제작된 DeepMind의 새 논문에서는 Transformer를 의사 코드로 자세히 설명합니다.

논문 주소: https://arxiv.org/pdf/2207.09238.pdf

그러나 이 기사를 읽으려면 독자는 기본 ML 용어와 간단한 신경망 아키텍처에 익숙해야 합니다. (예: MLP) ). 독자의 경우 기사의 내용을 이해한 후 Transformer에 대해 확실히 이해하고 의사 코드를 사용하여 자체 Transformer 변형을 구현할 수 있습니다.

이 문서의 주요 부분은 3-8장으로, Transformer와 그 일반적인 작업, 토큰화, Transformer의 아키텍처 구성, Transformer 훈련 및 추론, 실제 적용을 소개합니다.

처음부터 새로 제작된 DeepMind의 새 논문에서는 Transformer를 의사 코드로 자세히 설명합니다.

논문에서 기본적으로 완전한 의사 코드는 약 50줄인 반면 실제 실제 소스 코드는 수천 줄입니다. 논문에서 알고리즘을 설명하는 의사코드는 간결하고 완전하며 정확한 공식이 필요한 이론 연구자, Transformer를 처음부터 구현하는 실험 연구자에게 적합하며, 정식 Transformer 알고리즘을 사용하여 논문이나 교과서를 확장하는 데에도 유용합니다.

처음부터 새로 제작된 DeepMind의 새 논문에서는 Transformer를 의사 코드로 자세히 설명합니다.

논문에 나온 의사코드 예제

기본 ML 용어와 간단한 신경망 아키텍처(예: MLP)에 익숙한 초보자를 위해 이 백서는 Transformer의 탄탄한 기초를 익히고 이를 사용하는 데 도움이 될 것입니다. 자신만의 Transformer 모델을 구현하기 위한 의사코드 템플릿입니다.

저자 소개

본 논문의 제1저자는 올해 3월 딥마인드에 정식 합류한 연구원 Mary Phuong입니다. 그녀는 오스트리아 과학 기술 연구소에서 박사 학위를 취득했으며 주로 기계 학습에 대한 이론적 연구에 종사했습니다.

처음부터 새로 제작된 DeepMind의 새 논문에서는 Transformer를 의사 코드로 자세히 설명합니다.

이 논문의 또 다른 저자는 DeepMind의 선임 연구원이자 호주 국립 대학교(ANU) 컴퓨터 과학 연구소(RSCS)의 명예 교수인 Marcus Hutter입니다.

처음부터 새로 제작된 DeepMind의 새 논문에서는 Transformer를 의사 코드로 자세히 설명합니다.

Marcus Hutter는 수년 동안 인공 지능의 수학적 이론에 대한 연구에 참여해 왔습니다. 이 연구 분야는 강화 학습, 확률 이론, 알고리즘 정보 이론, 최적화, 검색 및 계산 이론을 포함한 여러 수학 및 계산 과학 개념을 기반으로 합니다. 그의 책인 General Artificial Intelligence: Sequential Decision-Making on Algorithmic Probability는 2005년에 출판되었으며 매우 기술적이고 수학적인 책입니다.

2002년 Marcus Hutter는 Jurgen Schmidhuber 및 Shane Legg와 함께 이상화된 에이전트와 보상 강화 학습을 기반으로 하는 인공 지능 AIXI의 수학적 이론을 제안했습니다. 2009년에 Marcus Hutter는 특징 강화 학습 이론을 제안했습니다.

위 내용은 처음부터 새로 제작된 DeepMind의 새 논문에서는 Transformer를 의사 코드로 자세히 설명합니다.의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

성명

이 기사는 51CTO.COM에서 복제됩니다. 침해가 있는 경우 admin@php.cn으로 문의하시기 바랍니다. 삭제

관련 기사

Let 's Dance : 인간 신경 그물을 미세 조정하기위한 구조화 된 움직임Apr 27, 2025 am 11:09 AM

과학자들은 C. el 그러나 중요한 질문이 발생합니다. 새로운 AI S와 함께 효과적으로 작동하도록 우리 자신의 신경망을 어떻게 조정합니까?

새로운 Google 유출은 Gemini AI의 구독 변경을 보여줍니다Apr 27, 2025 am 11:08 AM

Google의 Gemini Advanced : 수평선의 새로운 가입 계층 현재 Gemini Advanced에 액세스하려면 $ 19.99/월 Google One AI Premium Plan이 필요합니다. 그러나 Android Authority 보고서는 다가오는 변경 사항을 암시합니다. 최신 Google p. 내 코드

데이터 분석 가속이 AI의 숨겨진 병목 현상을 해결하는 방법Apr 27, 2025 am 11:07 AM

고급 AI 기능을 둘러싼 과대 광고에도 불구하고 Enterprise AI 배포 내에서 상당한 도전 과제 : 데이터 처리 병목 현상. CEO는 AI 발전을 축하하는 동안 엔지니어는 느린 쿼리 시간, 과부하 파이프 라인,

Markitdown MCP는 모든 문서를 Markdowns로 변환 할 수 있습니다!Apr 27, 2025 am 09:47 AM

문서 처리는 더 이상 AI 프로젝트에서 파일을 여는 것이 아니라 혼돈을 명확하게 전환하는 것입니다. PDF, PowerPoint 및 Word와 같은 문서는 모든 모양과 크기로 워크 플로우를 범람합니다. 구조화 된 검색

빌딩 에이전트에 Google ADK를 사용하는 방법은 무엇입니까? - 분석 VidhyaApr 27, 2025 am 09:42 AM

Google의 에이전트 개발 키트 (ADK)의 전력을 활용하여 실제 기능을 갖춘 지능형 에이전트를 만듭니다! 이 튜토리얼은 Gemini 및 GPT와 같은 다양한 언어 모델을 지원하는 ADK를 사용하여 대화 에이전트를 구축하는 것을 안내합니다. w

효과적인 문제 해결을 위해 LLM을 통해 SLM 사용 - 분석 VidhyaApr 27, 2025 am 09:27 AM

요약: SLM (Small Language Model)은 효율성을 위해 설계되었습니다. 자원 결핍, 실시간 및 개인 정보 보호 환경에서 LLM (Large Language Model)보다 낫습니다. 초점 기반 작업, 특히 도메인 특이성, 제어 성 및 해석 성이 일반적인 지식이나 창의성보다 더 중요합니다. SLM은 LLM을 대체하지는 않지만 정밀, 속도 및 비용 효율성이 중요 할 때 이상적입니다. 기술은 더 적은 자원으로 더 많은 것을 달성하는 데 도움이됩니다. 그것은 항상 운전자가 아니라 프로모터였습니다. 증기 엔진 시대부터 인터넷 버블 시대에 이르기까지 기술의 힘은 문제를 해결하는 데 도움이되는 정도입니다. 인공 지능 (AI) 및보다 최근에 생성 AI가 예외는 아닙니다.

컴퓨터 비전 작업에 Google Gemini 모델을 사용하는 방법은 무엇입니까? - 분석 VidhyaApr 27, 2025 am 09:26 AM

컴퓨터 비전을위한 Google Gemini의 힘을 활용 : 포괄적 인 가이드 주요 AI 챗봇 인 Google Gemini는 강력한 컴퓨터 비전 기능을 포괄하기 위해 대화를 넘어서 기능을 확장합니다. 이 안내서는 사용 방법에 대해 자세히 설명합니다

Gemini 2.0 Flash vs O4-Mini : Google은 OpenAi보다 더 잘할 수 있습니까?Apr 27, 2025 am 09:20 AM

2025 년의 AI 환경은 Google의 Gemini 2.0 Flash와 Openai의 O4-Mini가 도착하면서 전기가 전환됩니다. 이 최첨단 모델은 몇 주 간격으로 발사되어 비슷한 고급 기능과 인상적인 벤치 마크 점수를 자랑합니다. 이 심층적 인 비교

See all articles

핫 AI 도구

Undresser.AI Undress

사실적인 누드 사진을 만들기 위한 AI 기반 앱

AI Clothes Remover

사진에서 옷을 제거하는 온라인 AI 도구입니다.

Undress AI Tool

무료로 이미지를 벗다

Clothoff.io

AI 옷 제거제

Video Face Swap

완전히 무료인 AI 얼굴 교환 도구를 사용하여 모든 비디오의 얼굴을 쉽게 바꾸세요!

뜨거운 도구

ZendStudio 13.5.1 맥

강력한 PHP 통합 개발 환경

PhpStorm 맥 버전

최신(2018.2.1) 전문 PHP 통합 개발 도구

DVWA

DVWA(Damn Vulnerable Web App)는 매우 취약한 PHP/MySQL 웹 애플리케이션입니다. 주요 목표는 보안 전문가가 법적 환경에서 자신의 기술과 도구를 테스트하고, 웹 개발자가 웹 응용 프로그램 보안 프로세스를 더 잘 이해할 수 있도록 돕고, 교사/학생이 교실 환경 웹 응용 프로그램에서 가르치고 배울 수 있도록 돕는 것입니다. 보안. DVWA의 목표는 다양한 난이도의 간단하고 간단한 인터페이스를 통해 가장 일반적인 웹 취약점 중 일부를 연습하는 것입니다. 이 소프트웨어는