Maison >Périphériques technologiques >IA >ICML 2024 | Points de contrôle de dégradé trop lents ? Sans ralentir ni économiser la mémoire vidéo, LowMemoryBP améliore considérablement l'efficacité de la mémoire vidéo de rétro-propagation

ICML 2024 | Points de contrôle de dégradé trop lents ? Sans ralentir ni économiser la mémoire vidéo, LowMemoryBP améliore considérablement l'efficacité de la mémoire vidéo de rétro-propagation

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBoriginal: 2024-07-18 01:39:51791parcourir

ICML 2024 | 梯度检查点太慢？不降速、省显存，LowMemoryBP大幅提升反向传播显存效率

La rubrique AIxiv est une rubrique où ce site publie du contenu académique et technique. Au cours des dernières années, la rubrique AIxiv de ce site a reçu plus de 2 000 rapports, couvrant les meilleurs laboratoires des principales universités et entreprises du monde entier, favorisant efficacement les échanges et la diffusion académiques. Si vous souhaitez partager un excellent travail, n'hésitez pas à contribuer ou à nous contacter pour un rapport. Courriel de soumission : liyazhou@jiqizhixin.com ; zhaoyunfeng@jiqizhixin.com

Le premier auteur de cet article est Yang Yuchen, étudiant en deuxième année de maîtrise à l'École de statistique et de science des données de l'Université de Nankai, et son conseiller. est professeur agrégé Xu Jun à l'École de statistique et de science des données de l'Université de Nankai. Les recherches de l’équipe du professeur Xu Jun portent sur la vision par ordinateur, l’IA générative et l’apprentissage automatique efficace. Elle a publié de nombreux articles dans des conférences et revues de premier plan, avec plus de 4 700 citations de Google Scholar.

Étant donné que les modèles Transformer à grande échelle sont progressivement devenus une architecture unifiée dans divers domaines, le réglage fin est devenu un moyen important d'appliquer de grands modèles pré-entraînés aux tâches en aval. Cependant, à mesure que la taille du modèle augmente de jour en jour, la mémoire vidéo requise pour le réglage fin augmente également progressivement. Comment réduire efficacement la mémoire vidéo pour le réglage fin est devenu un problème important. Auparavant, lors du réglage fin du modèle Transformer, afin d'économiser la mémoire graphique, l'approche habituelle consistait à utiliser des points de contrôle de gradient (également appelés recalculs d'activation) pour réduire le temps requis dans le processus de rétropropagation (BP) au détriment de la vitesse d'entraînement. . Activez l'utilisation de la mémoire vidéo.

Récemment, l'article "Réduire les frais généraux de mémoire de réglage fin par rétropropagation approximative et de partage de mémoire" publié à l'ICML 2024 par l'équipe du professeur Xu Jun de l'École de statistique et de science des données de l'Université de Nankai a proposé qu'en modifiant la rétropropagation ( BP), sans augmenter la quantité de calcul, l'utilisation maximale de la mémoire d'activation est considérablement réduite.