국내 최초 뮤직 SOTA 모델 등장! 중국어에 최적화되어 있으며 무료로 사용 가능하며 장르 제한이 없습니다.-일체 포함-php.cn

집

기술 주변기기

일체 포함

국내 최초 뮤직 SOTA 모델 등장! 중국어에 최적화되어 있으며 무료로 사용 가능하며 장르 제한이 없습니다.

王林

Apr 18, 2024 pm 06:50 PM

산업쿤룬 완웨이차트 그리기티앙공 3.0

"Tiangong" 대형 모델 출시 1주년을 맞아 Kunlun Worldwide는 "Tiangong 3.0" 기본 모델과 "Tiangong SkyMusic" 음악 모델이 공식 베타 버전을 출시했다고 발표했습니다.

AI를 통해 인간은 음악 창작의 자유를 누릴 수 있기 때문에 다툼도 재미있어졌습니다.

과거 X 플랫폼의 유명한 AI 블로거 Aran Komatsuzaki는 다른 AI 과학자인 Gary Marcus에 대한 불만을 표현하기 위해 특별히 노래를 썼고 현재 인기 있는 Suno를 사용하여 생성했습니다. 아시다시피 과거에는 이 거물들 사이의 말싸움은 주로 게시물을 올리는 것이었고 그 다음에는 당신과 내가 후속 조치를 취했습니다. 이번 고마츠자키 아란의 접근 방식은 "고마워요, 고마워요, 디스하고 싶어요"에서 영감을 얻은 것인지도 모르겠습니다.

국내 최초 뮤직 SOTA 모델 등장! 중국어에 최적화되어 있으며 무료로 사용 가능하며 장르 제한이 없습니다.

고마츠자키 아란처럼 음악을 알지만 음악은 모르는 국내외 많은 사람들이 Suno와 같은 AI 음악 창작 도구를 사용하려고 노력하고 있으며 매우 흥미로운 음악 작품을 많이 만들어냈습니다.

그러나 많은 네티즌들은 Suno가 때때로 불안정한 중국어를 생성하고, 중국어 노래가 영어 느낌이 나고, 특이한 단어가 잘못 부르는 등의 문제가 있다고 보고했습니다.

국내 최초 뮤직 SOTA 모델 등장! 중국어에 최적화되어 있으며 무료로 사용 가능하며 장르 제한이 없습니다.

^{영상주소 : https://b23.tv/gVqTUOu}

그럼 특별히 중국어에 최적화된 AI 음악생성 모델이 있을까요?

오늘 Kunlun Wanwei가 공개 베타를 위해 사회 전체에 공개한 "Tiangong SkyMusic"이 바로 그러한 모델입니다. 그것이 생성하는 중국 보컬은 명확하고 정통하며 비정상적인 소리가 없으며 "브로드웨이 스타일 중국 노래"와 같은 적응 문제가 없습니다. 게다가 중국어에 최적화되어 있을 뿐만 아니라 광둥어, 청두어, 베이징어 등의 방언도 처리합니다.

그럼 Suno에 비해 SkyMusic의 성능은 어떤가요? 수평적 평가 데이터에 따르면 SkyMusic은 보컬 및 BGM 음질, 보컬의 자연성, 발음 명료도 등 여러 지표에서 우수한 것으로 나타났습니다. 종합적인 성능은 Suno V3를 능가하며 중국 최초의 음악 AIGC SOTA 모델이기도 합니다. 모델 기술은 AIGC 분야 최초로 세계를 선도합니다.

국내 최초 뮤직 SOTA 모델 등장! 중국어에 최적화되어 있으며 무료로 사용 가능하며 장르 제한이 없습니다.

이러한 뛰어난 성능은 강력한 기본 모델, 즉 Kunlun Wanwei가 동시에 출시하고 오픈 소스로 공개한 대형 모델 "Tiangong 3.0"과 자연스럽게 분리될 수 없습니다. 이 모델은 4,000억 개의 매개변수를 갖고 있으며, 이는 3,140억 개의 매개변수로 Grok-1을 능가하며 세계 최대 오픈 소스 MoE 모델입니다.

국내 최초 뮤직 SOTA 모델 등장! 중국어에 최적화되어 있으며 무료로 사용 가능하며 장르 제한이 없습니다.

MMBench 등 다수의 권위 있는 다중 모드 평가 결과에서 'Tiangong 3.0'은 GPT-4V를 능가하며 세계 1위를 차지했습니다.

국내 최초 뮤직 SOTA 모델 등장! 중국어에 최적화되어 있으며 무료로 사용 가능하며 장르 제한이 없습니다.

이 기본 모델의 지원으로 SkyMusic은 노래에 대한 더 깊은 이해를 갖게 되었습니다. 가사를 통해 감정의 변화를 조절할 수 있고, 비브라토, 오페라, 챈팅 등 다양한 창법을 구현해 생성된 음악 작품을 더욱 감성적으로 풍부하고 상황에 맞게 만들어준다.

그럼 이 모델은 어떻게 사용하나요? 기술적 경로는 무엇입니까? "Tiangong 3.0"의 혁신은 무엇입니까? 하나씩 살펴보겠습니다.

무제한 게임 플레이가 가능한 국내 최초의 음악 SOTA 모델

실제로 SkyMusic을 사용하여 노래를 생성하는 것은 매우 간단합니다. 노래 제목과 가사를 입력하고 참조 트랙을 선택하기만 하면 유사한 스타일과 보컬을 가진 노래가 생성됩니다.

국내 최초 뮤직 SOTA 모델 등장! 중국어에 최적화되어 있으며 무료로 사용 가능하며 장르 제한이 없습니다.

가사를 직접 쓰고 싶지 않다면 입력창 오른쪽 하단에 있는 "AI 작사" 기능을 사용해 보세요. 첫 문장부터 작성할 수 있으며, 한 번에 한 문장만 생성되며, 노래 전체가 완성될 때까지 만족스럽지 못한 문장은 시간 내에 삭제할 수 있습니다.

국내 최초 뮤직 SOTA 모델 등장! 중국어에 최적화되어 있으며 무료로 사용 가능하며 장르 제한이 없습니다.

물론 "Tiangong 3.0"을 사용하여 노래를 작성할 수도 있습니다. 예를 들어 이 노래 "This Site"는 "Tiangong 3.0"을 사용하여 작성되었습니다.

국내 최초 뮤직 SOTA 모델 등장! 중국어에 최적화되어 있으며 무료로 사용 가능하며 장르 제한이 없습니다.

다음 단계는 다음과 같습니다. 참조 곡을 선택하는 것은 SkyMusic의 고유한 기능이기도 합니다. 즉, 샘플 음원을 기반으로 음악을 생성할 수 있습니다.

이 단계에서 SkyMusic은 다양한 참조 트랙을 제공하며, 그 중에서 선택하거나 노래 파일을 업로드하도록 선택할 수 있습니다. 여기서는 생성 효과가 어떤지 확인하기 위해 Luo Tianyi의 노래를 업로드했습니다. 샘플 음원을 기반으로 음악을 생성하는 이 기능은 SkyMusic의 게임 플레이를 크게 향상시켰습니다. 사용자 작품 전시 영역에서는 '신인'(영화 '주추삼악'의 에피소드)에 고대 록과 DJ를 포함한 5가지 버전이 있음을 알 수 있습니다. 시험 과정에서 우리는 실제로 SkyMusic에서 생성한 음악이 랩, 포크, 펑크, 고대 스타일, 일렉트로닉 및 기타 장르를 포괄한다는 사실도 발견했습니다. 다음 단계에서는 사용자가 흥얼거리는 멜로디를 기반으로 노래를 생성할 수 있도록 허용할 계획이며 이는 전문가에게 큰 도움이 될 것입니다.

현재 Tiangong SkyMusic은 "Tiangong" 앱을 다운로드하여 체험하실 수 있습니다. 이는 중국에서 유일하게 공개된 대규모 AI 음악 생성 모델이며, 이 모델의 등장으로 이 분야에서 국내 AIGC 도구의 공백을 메울 수 있습니다.

이 모델은 아직 초기 단계이지만 이미 많은 사람들에게 음악 창작의 즐거움을 경험할 수 있게 해주었습니다. 모든 사람이 이를 사용하여 신극을 변형하고, 두 번째 히트작을 만들고, 교육을 지원하기 위해 고대 시를 다시 쓰고, 음악 창작을 위한 다양하고 새로운 방향을 개발합니다.

자체 개발한 Sora 아키텍처, 기술 로드맵이 공개되었습니다

Tiangong SkyMusic은 엔드 투 엔드 음악 생성 모델이므로 사용하기가 매우 간단하다고 느낍니다. 그러나 전체 모델의 개발은 그렇게 간단하지 않습니다.

먼저 기술적 관점에서 SkyMusic은 대형 모델 음악 오디오 생성 경로를 선택했습니다. 즉, 악보를 생성하기 위해 상징적인 음악 생성 경로(예: MIDI)를 사용하는 대신 오디오 파형을 직접 학습하고 생성한다는 의미입니다. 이 접근 방식을 사용하면 악기, 보컬, 멜로디, 볼륨, 음표 등과 같은 요소의 통합된 엔드투엔드 생성이 가능하여 보다 직접적이고 고품질의 음악 제작 경험을 제공할 수 있습니다. 하지만 이 방향은 더욱 어렵고 높은 컴퓨팅 파워와 자금이 필요하기 때문에 이를 실천하는 사람이 거의 없습니다.

게다가 이 방향에서는 참고할만한 공개 정보나 오픈 소스 모델이 거의 없기 때문에 대부분의 연구는 보컬이 아닌 BGM 분야에 집중됩니다. 이전에. .

이런 압박에도 불구하고 Kunlun Wanwei는 수많은 연구 개발 실험을 수행하고 많은 컴퓨팅 성능을 투자했으며 2천만 곡(인류 역사상 가장 큰 음악 데이터 세트)이 포함된 데이터 세트를 구축하고 마침내 효과를 탐색했습니다. 해결책. 또한 이 솔루션의 기술 개략도도 공개했습니다.

국내 최초 뮤직 SOTA 모델 등장! 중국어에 최적화되어 있으며 무료로 사용 가능하며 장르 제한이 없습니다.

^{Tiangong SkyMusic 기술 도식 다이어그램: 대규모 Transformer는 음악 제어성을 달성하는 동시에 음악 패치의 상황별 종속성을 학습하기 위해 음악을 작곡하는 역할을 담당하며 노래를 부르고 LDM을 통해 음악 패치를 복원할 수 있도록 합니다. 고품질 오디오로. 이 모델 아키텍처는 비디오, 오디오 및 음악을 처리할 때 매우 잘 작동합니다.}

사진에서 볼 수 있듯이 스카이뮤직의 프레임워크는 소라와 비슷한 DiT 기술 경로지만, 개발 시기는 소라가 나오기 전이었기 때문에 많은 함정을 밟을 수밖에 없습니다.

업계에서는 이 도식 다이어그램이 매우 중요합니다. SUNO를 포함하여 기술 경로를 공개한 대규모 AI 음악 모델 회사가 시장에 없기 때문에 Kunlun Wanwei가 유일한 회사이기 때문입니다.

뒤에 있는 강력한 기반 - Tiangong 3.0

SkyMusic의 성공은 그 뒤에 있는 기본 모델인 Tiangong 3.0과 뗄래야 뗄 수 없는 관계입니다. 핵심 업그레이드는 "독립적 사고"에 반영됩니다. 이는 모델의 새로운 다중 라운드 검색 및 포괄적인 도구 호출, 차트 그리기, 연구 모드, 향상 모드 및 기타 기능에 반영됩니다.

데이터 통계 작업을 수행하면 모든 데이터를 수집하는 데 도움이 될 수 있을 뿐만 아니라 자신만의 코드를 작성하고 다양한 함수를 호출하여 차트를 그릴 수도 있습니다. 각 중간 단계는 명확하게 해체되었으며, 후속 실행에는 "라벨 중복 방지" 및 "텍스트 표시 중앙 정렬"과 같은 세부 사항도 고려되었습니다. 이것은 "독립적 사고"능력의 구체화입니다.

이러한 "독립적 사고" 능력의 향상은 의미 이해, 논리적 추론 및 기타 측면에서 "Tiangong 3.0"의 최적화와 불가분의 관계입니다. 이전 세대의 "Tiangong 2.0" MoE 대형 모델에 비해 "Tiangong 3.0"은 모델 의미 이해, 논리적 추론, 다양성, 일반화, 불확실성 지식, 학습 능력 등의 영역에서 놀라운 성능 향상을 보였습니다. 20% 이상 향상되었으며, 수학/추론/코딩/문화 및 창의적 능력이 30% 이상 향상되었습니다.

검색 작업을 예로 들어보세요. "검색 강화" 모드에서 간단한 검색 요청을 하면 "Tiangong 3.0"은 요약 답변을 제공할 뿐만 아니라 일부 중요한 정보를 차트로 세분화합니다.

"Research" 모드에서는 Query에 언급되지 않은 확장 질문에 대해 토론하고 검색할 수 있는 "심층 연구" 모듈도 제공되어 마치 논문을 읽는 듯한 느낌을 줍니다. 마지막으로, 빠른 참조를 위해 이 정보를 마인드 맵으로 구성합니다.

의미론적 이해와 논리적 추론 능력의 획기적인 향상을 바탕으로 "Tiangong 3.0"은 모델이 외부 도구와 정보를 독립적으로 계획하고 호출하고 결합하는 능력에 대한 특별 교육도 수행했습니다. 외부 도구와 정보를 독립적으로 계획하고 호출하고 결합함으로써 산업 연구, 제품 리뷰, 정보 분석 등 다양하고 복잡한 요구 사항을 정확하고 효율적으로 완료하는 데 도움이 될 수 있습니다.

이 독립적인 사고 능력은 대규모 인공 지능 모델에 매우 중요합니다. 첫째, 이 기능을 통해 AI는 직접적인 지시 없이도 자율적인 추론을 수행하여 복잡한 문제를 처리하는 능력을 향상할 수 있습니다. 둘째, 독립적으로 생각하는 AI 모델은 개인화된 시나리오 기반 요구 사항을 충족하는 혁신적인 솔루션을 설계할 수 있습니다. AI는 새로운 환경이나 변화하는 환경에 직면할 때 자체 학습 및 적응을 통해 지속적으로 성능을 최적화할 수 있습니다. 이 세 가지 측면의 누적 효과는 AI 기술 적용의 폭과 깊이를 크게 촉진하여 다양한 실제 응용 분야에서 AI 기술을 더욱 지능적이고 효율적으로 만들었습니다.

"Tiangong 3.0"에는 AI 음악, AI 검색, AI 글쓰기, AI 페인팅 등 다양한 대형 모델 기능이 포함되어 있습니다. 4000억 매개변수 MoE 대형 모델 "Tiangong 3.0"과 Tiangong SkyMusic의 관계에 대해 이야기하면 Kunlun Fang 한완웨이 회장 겸 CEO는 “AI 기반 대형 모델이 AIGC의 탄탄한 기반이라는 것은 누구나 알고 있으며, 특히 텍스트 대형 모델의 경우 빈센트 픽쳐, 빈센트 뮤직, 빈센트 비디오(이러한 AIGC 모델)의 역량이 뛰어나다”고 설명했다. 텍스트 모델 기반입니다. 텍스트 모델 기능이 충분하지 않으면 AIGC 기능이 크게 제한됩니다."

이 효과는 "Tiangong 3.0"의 AI 페인팅 및 기타 기능에도 반영됩니다. 'Tiangong 3.0'에는 이미지 크기 확장, 이미지 방향 조정, 매트 이미지 생성, 매트 이미지 진화, 매트 이미지 확장 등의 새로운 기능이 추가되었으며 실제 테스트 결과가 뛰어납니다.

국내 최초 뮤직 SOTA 모델 등장! 중국어에 최적화되어 있으며 무료로 사용 가능하며 장르 제한이 없습니다.

"저희 4000억 대형 모델은 당사의 모든 C-end 제품을 지원하는 기본 모델입니다. 저의 기본 모델이 좋을수록 저의 음악, 게임, 영상, 애니메이션 제품도 더 좋아질 것입니다. 더 잘하세요. 그래서 우리는 대형 기본 모델을 만들려는 매우 강한 동기를 갖고 있습니다."라고 Fang Han은 말했습니다.

일반 인공 지능 달성,

모든 사람이 자신을 더 잘 형성하고 표현하도록 하세요

AGI의 비전에서 일부 AI 회사 경영진은 AI 도구를 사용하여 인간 사회의 생산성과 효율성을 향상시키고 싶다고 언급하는 것을 자주 듣습니다. . 따라서 그들은 주로 모델 지능의 확장 및 향상에 중점을 둡니다. 그러나 Fang Han의 관점에서는 중요한 문제, 즉 AI를 사용하여 사람들이 감정을 더 잘 이해하고 표현하도록 돕는 방법을 간과했습니다.

스카이뮤직의 음악섹션에서는 졸업을 앞둔 학생들의 슬픔, 사랑을 할 수 없는 청년들의 슬픔, 가족을 부양하는 중년의 피로가 모두 노래를 통해 표현되는 사례를 많이 봤습니다. . 이것이 바로 '자신의 야망을 표현하는 노래'이다.

국내 최초 뮤직 SOTA 모델 등장! 중국어에 최적화되어 있으며 무료로 사용 가능하며 장르 제한이 없습니다.

방언에 대한 지원은 일종의 문화적 평등에 가깝고 Fang Han이 매우 중요하게 생각하는 것입니다. 앞으로는 더 많은 언어를 추가해 작은 언어를 사용하는 모든 사람이 자신만의 문화 콘텐츠를 쉽게 만들 수 있도록 하겠다.

"AIGC 분야에서 우리의 야심찬 목표는 전 세계 모든 사람이 동등하게 콘텐츠를 만들 수 있기를 바라는 것입니다. 우리는 모든 사람이 자신을 더 잘 형성하고 표현할 수 있도록 모든 사람의 창의적 문턱을 낮추고 싶습니다."

최근에는 이 내용이 Kunlun Worldwide의 최신 미션에도 쓰여졌습니다.

국내 최초 뮤직 SOTA 모델 등장! 중국어에 최적화되어 있으며 무료로 사용 가능하며 장르 제한이 없습니다.

실제로 이러한 접근 방식은 상업적으로도 의미가 있습니다. Fang Han은 "모든 사람이 음악을 만들 수 있게 되면 모든 레스토랑, 바 등 모든 공공 장소에서 자신의 비즈니스 요구 사항에 맞는 배경 음악을 만들 수 있다고 믿습니다."라고 설명했습니다.

향후 지속적인 최적화와 개선을 통해 SkyMusic은 점차 모든 사람이 전문적이고 사용하기 쉬운 음악 제작 플랫폼으로 발전할 것입니다.

물론 Kunlun Wanwei의 노력은 음악에만 국한되지 않습니다. "Tiangong 3.0"을 기반으로 6개의 주요 AI 비즈니스 매트릭스를 형성했습니다. 미래에는 이러한 매트릭스가 AI UGC 플랫폼을 구성할 것입니다.

국내 최초 뮤직 SOTA 모델 등장! 중국어에 최적화되어 있으며 무료로 사용 가능하며 장르 제한이 없습니다.

이 플랫폼은 일반 사람들이 자신을 표현하는 데 도움을 줄 수 있을 뿐만 아니라 AI를 사용하여 콘텐츠를 제작하려는 창작자가 IP 창작의 완전히 닫힌 루프를 완성하도록 도울 수 있습니다. 이 폐쇄 루프는 '좋은 이야기(IP)'를 핵심으로 텍스트, 만화, 음악, 비디오 등 다양한 형태를 포괄하며, 소비자의 콘텐츠 소비도 이 플랫폼에서 완성됩니다.

"우리의 본질은 더 많은 사람들이 창작자 팀에 합류할 수 있도록 하는 것입니다. 전제는 좋은 이야기를 할 수 있어야 한다는 것입니다. 좋은 IP를 만들 수 있다면 콘텐츠를 만들 수 있다는 것은 예측 가능합니다. 모든 콘텐츠 산업이 재편될 것이며, 창작자 수도 수백 배로 늘어날 것이고, 소비할 수 있는 콘텐츠도 백배로 늘어날 것입니다. 이는 또한 우리의 "All in AGI 및 AIGC" 전략의 논리이기도 합니다. .

이 시대는 어떤 모습으로 변할 것인가? 두고 보자.

위 내용은 국내 최초 뮤직 SOTA 모델 등장! 중국어에 최적화되어 있으며 무료로 사용 가능하며 장르 제한이 없습니다.의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

성명

이 기사는 机器之心에서 복제됩니다. 침해가 있는 경우 admin@php.cn으로 문의하시기 바랍니다. 삭제