搜尋
首頁科技週邊人工智慧通過測試時間培訓生成一分鐘的視頻

這項開創性的研究解決了AI視頻的一個重大障礙:從文本中創建更長的多場景視頻。雖然最近的模型在簡短,視覺上令人驚嘆的剪輯中表現出色,但由於所需的信息量,產生了長達一分鐘的敘述卻帶來了重大挑戰。這種新方法是由Nvidia,Stanford,UC Berkeley等開發的,它利用測試時間培訓(TTT)克服了這些限制。

目錄

  • 長期視頻挑戰
  • TTT:動態解決方案
  • TTT的一分鐘視頻示例
  • TTT的工作原理
  • Tom&Jerry數據集
  • 績效評估
  • 文物和局限性
  • TTT的獨特優勢
  • 未來的研究方向
  • TTT與其他領先模型
  • 結論

長期視頻挑戰

當前的視頻生成模型通常基於變形金剛,由於自我發揮機制的二次計算成本而與更長的視頻鬥爭。生成一分鐘的高分辨率視頻需要處理數十萬個令牌,從而導致效率低下和敘事不一致。儘管Mamba或Deltanet等基於RNN的方法提供線性時間上下文處理,但其固定尺寸的隱藏狀態限制了表現力。

TTT:動態解決方案

這項研究引入了TTT層 - 集成到RNN中的小型,可訓練的神經網絡(MLP)。這些層在推理過程中動態適應,並使用自我監督的損失從不斷發展的視頻上下文中學習。這使該模型可以隨著視頻的進行調整,以改善敘事連貫性和運動平滑度。

通過測試時間培訓生成一分鐘的視頻

TTT的一分鐘視頻示例

研究人員通過從詳細的文本提示中生成一分鐘的Tom&Jerry視頻來展示TTT的功能。與基線模型相比,這些示例展示了提高時間一致性和運動平滑度。

視頻1:傑里偷奶酪

視頻2:湯姆和傑里廚房追逐

視頻3:限制示例

TTT的工作原理

該系統將TTT層結合到預訓練的擴散變壓器模型(Cogvideo-X 5B)中。自我注意力僅限於短段,而TTT層管理全球敘事理解。門控機制可防止早期訓練期間的性能降解。雙向序列處理和場景細分註釋(故事板格式)進一步增強培訓。

通過測試時間培訓生成一分鐘的視頻

通過測試時間培訓生成一分鐘的視頻

Tom&Jerry數據集

該研究利用了源自經典的Tom&Jerry漫畫的數據集,並以詳細的描述為3秒。這種受控的環境簡化了任務,重點是敘事連貫性和運動動態。

通過測試時間培訓生成一分鐘的視頻

績效評估

在人類評估中,TTT-MLP的表現明顯優於基準(Mamba 2,門控的Deltanet),實現了34分ELO得分的提高。它在運動的自然性,時間一致性和整體美學質量上都表現出色。

文物和局限性

儘管取得了進展,但仍然存在諸如不一致的照明和不自然運動之類的偽影。這些可能是由於基本模型的局限性和計算成本所致。雖然比完全自我注意力快,但TTT-MLP比某些RNN方法慢。但是,只需要微調,使其更加實用。

TTT的獨特優勢

  • 通過可訓練的隱藏狀態表達記憶
  • 推理期間的適應性
  • 可擴展性更長,更複雜的視頻
  • 有效的微調

未來的研究方向

未來的工作包括優化TTT內核,嘗試不同的骨幹模型,探索更複雜的故事情節以及使用基於變壓器的隱藏狀態。

TTT與其他領先模型

模型 核心重點 輸入類型 關鍵功能 它與TTT的不同
TTT(測試時間培訓) 具有動態適應的長期視頻生成 文字故事板 在推理期間適應60秒的視頻,連貫的多場景故事 專為長視頻而設計;在發電期間更新內部狀態以換取敘事一致性
摩卡 說話的角色產生 文字演講 語音驅動的全身動畫 專注於角色對話和表達方式,而不是全景敘事視頻
悟空 高質量的視頻和圖像生成 文字,圖像 整流流變壓器,多模式輸入支持 優化質量和訓練速度;不是專為長篇故事設計而設計的
Omnihuman1 現實的人類動畫 圖像音頻文字 多種條件信號,高分辨率化頭像 創造栩栩如生的人;不會建模長序列或動態場景過渡
Dreamactor-M1 圖像對動作(面部/身體) 圖像駕駛視頻 整體運動模仿,高框架一致性 動畫靜態圖像;不使用文字或逐個故事的故事創造

(鏈接到有關摩卡,Dreamactor-M1,Goku和Omnihuman1的相關文章,將在此處插入。)

結論

TTT代表了長期視頻生成的重大進步。它在推斷過程中適應的能力可以使更連貫和引人入勝的講故事,為更複雜的AI生成的媒體鋪平了道路。

以上是通過測試時間培訓生成一分鐘的視頻的詳細內容。更多資訊請關注PHP中文網其他相關文章!

陳述
本文內容由網友自願投稿,版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容,請聯絡admin@php.cn
您必須在無知的面紗後面建立工作場所您必須在無知的面紗後面建立工作場所Apr 29, 2025 am 11:15 AM

在約翰·羅爾斯1971年具有開創性的著作《正義論》中,他提出了一種思想實驗,我們應該將其作為當今人工智能設計和使用決策的核心:無知的面紗。這一理念為理解公平提供了一個簡單的工具,也為領導者如何利用這種理解來公平地設計和實施人工智能提供了一個藍圖。 設想一下,您正在為一個新的社會制定規則。但有一個前提:您事先不知道自己在這個社會中將扮演什麼角色。您最終可能富有或貧窮,健康或殘疾,屬於多數派或邊緣少數群體。在這種“無知的面紗”下運作,可以防止規則制定者做出有利於自身的決策。相反,人們會更有動力製定公

決策,決策……實用應用AI的下一步決策,決策……實用應用AI的下一步Apr 29, 2025 am 11:14 AM

許多公司專門從事機器人流程自動化(RPA),提供機器人以使重複的任務自動化 - UIPATH,在任何地方自動化,藍色棱鏡等。 同時,過程採礦,編排和智能文檔處理專業

代理人來了 - 更多關於我們將在AI合作夥伴旁邊做什麼代理人來了 - 更多關於我們將在AI合作夥伴旁邊做什麼Apr 29, 2025 am 11:13 AM

AI的未來超越了簡單的單詞預測和對話模擬。 AI代理人正在出現,能夠獨立行動和任務完成。 這種轉變已經在諸如Anthropic的Claude之類的工具中很明顯。 AI代理:研究

為什麼同情在AI驅動的未來中比控制者更重要為什麼同情在AI驅動的未來中比控制者更重要Apr 29, 2025 am 11:12 AM

快速的技術進步需要對工作未來的前瞻性觀點。 當AI超越生產力並開始塑造我們的社會結構時,會發生什麼? Topher McDougal即將出版的書Gaia Wakes:

用於產品分類的AI:機器可以總稅法嗎?用於產品分類的AI:機器可以總稅法嗎?Apr 29, 2025 am 11:11 AM

產品分類通常涉及復雜的代碼,例如諸如統一系統(HS)等系統的“ HS 8471.30”,對於國際貿易和國內銷售至關重要。 這些代碼確保正確的稅收申請,影響每個INV

數據中心的需求會引發氣候技術反彈嗎?數據中心的需求會引發氣候技術反彈嗎?Apr 29, 2025 am 11:10 AM

數據中心能源消耗與氣候科技投資的未來 本文探討了人工智能驅動的數據中心能源消耗激增及其對氣候變化的影響,並分析了應對這一挑戰的創新解決方案和政策建議。 能源需求的挑戰: 大型超大規模數據中心耗電量巨大,堪比數十萬個普通北美家庭的總和,而新興的AI超大規模中心耗電量更是數十倍於此。 2024年前八個月,微軟、Meta、谷歌和亞馬遜在AI數據中心建設和運營方面的投資已達約1250億美元(摩根大通,2024)(表1)。 不斷增長的能源需求既是挑戰也是機遇。據Canary Media報導,迫在眉睫的電

AI和好萊塢的下一個黃金時代AI和好萊塢的下一個黃金時代Apr 29, 2025 am 11:09 AM

生成式AI正在徹底改變影視製作。 Luma的Ray 2模型,以及Runway的Gen-4、OpenAI的Sora、Google的Veo等眾多新模型,正在以前所未有的速度提升生成視頻的質量。這些模型能夠輕鬆製作出複雜的特效和逼真的場景,甚至連短視頻剪輯和具有攝像機感知的運動效果也已實現。雖然這些工具的操控性和一致性仍有待提高,但其進步速度令人驚嘆。 生成式視頻正在成為一種獨立的媒介形式。一些模型擅長動畫製作,另一些則擅長真人影像。值得注意的是,Adobe的Firefly和Moonvalley的Ma

Chatgpt是否會慢慢成為AI最大的Yes-Man?Chatgpt是否會慢慢成為AI最大的Yes-Man?Apr 29, 2025 am 11:08 AM

ChatGPT用户体验下降:是模型退化还是用户期望? 近期,大量ChatGPT付费用户抱怨其性能下降,引发广泛关注。 用户报告称模型响应速度变慢,答案更简短、缺乏帮助,甚至出现更多幻觉。一些用户在社交媒体上表达了不满,指出ChatGPT变得“过于讨好”,倾向于验证用户观点而非提供批判性反馈。 这不仅影响用户体验,也给企业客户带来实际损失,例如生产力下降和计算资源浪费。 性能下降的证据 许多用户报告了ChatGPT性能的显著退化,尤其是在GPT-4(即将于本月底停止服务)等旧版模型中。 这

See all articles

熱AI工具

Undresser.AI Undress

Undresser.AI Undress

人工智慧驅動的應用程序,用於創建逼真的裸體照片

AI Clothes Remover

AI Clothes Remover

用於從照片中去除衣服的線上人工智慧工具。

Undress AI Tool

Undress AI Tool

免費脫衣圖片

Clothoff.io

Clothoff.io

AI脫衣器

Video Face Swap

Video Face Swap

使用我們完全免費的人工智慧換臉工具,輕鬆在任何影片中換臉!

熱工具

SAP NetWeaver Server Adapter for Eclipse

SAP NetWeaver Server Adapter for Eclipse

將Eclipse與SAP NetWeaver應用伺服器整合。

Atom編輯器mac版下載

Atom編輯器mac版下載

最受歡迎的的開源編輯器

SecLists

SecLists

SecLists是最終安全測試人員的伙伴。它是一個包含各種類型清單的集合,這些清單在安全評估過程中經常使用,而且都在一個地方。 SecLists透過方便地提供安全測試人員可能需要的所有列表,幫助提高安全測試的效率和生產力。清單類型包括使用者名稱、密碼、URL、模糊測試有效載荷、敏感資料模式、Web shell等等。測試人員只需將此儲存庫拉到新的測試機上,他就可以存取所需的每種類型的清單。

禪工作室 13.0.1

禪工作室 13.0.1

強大的PHP整合開發環境

EditPlus 中文破解版

EditPlus 中文破解版

體積小,語法高亮,不支援程式碼提示功能