摘要重點
彭博9月7日報導,根據知情人士透露,字節跳動創辦人張一鳴親自監督這款新模型的開發,該模型預計最快將於下個月發布。這位億萬富翁一直在協調公司各業務部門的努力,並投入大量AI資源和運算能力來支援該專案。
但知情人士也表示,發布時間尚未確定,相關計劃可能會有所變動。
據指,該模型基於字節跳動現有的電影級影片生成AI模型Seedance構建,將允許用戶創建用於直播、短劇和遊戲的互動式虛擬世界。字節跳動發言人未對此報導置評。
報導指,張一鳴希望憑藉這款最新的AI模型,並在影片領域頂尖專業知識的挹注下,助字節跳動進軍蓬勃發展的「世界模型」領域。
李飛飛、楊立昆都投入世界模型
世界模型被許多AI先驅認為對於實現機器人、遊戲和自動駕駛汽車來說極為重要,有AI「教母」美稱的史丹佛大學教授李飛飛、圖靈獎得主楊立昆(Yann LeCun)等人已投入該領域的研究工作。
此舉是字節跳動持續策略轉型的一部分,這家總部位於北京的公司正將其大部分B2B業務轉向影片製作和生成。知情人士透露,張一鳴把空間影片模型(Spatial-Video Model)視為一個飛輪,把字節跳動的AI模型和雲端運算資源與其內容平台以及擴展現實部門Pico的硬體連接起來。
🔗 延伸閱讀《一文看懂「世界模型」! 黃仁勳:有助實現AI自主機器人、自駕車》
🔗 延伸閱讀《人物|Meta首席科學家楊立昆獨排眾議 LLM是死胡同!「這模型」才可推動AI發展》
空間智慧模型開闢科技新戰場
空間影片模型又稱空間智慧世界模型(Spatial Intelligence World Model),是目前生成式AI領域最尖端的發展方向,具備3D空間感知與物理幾何推理能力,把用戶置於3D立體世界。
Google今年稍早推出的世界模型「Genie 3」,就是讓用戶能夠與即時渲染的世界進行互動。字節跳動和Google的系統都屬於以影片為中心的策略,目的是建構能夠模擬物理環境供AI代理使用的模型。
如果成功,這種新模型可能會在字節跳動與Meta和iPhone製造商蘋果公司的競爭中開闢新的戰場。這兩家美國科技巨頭都在虛擬實境和混合實境設備領域投入大量資金。Meta一直致力於Quest頭戴式顯示器建構大眾市場生態系統,而蘋果則將Vision Pro定位為高階空間運算平台。但這兩款產品都難以真正走向主流市場。
欲降低虛擬實境 (VR) 的普及成本
字節跳動最新推出的虛擬實境(VR)模型,旨在產生能夠回應Pico頭戴式顯示器用戶語音或動作的虛擬世界。知情人士透露,該模型能夠以每秒20幀的速度,提供延遲約為0.05秒的按需影片,並可用於空間計算環境和介面。
該模型透過將運算密集型的空間內容生成過程轉移到雲端來降低VR的普及成本。這將減少頭戴裝置所需的處理能力,並為更便宜、更簡單的硬體鋪平道路。快速的內容生成也可能有助於將用戶競爭焦點,從硬體規格轉移到AI模型、運算基礎設施和內容分發平台。
儘管字節跳動在中國的AI領域落後於阿里巴巴集團、DeepSeek和月之暗面(Moonshot AI)等競爭對手,但Seedance已成為該公司的標誌性AI成功案例,支撐著字節跳動的一系列產品,包括影片剪輯軟體剪映(CapCut)和中國最受歡迎的AI聊天機器人「豆包」(Doubao)。剪映目前已成為不少獨立電影工作室、內容創作者和新興AI新創公司的首選。


