Latent Space interviews Ethan He, who led Grok Imagine at xAI, about building the product in three months. The episode contrasts video generation with world models and explores why video agent models may become an important next step. It also argues that Grok Imagine remains underrated, while the supplied description does not include architecture details or benchmark results.
Latent Space interviews Biohub’s Alex Rives about ESMFold2 and the broader ESM protein modeling stack. The discussion centers on datasets versus inductive bias, and whether protein biology is entering its own Bitter Lesson era. The key implication is that large-scale evolutionary sequence data and open models may become foundations for structure prediction, interaction modeling, and programmable biology.
Hugging Face 發表 Waypoint-1.5,這是一款專為消費級 GPU 優化的互動式世界模擬器。相較於前代,它在提升視覺與物理保真度的同時,大幅降低了硬體門檻。這讓研究人員與開發者能在單張家用顯示卡上,高效進行具身智能(Embodied AI)與強化學習代理的訓練,加速 AI 與物理世界互動的研究。
Google DeepMind 宣布向美國的 Google AI Ultra 訂閱會員開放「Project Genie」實驗性研究原型。這款工具能讓使用者創造並親自探索無限的互動式世界。用戶只需輸入簡單的提示詞或圖片,系統就能生成可操作、具備物理互動特性的 2D 平台環境,展現了生成式 AI 在遊戲與世界模型(World Models)領域的全新突破。
遊戲與 AI 研發團隊 Overworld 在 Hugging Face 上推出了「Waypoint-1」。這是一項突破性的即時互動式影片擴散(Interactive Video Diffusion)技術,允許使用者透過即時輸入來引導和改變影片生成內容。這項技術展示了「世界模型(World Models)」在未來遊戲開發、虛擬環境模擬與即時互動生成藝術中的巨大潛力。
NVIDIA 於 Hugging Face 宣布推出 Cosmos Reason 2 模型,專為「物理 AI(Physical AI)」與具身智能設計。該模型結合了先進的推理機制,使機器人與自主系統能更深層地理解物理規律、進行複雜的空間時間規劃。此模型的發布將大幅降低開發者構建具備物理常識與決策能力 AI 應用的門檻。
Google DeepMind 發表全新世界模型 Genie 3,為生成式 AI 領域帶來重大突破。該模型能以每秒 24 幀(fps)的即時速度,生成可供用戶自由導航與互動的動態虛擬世界。Genie 3 不僅支援 720p 的高解析度,更能在長達數分鐘的互動過程中,保持場景與物理邏輯的高度一致性,這將為未來的遊戲開發、虛擬實境以及 AI 代理(Agents)的模擬訓練開闢全新途徑。
NVIDIA 在 GTC 2025 針對實體 AI(Physical AI)領域發表重大更新,與 Hugging Face 合作釋出全新開源模型與資料集。這些資源旨在降低具身智慧與機器人開發門檻,涵蓋世界模型、VLA 模型及高質量訓練資料。開發者可直接在 Hugging Face 平台獲取,加速實體世界 AI 應用的落地。