物理人工智慧(AI)系統仰賴世界模型來感知、推理並預測物理環境。然而,真實世界廣闊、難以預測且持續變動。
無論是於倉庫中移動的機器人,或監控工廠現場的攝影機網路,物理 AI 系統都必須了解當下情況,推理接下來可能發生的事,並迅速採取行動以產生實質影響。迄今為止,要在邊緣端實現這類前沿 AI,往往意味著必須在模型能力與部署效率之間取捨。
現已推出的 NVIDIA Cosmos 3 Edge 有助於消除這項取捨。這款擁有 40 億參數的全模態模型,針對記憶體高效部署與高輸送量進行最佳化,可在 NVIDIA Jetson、NVIDIA RTX PRO、NVIDIA DGX 系統及 GeForce RTX GPU 上執行。
作為 NVIDIA Cosmos 3 的延伸,這款精巧的世界基礎模型可理解並生成文字、影像、影片、環境音與動作。其混合 Transformer 架構可在裝置端支援以物理世界為基礎的即時視覺分析與機器人動作。
Cosmos 3 Edge 將前沿物理 AI 帶到邊緣端,在VANTAGE-Bench 的視覺分析成功率評比中,於其參數規模級別排名第一,並可透過後訓練實現先進的機器人學習。
橫跨機器人、自駕車與智慧基礎設施的裝置端物理 AI
開發人員可使用NVIDIA DGX Station 桌上型 AI 超級電腦,以專屬的機器人與感測器資料對 Cosmos 3 Edge 進行後訓練,打造專用的世界動作模型,隨後再將其部署至 NVIDIA Jetson Thor,用於執行包含操作或移動在內的即時機器人控制策略。Agile Robots、斗山機器人、西門子與 Skild AI 等合作夥伴,目前正評估將 Cosmos 3 Edge 應用於機器人工作流程。
在自駕車方面,Cosmos 3 Edge 可在資源受限的硬體上支援道路場景理解、交通推理、物件意圖預測與策略模型蒸餾。該模型可作為車用策略模型蒸餾的學生骨幹(student backbone)模型,包括與 NVIDIA Alpamayo 視覺語言動作模型搭配使用。
在智慧基礎設施方面,Cosmos 3 Edge 透過在 Jetson Thor 上進行即時推論,為視覺代理提供業界同級最佳的輸送量與準確度,這些視覺代理能針對即時影片串流進行推理,應用於交通監控、公共安全、物流及工業檢測等領域。開發人員也可在 NVIDIA Jetson Orin 8GB 上,獨立執行由 NVIDIA Nemotron 驅動的 20 億參數推理模組。Centific、Vaidio 與聰泰科技正評估使用 Cosmos 3 Edge,以加速在邊緣執行的視覺代理。
NVIDIA Cosmos 平台現已開放使用
Cosmos 3 Edge 是用於開發物理 AI 世界模型的 NVIDIA Cosmos 平台一部分。Cosmos 3 提供 Edge(40 億參數)、Nano(160 億參數)與 Super(640 億參數)三種規模,開發人員可依照各開發階段選擇合適的模型,涵蓋從邊緣部署到高擬真生成。
Cosmos 3 Edge、Cosmos 3 Nano 與 Cosmos 3 Super 現已於 Hugging Face 提供,相關的推論與後訓練框架及實作指南亦可於 GitHub 上取得。