在中國出生、移民至美國念大學與研究所的李飛飛,當年的研究帶動電腦視覺起飛,她透過對圖片內容物做好標記的數據庫ImageNet,從此電腦認的得貓、狗、雨傘,為現在已是AI基本功能的圖像辨識奠定基礎,並帶動AI從機器學習、進入「深度學習」的階段,深度學習成為Transformer、大語言模型橫掃AI世界前最重要的研究領域,她也在2017年1月出任Google Cloud首席科學家,直到2018年底才返回學術圈任教。
現在語言已經成為AI模型發展的基礎,李飛飛並沒有放棄以影像、視覺為主的AI發展道路,她在2024年與其他兩位AI科學家共同創立World Labs,專攻世界模型(World Labs)與空間智慧(Spatial Intelligence)兩種被視為下一階段AI發展的關鍵。
相較於基於語言的大語言模型如ChatGPT、Gemini等是預測「下一個字」,世界模型預測的則是「下一格畫面」,大語言模型用的是大量的現存文字記錄如報章雜誌、書本來訓練,而世界模型則是以照片、影片為最主要訓練資料來源,從物理世界中最基礎的光影、重力、碰撞、3D立體空間出發,世界模型結合自駕車、機器人等實體AI後,將進一步演進成空間智慧,另一個美國AI界的響叮噹人物、前Meta的AI首席科學家楊立昆,離開老東家後也是投入與世界模型相關的技術領域。
從影像、物理出發的世界模型/空間智慧的技術道路,與從文字出發的大語言模型,都走向同樣的實體AI應用,但世界模型/空間智慧在了解與應用3D、物理世界運作邏輯上,比起大語言模型擁有更大的優勢,也讓許多人認為通用AI將是整合世界模型/空間智慧與大語言模型而成,李飛飛更在自己的部落格上表明,光靠語言不足以發展出理解現實的模型,宇宙是由真實的事物組成,從科學、娛樂到機器人,AI要解決的許多重要問題,都需要模型能推理物理世界的結構與行為。
正因為世界模型的潛力無窮,掌握這項AI技術,有機會搶先發展出下一世代AI運算需要的CPU與GPU,以及整個資料中心、邊緣運算的架構,超微宣布以82億美元股票的天價,買下李飛飛所創立的World Labs,而這也是繼2022年超微以500億美元收購FPGA大廠Xilinx後,超微史上第二大規模的併購案。
李飛飛則表示,加入超微可以提供World Labs團隊足夠的資源與工程深度來加速研發,並幫助業界定義下一世代AI所需要的AI基礎建設架構。


