GEN-1.5 是什麼?機器人看一次示範就能學新任務,Physical AI 進入實體 Prompt 時代

GEN-1.5 能從 3~12 秒的單次示範學習新任務。本文解析實體 Prompt、成功率、工具使用、模擬轉真實與實際限制。

Share
Generalist GEN-1.5 官方橘色主視覺與 one-shot learner 標題
Generalist 將 GEN-1.5 定位為能從單次示範學習的具身基礎模型。 圖片來源:https://generalistai.com/blog/gen-1.5

想教機器人拉開拉鍊、打開罐子或從錢包取出鈔票,過去通常需要工程師蒐集資料、調整模型,再反覆測試。Generalist 在 2026 年 8 月 19 日公布的 GEN-1.5,嘗試把這段流程縮短成一件更直覺的事:在機器人面前做一次給它看。

GEN-1.5 是一款機器人基礎模型。所謂基礎模型,就是先從大量資料學到通用能力,再用少量示範適應不同任務。官方表示,GEN-1.5 看過 3~12 秒的單次示範後,不必重新訓練,就能立刻嘗試執行新任務。

這項成果值得關注,因為機器人最昂貴的部分之一,往往不是硬體,而是每換一項工作就要重新蒐集資料與寫控制流程。Physical AI 指的是讓 AI 不只處理螢幕中的資訊,還能控制機器在真實環境工作。若「示範一次」真的能取代部分專業設定,機器人導入新工作的時間與成本都可能下降。

不過,這還不是看一次就能穩定做任何事的通用型機器人。官方在 10 種短流程任務中測得的單次示範平均成功率為 59%,而且所有數據都來自 Generalist 自己的研究。我的判斷是,GEN-1.5 是 Physical AI 的重要研究進展,但現階段更像一個值得追蹤的技術轉折點,而不是能立刻取代人力的成熟產品。

GEN-1.5 是什麼?

GEN-1.5 是 Generalist 開發的具身基礎模型。具身 AI(Embodied AI)指的是能透過攝影機與感測器理解環境,並控制機器人在真實世界採取行動的 AI。它和 ChatGPT 這類語言模型最大的差別,是輸出不只是一段文字,而是機器手臂每一刻該如何移動。

根據官方說明,GEN-1.5 會同時處理影片、語言、機器人自身姿態與其他感測資料。模型保留 30 秒的記憶範圍,並以每秒 100 次的頻率產生動作軌跡,持續根據眼前變化修正動作。

這種持續觀察、行動、再修正的方式稱為閉迴路控制。白話來說,機器人不是看完畫面後一次把整套動作播完,而是每走一步都會重新確認物品與手的位置。當拉鍊沒有拉開、積木滑動或工具被擋住時,模型才有機會在過程中補救。

GEN-1.5 的核心能力可以整理成以下幾項:

能力 官方測試方式 對使用者的意義
單次情境學習 看 3~12 秒的一次示範,不更新模型參數 示範後就能立刻嘗試,不必先等待訓練
少樣本適應 使用 1~5 分鐘資料,進行 1~10 次模型調整 以少量資料換取較高成功率
組合任務 把兩段獨立示範接在同一個記憶範圍 模型自行補上換手、重新抓取與銜接動作
模擬轉真實 用模擬環境中的動作提示真實機器人 部分示範資料可能不必在實體機器上蒐集
跨形體模仿 觀察人手動作後,由機器手重現 人不一定需要操作相同的機器人硬體
即興與工具使用 任務條件改變後改用香蕉、畚箕等物品 模型嘗試保留目標,而非死背固定軌跡

真正的新意不是表格中的能力各自第一次出現,而是 Generalist 宣稱同一個模型能跨多種短流程操作展現這些能力。若後續能在更多硬體與真實環境重現,機器人的使用方式可能從「工程師替每個工作寫流程」,轉向「現場人員直接示範工作」。

什麼是一次學習?它和重新訓練有何不同?

GEN-1.5 官方影片顯示不同短流程任務的少樣本學習成功率
官方測試顯示,提供少量任務資料與模型調整後,不同短流程任務的成功率仍有明顯差異。 圖片來源:Generalist 官方研究與發表影片

一次學習(one-shot learning)是讓模型只看一個範例,就推測接下來要完成的任務。GEN-1.5 的做法和在聊天視窗中提供範例相似,只是 Prompt 不再是一段文字,而是人或機器人實際操作物品的影像、感測資料與動作軌跡。

Generalist 把這種方法稱為「實體 Prompt」(physical prompting)。例如,人先用手持夾爪示範如何拉開筆袋,再示範如何從裡面拿出鈔票。模型可以把兩段原本分開的示範放進 30 秒記憶範圍,接著自行完成拉開筆袋、重新調整抓法、伸手取出鈔票的連續動作。

兩段實體 Prompt 被放入模型記憶後,機器人連續完成拉開筆袋與取出鈔票。 影片來源:Generalist 官方研究頁

這和微調模型不同。模型參數是模型內部用來保存所學規律的數值,微調會用新資料更新這些數值,通常需要額外運算與等待時間。實體 Prompt 則把示範暫時放在模型的記憶中,模型參數沒有改變,所以可以立即執行,但學到的技能也較不穩定。

官方數據正好反映這個取捨。在 10 種任務中,只看一次示範、不更新參數的平均成功率為 59%,標準差為 10%。標準差可用來看不同任務的結果分散程度,數字越大,代表各任務表現差異越明顯。若每項任務提供約 5 分鐘、約 50 次示範,再進行 10 次模型調整,平均成功率提高到 83%,標準差為 9%。

GEN-1.5 適應方式 任務資料 模型調整次數 10 種任務平均成功率
單次實體 Prompt 3~12 秒、1 次示範 0 次 59%(±10%)
少樣本適應 每項任務 5 分鐘、約 50 次示範 10 次 83%(±9%)

59% 還不足以支撐多數不能出錯的商業工作,但它證明模型在完全不重新訓練的情況下,已能從單一範例取得可測量的任務能力。83% 則顯示,只要多給幾分鐘資料與少量模型調整,可靠度就能明顯提高。

這對產品設計的啟示很直接:未來的機器人系統不一定要在「立即但不穩」與「訓練很久才可靠」之間二選一。比較實際的流程可能是先示範一次,讓機器人立刻建立基本能力,再把失敗案例累積成少量資料,提高成功率。

從香蕉到畚箕,GEN-1.5 為什麼會自己換工具?

GEN-1.5 使用另一隻機器手排除卡在手指上的積木
當積木卡在機器手上時,GEN-1.5 會嘗試用另一隻手排除障礙。 圖片來源:Generalist 官方研究與發表影片

比起單次學習的數字,GEN-1.5 在任務出現變化時如何處理,更能看出它是否只是在重播動作。

官方先示範用刷子把方塊掃進碗裡,接著把刷子換成其他物品。當模型拿到香蕉時,它把香蕉當成臨時刷子,把方塊推進碗中。拿到畚箕時,它不再照抄「掃」的動作,而是改成鏟起方塊,再倒進碗裡。

模型原本看過刷子示範,工具更換後改用香蕉完成相同目標。 影片來源:Generalist 官方研究頁

在另一個測試中,模型只學過把方塊放進碗裡。研究人員用紙蓋住碗後,機器人會先移開紙、放入方塊,有時還會把紙蓋回去。當積木卡在手指上時,它也會用另一隻手把積木取下。

這些案例的價值不在於機器人會用香蕉,而是它似乎抓到「把方塊移進容器」這個目標,並在原本的動作失效時尋找替代方案。這比固定軌跡更接近真實工作,因為工廠、倉庫與家庭的物品位置不會永遠相同。

但目前還不能把這些展示解讀成機器人已理解所有工具用途。Generalist 表示,研究團隊以語言搜尋比對約 189 萬個預訓練場景,沒有找到相同的畚箕用法,但這不等於能完全排除訓練資料中存在相近行為。更關鍵的驗證,是外部研究者能否用未公開的新工具與新環境重現同樣的即興能力。

模擬轉真實:教機器人的資料,不一定要在現場錄製

蒐集真實機器人資料很慢,也可能造成硬體損耗。模擬環境可以快速生成大量動作,但模擬世界與真實世界的光線、摩擦力、物體重量和感測誤差不會完全相同,這個落差一直是機器人訓練的難題。

GEN-1.5 展示了另一種做法。研究人員先在模擬環境中產生任務示範,再把這段示範當成實體 Prompt,交給真實世界中的機器人。官方表示,GEN-1.5 的預訓練資料沒有模擬影片或模擬動力學資料,但模型仍能依照模擬示範,在真實環境中執行任務,並適應不同機器手、物品位置與尺寸。

GEN-1.5 接收模擬環境示範後,由真實機器人執行任務。 影片來源:Generalist 官方研究頁

這項能力若能擴展,會直接降低資料成本。開發者可以先在模擬器快速建立示範,再到真實環境測試與修正,不必每一個新任務都從實體操作開始。

不過,官方只表示這種方法適用於部分任務。涉及柔軟材質、液體、精密接觸或安全風險的操作,模擬與現實之間的差異可能更大。現階段比較合理的定位,是把模擬當成快速建立初始能力的入口,而不是完全取代真實測試。

GEN-1、GEN-1.5 有什麼差別?

Generalist 在 2025 年 11 月公布 GEN-0,重點是證明機器人的具身模型也會隨資料與運算規模增加而進步。2026 年 4 月推出的 GEN-1,則把焦點放在任務熟練度。官方表示,GEN-1 在部分簡單任務能達到 99% 成功率,但每項成果仍使用約 1 小時的機器人資料進行任務適應。

GEN-1.5 沒有用更高的單一成功率當主角,而是把「學會新任務需要多少資料與時間」往下壓。它能透過數秒示範取得 59% 的初始能力,或用 5 分鐘資料與 10 次模型調整達到 83%。

模型 官方發布時間 主要問題 代表成果
GEN-0 2025 年 11 月 擴大資料是否能讓多項能力一起進步? 官方觀察到機器人預訓練的規模化趨勢
GEN-1 2026 年 4 月 模型能否把簡單任務做到穩定、快速? 部分任務達 99% 成功率,每項約用 1 小時機器人資料
GEN-1.5 2026 年 8 月 模型能否在幾乎沒有任務資料時立刻學習? 3~12 秒示範達 59%,5 分鐘資料與 10 次模型調整達 83%

這三代模型處理的是不同門檻。GEN-1 證明部分短任務可以練到很熟,GEN-1.5 則嘗試證明新任務可以學得很快。真正可用的通用型機器人需要兩者同時成立:第一次接觸任務時能快速上手,部署後也能達到接近零失敗的可靠度。

GEN-1.5 對機器人產業的真正影響

傳統工業自動化很可靠,但通常依賴固定環境、專用夾具與工程師事先寫好的流程。只要產品換型、物品位置改變或任務多一個步驟,設定成本就可能重新出現。

GEN-1.5 展示的是另一種人機介面:使用者不必精確描述每個關節該轉幾度,也不必先寫控制程式,而是直接把工作做一次給機器人看。對許多難以用文字說清楚的動作,例如拉鍊、旋蓋、重新抓取與控制接觸力,示範確實比逐步下指令自然。

因此,我對這條技術路線的看法是中性偏正面。最重要的利多不是某段影片有多流暢,而是適應成本從約 1 小時資料,進一步降到數秒或數分鐘。若這個趨勢持續,機器人供應商就有機會用同一套模型服務更多客戶與任務,不必每次從頭建立專用系統。

目前最大的反方證據也很清楚:59% 的單次示範成功率仍然偏低,83% 也不足以處理會造成產品損壞、人身風險或高額停機成本的工作。研究又集中在拉鍊、旋蓋、移動方塊等短流程桌面任務,還沒有證明模型能連續工作數小時,處理跨空間、多階段且失敗代價更高的流程。

會讓我進一步轉為看多的證據,是第三方在不同機器人硬體上重現結果,並公布長流程任務的成功率、失敗後恢復率、速度與安全介入次數。反過來說,如果能力只在 Generalist 自己的資料、機器手與測試環境成立,GEN-1.5 的商業影響就會比展示影片看起來小很多。

GEN-1.5 目前有哪些限制?

第一,這次成果來自 Generalist 自行設計與執行的測試,尚不是跨研究機構的統一評測。官方有公布資料量、成功率與部分實驗設定,但沒有釋出足以讓外部團隊完整重現的模型與測試環境。

第二,官方明確表示,測試仍是簡單、短流程的操作。拉開拉鍊或把物品放進容器,和整理整間房間、在產線連續工作一班,難度不是同一個等級。任務時間一拉長,每一步的錯誤還可能累積。

第三,單次實體 Prompt 的平均成功率只有 59%。這代表它適合快速建立初始能力與探索可行性,還不適合直接用在高可靠度場景。即使經過少量調整達到 83%,平均每 100 次仍可能有約 17 次失敗。

第四,會操控物品不等於已通過安全部署驗證。真實機器人還需要碰撞偵測、速度與力量限制、急停裝置、工作區隔離與硬體認證。GEN-1.5 研究頁主要討論學習與泛化能力,不能直接拿來證明完整系統已經安全。

第五,Generalist 尚未把 GEN-1.5 公布為一般消費者可購買的產品,也沒有公開定價或開放下載。現階段一般讀者能看到的是研究成果與官方展示,而不是能帶回家教做家事的機器人。

常見問題

GEN-1.5 是什麼?

GEN-1.5 是 Generalist 開發的機器人基礎模型。它能處理影片、感測器、語言與機器人姿態資料,再即時產生控制動作。主要特色是只看一次數秒示範,就能嘗試執行新的短流程任務。

GEN-1.5 真的只看一次就能學會嗎?

可以建立初始能力,但不能理解成一次就能穩定做好。官方在 10 種任務中,以 3~12 秒單次示範測得 59% 平均成功率。提供 5 分鐘資料並進行 10 次模型調整後,平均成功率提高到 83%。

實體 Prompt 是什麼?

實體 Prompt 是把人或機器人的實際操作示範,放進模型的短期記憶中。模型會從影像、感測與動作軌跡推測任務目標,再控制機器人執行,概念上類似在聊天 Prompt 中先放一個範例。

GEN-1.5 和人形機器人是一樣的東西嗎?

不一樣。GEN-1.5 是負責感知與控制的 AI 模型,不是一台特定外型的機器人。官方研究重點之一,就是讓同一個模型適應不同機器手與操作方式。

GEN-1.5 可以用在工廠或家裡嗎?

研究方向涵蓋家庭、倉庫與工廠資料,但這次展示不等於產品已能直接部署。實際使用仍要驗證長時間可靠度、速度、硬體相容性、安全機制與導入成本。

一般人現在可以使用 GEN-1.5 嗎?

目前沒有公開下載、一般使用介面或定價。Generalist 的官方網站提供合作聯絡方式,但 GEN-1.5 仍屬研究與早期商業合作階段。

結語:機器人的 Prompt,開始從文字變成動作

GEN-1.5 最值得注意的地方,不是機器人會拉拉鍊、開罐子或拿香蕉掃方塊,而是教它做新工作的方式正在改變。過去需要工程師寫流程、蒐集大量資料的工作,現在開始可以用幾秒鐘的示範建立初始能力。

這還不是「示範一次就永遠學會」。59% 與 83% 的成功率都提醒我們,快速上手和穩定部署仍是兩件事。但如果下一代模型能同時提高長流程可靠度、跨硬體泛化與安全性,實體 Prompt 可能會成為機器人真正走出實驗室的重要介面。

我的結論是,GEN-1.5 值得關注,但不值得把它包裝成通用型機器人已經完成。現階段最有價值的判斷,是看它能否讓「教機器人工作」從專業工程專案,逐步變成現場人員也能完成的操作。

官方影片

資料來源

Read more

Hermes 推出「Bot Mode」,可以分出不同職能的 Agent Bot 一起工作,還能操作電腦!

Hermes 推出「Bot Mode」,可以分出不同職能的 Agent Bot 一起工作,還能操作電腦!

前兩週大家點擊其他連結的次數都比讀者調查多 XD,還是希望大家能幫我們填一下這份調查。 其實有廠商想藉這次調查提供我們一些 credit 當作獎勵機制,但我們想了很久:上次讀者調查搭 Manus,就很明顯有讀者是為了 Manus 點數才來填的(雖然他們的答案還是有認真填啦),但我們非常希望這份調查不要讓大家帶著嚕羊毛的心態來填,而是變成一次回顧、檢視自己使用 AI 方式的機會,也歡迎已經填寫的讀者們可以分享給自己的同事、朋友一同填寫! 👉 填寫「2026 AI 郵報讀者調查」 填完可以優先拿到完整報告,希望我們可以在AI學習這條路上一起成長。 接下來,就讓我們一起快速掌握本週五件最值得關注的 AI 大事! 本周焦點事件 1. Hermes 推出「Bot Mode」,可以分出不同職能的 Agent Bot 一起工作,還能操作電腦! 2. 支付巨頭 Stripe 收購 AI 聚和器/ 模型市集 OpenRouter,半年身價翻