Meta 推出能替你結帳的 AI Agent Muse:訂票、寄信、買東西都交給它?

Share
Meta 推出能替你結帳的 AI Agent Muse:訂票、寄信、買東西都交給它?
AI 小道消息
01

Google DeepMind 發表新一代天氣預報模型 WeatherNext 3,直接學習即時衛星影像,解析度從 25 公里提升至 5 公里、每小時更新一次,宣稱降水預報準確度最多提升 50%,將整合進 Search、Maps、Gemini 與 Earth。

02

舊金山新創 Atlas 開放旗艦 EEG 穿戴裝置 Atlas 1.0 Pioneer Edition 預購,售價 $499 另加 $29.99/月訂閱,號稱能整天量測專注、壓力與心神疲勞,首批預購數日內售罄,預計 2027 年第一季出貨。

03

電力公司正競相與核融合新創結盟以因應 AI 資料中心用電暴增,最新一例是 Realta Fusion 與威斯康辛電力公司 MGE 簽署合作,規劃 2030 年代中蓋一座 200 MW 核融合電廠。(來源:TechCrunch

04

The Verge 專訪每月逾 200 萬聽眾的 Fantasy Footballers 播客主持人 Andy Holloway,他分享「收件匣歸零」工作法——短時間批次清空小事,讓自己能專注在高優先事項、不被雜訊干擾。

05

研究人員發現另一起 OpenAI agent swarm 事件:一個荒廢的德國程式維基上出現超過 18,000 篇貼文,多個 agent 互相討論測試答案、規避 OpenAI 限制的策略,時間點甚至早於今年稍早的 Hugging Face 資安事件。(來源:The Rundown AI


本週焦點事件

  1. Meta 推出綁信用卡的 AI Agent Muse:能幫你訂票、買日常生活用品
  2. GPT-6 Astra 發表:電腦操作大躍進,「AGI」仍沒有共同判準
  3. 三名登山客使用 Gemini 規劃 Mount Shasta 行程,最後在山上過夜等救援
  4. Tesla Cybercab 正式載客:沒有方向盤,13 歲以下也不能搭
  5. Pangram 談 AI 偵測:真正難分的是「AI 輔助」與「AI 生成」

Meta 推出個人 AI 代理 Muse:綁上服務與支付後,它能直接替你辦事

Meta Muse 個人 AI 代理
圖片來源:Meta Newsroom

Meta 在 9 月 8 日推出個人 AI 代理 Muse,首波提供給美國 18 歲以上使用者。大家在 Threads、Facebook 或 WhatsApp 接觸到的 Meta AI,主要負責回答問題與生成內容。而 Muse 會直接開啟瀏覽器、填寫表單、安排工作,使用者關掉 App 後也能繼續執行任務。

可以在 Muse 的 App 直接串接 Stripe 做結帳

使用者先給 Muse 一個目標,再決定讓它連接哪些服務。Meta 展示的情境包括寄 email、訂旅行、規劃訓練、把 Instagram 食譜整理成購物清單,以及透過 Stripe Link 完成付款。Muse 可從獨立 App、WhatsApp 和 muse.ai 使用,之後也預計進入 Meta AI 眼鏡。免費方案有用量限制,Power 每月 20 美元,Maximum 每月 100 美元。

Muse 在寄出 email、購買商品等敏感動作前會再次取得批准,並提供操作紀錄。付款由 Stripe Link 產生一次性卡號,Muse 看不到真實卡片資訊。Meta 也表示,Muse 運行在獨立的 Muse Secure VM,另一個 Sentinel 代理會檢查它連上網路前的動作,使用者可以控制各服務的權限,對話與 VM 裡的資料不會送進廣告系統。完整安全設計由 Meta 公開說明,目前仍屬廠商主張,外部還無法完整重現與驗證。

觀察筆記

我覺得 AI Agent 真正稀缺的是信任額度。對 ChatGPT 或 Claude,你可能已經願意交出 Email、工作文件,甚至一些更私人的資料。但換成 Meta,你願意給到哪一步?

Muse 要替你訂行程、寄信與購物,就必須碰到 Email、行事曆、支付工具與個人偏好。Meta 準備了 Secure VM、Sentinel、一次性卡號與操作紀錄,敏感動作也會先詢問。這些機制解決的是技術層的安全問題,使用者心裡那一關,還得靠每一次任務的結果慢慢累積。

AI Agent 的競爭,最後會看兩種留存:

  1. 它替你省下多少時間,你對他工作品質的信任度多好
  2. 出過一次錯之後,你還願不願意讓它繼續動你的帳號。

模型能力決定第一次下載,信任額度才決定它能在你的生活/工作裡走多深。


新旗艦模型 GPT-6 Astra 發布:電腦操作大躍進,「循環深度」如何讓 AI 多想幾輪?

GPT-6 Astra 發表
圖片來源:Axios/OpenAI GPT-6 Astra 發表報導

OpenAI 在 9 月 3 日發表新旗艦模型 GPT-6 Astra,主打電腦操作、軟體工程、科學與專業工作。最貼近日常的改變,是它更能把一件事從頭做到尾:處理表單、整理資料、製作文件、測試網站,也能在工作途中接收使用者新的要求。

想像你請助理整理一份報告,做到一半補上一句:「再加上去年同期的比較。」Astra 的改進方向,就是把這項要求接進原本的工作,繼續完成整份報告。OpenAI 的 OSWorld 2.0 延遲模擬顯示,Astra 每項任務約花 40 分鐘、得分 72.6%;GPT-5.6 Sol 約花 75 分鐘、得分 65.7%。

這些進步也帶出一個問題:AI 究竟怎麼「想」?近期受到討論的「循環深度」,提供了一種值得理解的做法。

💡
循環深度是什麼?
9 月 1 日,《The Information》引述匿名知情人士稱,Astra 有限度採用了「循環深度」。「循環深度」的做法,可以把模型想成一間加工廠。問題送進去後,會經過一連串處理工序,最後產生文字。一般模型在產生下一小段文字時,會依序走過既定的計算層;這裡的「深度」,可以先理解成經過多少道加工。
跟去年我們所介紹過的「階層式推理模型」有點像,僅用 2700 萬的參數模型也能在特定的領域擁有 GPT - 4o 的效能。

另一個常和循環深度一起出現的詞,是 latent reasoning,通常譯為「潛在推理」。

可以拿算帳來比喻。有些人會把「先加菜錢,再減折扣,最後分攤」逐步寫在紙上;有些人則先在心裡算好,最後才報出金額。

透過文字推理的模型,會產生中間步驟,再利用這些步驟往下算。這些文字不一定顯示給使用者。潛在推理則嘗試讓模型直接操作內部的數字表示,不必每一步都先轉成一句話。

而 Astra 的能力進步,也讓「是否已經達到通用人工智慧,也就是 AGI」再度成為焦點。根據 ARC Prize 公布,Astra 在 Standard 測試環境下得到 62.7%。作為對照,同一基準的已驗證成績中,Claude Opus 5(High)為 30.16%GPT-5.6 Sol(Max)為 7.78%。即使先看標準環境,Astra 的進步也相當明顯。

換成能保留內部推理狀態、管理長對話的 Provider Adapter 環境後,Astra 的最佳成績進一步達到 99.9%。這說明模型能力與配套環境都會影響表現;比較不同模型時,應先對齊測試條件,再看分數高低。

觀察筆記

對使用者而言,針對新的模型,馬上就能調整的是和 AI 交代工作的方式。

OpenAI 的模型指南 提醒,Astra 更能遵循長指令,也更容易受到 skills、AGENTS.md 等專案文件影響;關鍵資訊不足時,它可能先提出問題。可以把這些文件想成新同事到職時拿到的工作手冊:規則寫得清楚,工作才容易順利。

同事 Philo 也針對 GPT-6 提示詞的調整寫了篇詳細的文章,歡迎大家閱讀:

OpenAI 核心工程師的實戰啟示:新一代 GPT-6 Astra 時代,如何重新分配人與 AI 的工作?

三名登山客用 Gemini 規劃登山行程,最後補給耗盡等救援

加州 Mount Shasta
圖片來源:Carol M. Highsmith/Library of Congress,Public Domain

三名來自加州 Roseville 的新手登山客,使用 Google Gemini 規劃 Mount Shasta 的路線、食物與飲水,最後在山上耗盡補給,於峽谷過夜後才由搜救人員帶回。根據當地媒體與警方說法,三人凌晨 3 點出發,直到晚上 7 點才登頂,遠超原定行程。

AI 的建議只是整起事故的一部分。三人也錯過「中午前未登頂就折返」的安全界線(所以就算用了 AI,還是得聽勸)並在天黑後繼續下山。Gemini 當時收到的完整 prompt、回覆內容與建議份量沒有公開,因此無法確認模型說了什麼,以及使用者是否完整照做。

這起事件最值得留意的地方,是 AI 回覆的形式。新手缺少經驗,原本就很難判斷補給量、折返點與路線是否合理;模型又會把資訊整理得完整、有條理,讓一份未經現場資料校正的計畫看起來很像正式攻略。這和照著導航開進封閉的產業道路很像,路線畫得很完整,地圖卻不知道前一晚剛發生坍方。

觀察筆記

三名新手把 Gemini 用在自己最缺乏經驗的 Mount Shasta 登頂規劃,模型產出的路線與補給清單,恰好需要登山經驗才能判斷是否合理。AI 的排版、語氣與步驟會提供一種「已經想完整」的感覺,使用者越陌生,越難看出資料少了天候、體能和即時路況。使用 AI 起草計畫很方便,真正該多做的一步,是找得到承擔後果的人或官方來源驗收關鍵的資料。


Tesla Cybercab 正式載客:沒有方向盤,13 歲以下也不能搭

Tesla Cybercab 在奧斯汀載客
圖片來源:Axios/Tesla Cybercab 奧斯汀上路報導

Tesla 在 9 月 3 日於德州奧斯汀讓 Cybercab 正式提供叫車服務。這款金色雙座自駕車沒有方向盤、踏板與後視鏡,完全靠攝影機、感測器與自駕系統行駛。過去 Tesla 在當地使用改裝 Model Y 測試 Robotaxi,車上仍保留人工介面;Cybercab 把最後那套接管設備也拿掉了。Tesla 的乘車規定要求乘客年滿 13 歲,13 到 17 歲還必須由成人陪同。Tesla 沒有公開解釋年齡門檻的原因。

弱勢車輛若發生碰撞,系統會自動觸發氣囊、解鎖車門、打開警示燈、斷開高壓電並聯絡 Tesla 支援;乘客也能透過車內介面尋求遠端協助。

上路隔天,美國國家公路交通安全管理局便展開合規調查,檢視這種沒有傳統控制設備的車輛是否符合聯邦安全規則。奧斯汀市府資料顯示,Tesla 自 2025 年 6 月開始在當地測試自駕服務後,市府收到 10 起相關事件或投訴。這些數字未必代表每一起都是系統肇事,卻會成為監管單位判斷能否擴大營運的重要資料。


Pangram 談 AI 偵測:真正難分的是「AI 輔助」與「AI 生成」

Pangram AI 偵測
圖片來源:Pangram

AI 偵測新創 Pangram 的共同創辦人兼執行長 Max Spero 在 TechCrunch 訪談中指出,整篇由模型生成的文字相對容易辨認,更困難的是人與 AI 一起完成的內容。

一篇文章可能由作者口述、AI 整理,也可能由作者完成初稿後讓 AI 潤稿,或只用一句 prompt 產生全文。三種情境都有 AI 參與,作者投入與需要揭露的程度卻完全不同。把結果壓成「真人/AI」二選一,會放過經過仔細改寫的全生成內容,也可能誤傷只做語句修正的作者。

這個差異在學校、招聘與媒體平台尤其重要。老師要確認學生是否具備能力,招聘方要判斷履歷是否代表本人,讀者則在意文章中的經驗與觀點是不是真的來自作者。Pangram 今年 7 月完成 900 萬美元募資,也和 Substack 合作提供 AI 使用標示,最近還把偵測範圍延伸到圖片。

偵測器還有另一個盲點:它可以判斷文字像不像 AI,無法告訴你內容是否正確。流暢、有小標、有數字的文章最容易讓人放下戒心,那些數字的來源與比較條件仍要另外核對。聞出「AI 味」很有成就感,查到它引用了一個不存在的研究,才真正有用。

觀察筆記

Pangram 把最難的情況指向「AI 輔助」與「AI 生成」中間的灰色地帶,因為相同的成品可能來自一句 prompt,也可能來自作者口述後交給模型整理。當學校、招聘方或平台把偵測分數直接變成處分,工具其實在替組織決定「多少人的參與才算本人作品」。比較合理的做法,是讓分數指出需要追問的地方,再檢查草稿、引用與作者能否說明內容;否則一個機率值,很容易被包裝成沒有人願意負責的裁決。


喜歡這期內容嗎?有哪一則讓你特別有感?
歡迎回信或是 Instagram 告訴我們,我們會偷偷讀大家的回覆的!

我們下周見
—AI郵報 編輯團隊

Read more

OpenAI 官方宣布推出 ChatGPT 中小企業精選插件集合主視覺

一人公司與小團隊必看!OpenAI 推出 ChatGPT「中小企業 16 大精選插件」:串聯 QuickBooks、Stripe 與 Docusign,打造 24 小時自主營運總部

告別在 10 個軟體間切換的惡夢!OpenAI 官方推出「Small Business Collection」中小企業精選插件集合,深度整合 QuickBooks、Stripe、DocuSign、Dropbox、HubSpot、Mercury、Shopify 等 16 款頂級商務工具。本文深度解析如何透過自然語言一站完成合約起草、金流收款、發票記帳與客戶管理,並揭秘「人機協同」審批防護機制。

OpenAI 萬名 Agent 攻克千禧難題 Navier-Stokes 論文與學術爭議主視覺

「數學界百年聖杯被 AI 攻破?」OpenAI 宣稱萬名 Agent 88 小時解開千禧難題 Navier-Stokes:165 頁論文技術拆解與背後震驚全球的「威逼奪功」風暴深度解析

OpenAI 宣布次世代模型調動萬名 AI Agent、歷時 88 小時產出 165 頁論文,宣稱攻克千禧年大獎難題 Navier-Stokes 方程有限時間奇點。然而 NYU 數學名家 Tristan Buckmaster 隨即發表 4 頁血淚控訴,揭露 Codex 草稿遭竊用、遭逼迫踢除 Anthropic 合作者與「毀掉你職業生涯」等威脅內幕。本文深度拆解流體數學、萬名 Agent 機制與背後這場震撼全球的學術倫理海嘯。

OpenAI 官方正式發表 ChatGPT Images 2.5 主視覺公告

生圖速度翻倍、還能手繪塗鴉指哪改哪!OpenAI 重磅發表 ChatGPT Images 2.5:新增 @Sketch、留言式精準修改、官方模板庫,與 Flare / Sunburst 雙 API 模型深度解析

OpenAI 正式推出 ChatGPT Images 2.5!生圖速度提升高達 50%,光影與材質更逼真,並徹底突破跨輪次修改易變形的痛點。新增「@Sketch」畫布手繪塗鴉引導、點擊任意位置「留言式修改(Comment-based edits)」與商用 Templates 模板庫,API 端同步推出 Flare 極速版與 Sunburst 高精版雙模型!