ScienceBuddy 是什麼?PhAI Labs 宣布免費用 GPT-6,雙層自我改進與使用限制

ScienceBuddy 將科研資料、工具執行和互動紀錄放進同一工作區。本文整理免費 GPT-6 公告、論文中的雙層自我改進方法、基準測試結果與使用限制。

Share
ScienceBuddy 的科研工作區、遞迴式工作流程與研究者互動概觀。
ScienceBuddy 官方 overview 圖。圖片 © 2026 XShuhan,依 MIT License 授權。來源與完整授權:https://github.com/Gen-Verse/ScienceBuddy/blob/53177995fd549068cbe25282273bed771e843f50/LICENSE

PhAI Labs 把 ScienceBuddy 介紹成一個能和研究者一起工作的 AI 科研工作區:你可以放入論文、資料或圖表,讓代理檢索資料、執行分析,再檢查它做過哪些步驟。9 月 23 日,PhAI Labs 在 X 上宣布可免費使用 GPT-6,並稱平台有 GPU(圖形處理器,可平行處理大量 AI 計算)加速,且整合 JEV framework。

ScienceBuddy 值得關注的地方,是它嘗試讓研究者的追問、修正與執行結果,逐步改善代理的工作流程和模型。不過,這目前仍是早期研究產品:論文中的自我改進結果來自特定基準任務,也就是用固定題目比較系統表現的測試。真實研究者案例則只有兩個質性示範,著重描述過程而非量化比較。我的判斷是,它值得研究者拿公開或低敏感度材料試用,重要研究結論仍需要專家檢查。

0:00
/0:00

ScienceBuddy 官方科研工作區示範:上傳科學圖、查看分析與執行紀錄,再提出追問。影片 © 2026 XShuhan,依 MIT License 授權。查看原始檔完整授權

ScienceBuddy 是什麼?它怎麼幫忙做研究?

ScienceBuddy 是 PhAI Labs 推出的互動式科研工作區。一般聊天機器人主要回覆文字。ScienceBuddy 還會把研究資料、工具執行和產出的檔案放在同一個任務中,讓研究者可以追問、調整要求,並檢查前面做了什麼。

PhAI Labs 的論文描述,研究者可以上傳文件、表格、生物序列或圖片,要求代理閱讀資料、查找文獻、執行程式與整理結果。工作區的工具目錄涵蓋 22 個功能模組、共 224 種工具,範圍包括基因體、分子與癌症生物學、藥理、影像分析、文獻檢索和資料庫查詢。執行環境支援 Python、R 和 Bash。這些是研究報告描述的能力,實際開放項目仍要看目前的預覽版。

它的流程可以想成「提問、執行、查看、修正」。例如,研究者提供一張免疫訊號圖,代理可以整理相關標的與證據,再讓使用者檢查它查過什麼、哪些資料有找到、哪些地方仍缺證據。工作區也提供執行紀錄與結果檔案,方便研究者追查分析過程。ScienceBuddy 的產品頁目前以預覽介面呈現。PhAI Labs 也明確把它稱為早期產品/研究預覽。

目前較實際的用途,是協助研究者處理資料探索、文獻整理、研究計畫初稿或重複性的分析步驟。研究設計、資料品質與結論仍需要領域專家確認。

免費使用 GPT-6,具體包含什麼?

PhAI Labs 的 X 貼文寫明可在 ScienceBuddy 免費使用 GPT-6,也稱平台有 GPU 加速。這是值得注意的產品訊息,但貼文沒有說明 GPT-6 的具體型號、免費額度、使用期限、排隊規則或 GPU 規格。因此,「免費」適合解讀為目前公告的體驗條件,不代表無限使用或永久免費。未來若使用額度、模型或服務政策改變,就要重新查官方頁面。

貼文也寫了「JEV framework」,卻沒有交代 Jev 在 ScienceBuddy 裡負責哪個環節,或提供可比較的速度與品質數據。PhAI Labs 的產品介紹和研究報告,主要描述科研工具、代理工作流程,以及後面會說明的雙層學習方法。目前公開資料不足以把 JEV 說成 ScienceBuddy 的主模型、科研推理引擎,或某種已量化的加速技術。這項整合值得追蹤,但現階段不宜延伸成貼文沒有提出的效能結論。

另外一個需要分清楚的地方,是免費提供的 GPT-6 服務和論文中的模型實驗並不是同一件事。研究報告的主要任務模型是 Qwen3.5-4B。其中一項工作流程調整實驗,才使用 GPT-6 Astra 作為輔助模型來提出修改建議。這些設定不能直接證明目前預覽版每個對話都由 GPT-6 Astra 執行。

「遞迴式自我改進」到底怎麼運作?

ScienceBuddy 把改進拆成兩個互相銜接的迴圈。第一個迴圈先改代理的工作手冊,第二個迴圈再訓練負責執行工作的模型。

ScienceBuddy 論文方法圖:研究者互動資料進入內層工作流程修訂,再進入外層模型訓練與重新評估。
ScienceBuddy 官方方法圖,呈現工作流程改進與模型訓練如何交替進行。圖片 © 2026 XShuhan,依 MIT License 授權。查看原始檔完整授權
迴圈 白話說法 改變什麼
內層:工作流程改進 研究者指出遺漏或要求重做後,系統檢查操作紀錄,提出新的步驟或指令,再用驗證任務比較修改前後 Agent harness,也就是代理如何理解任務、使用工具和整理上下文的工作規則
外層:模型訓練 在選定的工作流程下,讓模型反覆執行任務,再依照評分規則更新模型 模型參數,也就是模型從訓練中學到的行為傾向

論文使用的概念是「Agent harness」,可以把它理解成研究助理的工作手冊:先查哪些資料、何時執行程式、如何提交答案。內層會固定模型,只修改並測試工作手冊。外層則固定選好的工作流程,再透過強化學習(依照任務結果調整模型的訓練方式)更新模型。接著,研究者和新版代理繼續互動,形成下一輪資料。

你在對話中糾正錯誤後,模型也不會立刻更新。論文描述的是先累積互動與執行紀錄,再把它們整理成任務和評分規則。工作流程經過驗證、模型完成訓練後,團隊才會部署更新版本。研究者的回覆也不會直接被當成「正確答案」。報告指出,評分還會參考任務條件、工具執行證據和驗證器。

這個設計的價值,在於把一次性的「請再檢查」轉成可重複測試的程序。例如,代理常忘了確認資料欄位,就把「先檢查欄位與資源」列入工作流程,再看它在相同任務上是否真的提高成功率。若缺少明確的驗證標準,累積更多互動本身並不保證模型進步。因此,ScienceBuddy 的方法仍仰賴任務評分與研究者審查,不能只靠長期記憶來判定能力提升。

論文數據支持了哪些改善?

ScienceBuddy 團隊在 arXiv(研究者公開論文草稿的平台)上的研究報告中,展示真實研究互動,以及工作流程和模型學習的基準測試。報告目前列為 PhAI Labs Technical Report,公開版本是 2026 年 9 月提交的 v1。這是團隊自己的技術報告,成果尚未由獨立實驗室重做確認。

在一項固定工作流程、只訓練模型的實驗中,模型在相同任務上各嘗試四次,至少成功一次的題目比例從 48.3% 升到 67.8%。這叫 pass@4,也就是「四次機會中曾經答對」的比例,並非第一次作答的正確率。另一項固定模型、調整工作流程的實驗,驗證集正確率從 31.1% 升到 51.1%。研究團隊另外報告,經過三輪工作流程和模型交替更新後,特定保留測試題的一次作答正確率從 42.2% 升到 73.3%

團隊報告的結果 實驗條件 可以得出的結論
48.3% → 67.8% 固定工作流程,比較模型訓練前後,每題四次作答 訓練後,能在四次內解出的基準題增加
31.1% → 51.1% 固定模型,調整代理的工作流程,再測驗證集 不改模型參數,改善工作規則也可能提高特定任務表現
42.2% → 73.3% 工作流程與模型交替更新後,測試保留任務的一次作答正確率 這套組合在報告中的測試集有提升,仍不代表一般科研都會提升

這些數字提供了可檢驗的研究方向,也比只展示一段順利的產品影片多了可比較的證據。但它們測的是有限的科學問答、資料庫判斷、實驗流程除錯、基因與變異判讀等基準任務,不能直接換算成「發現新藥」或「研究結論正確率提高三成」。不同實驗的任務、模型和評分方式也不同,表格中的數字不能互相比大小。

真實研究者用過嗎?

報告記錄兩個研究者互動案例,並把它們當作質性示範。第一個案例是規劃小細胞肺癌中 JAK1、免疫治療和免疫微環境的研究,代理整理出基因相關分析步驟與後續機制研究方向。第二個案例是根據 ARL4C 研究的論文圖表整理簡報,嘗試把主張連回支持它的實驗比較。

案例呈現了「研究者可以追問和修正」的工作方式,也讓系統有機會把要求轉成後續任務。兩個案例沒有證明 ScienceBuddy 已經完成新的生物學發現,也沒有臨床或濕實驗室驗證。論文中的定量自我改進結果主要來自基準任務。工作流程調整實驗的附錄還描述了受限的模擬研究者回覆。這是目前判讀宣傳語與證據時最重要的分界。

研究者現在適合怎麼用?

如果你是研究生、實驗室成員或資料分析者,ScienceBuddy 值得拿來試跑一個可檢查的小任務:例如整理公開論文中的證據、建立資料摘要表,或請它提出一份分析計畫。要評估它是不是真的省時間,請保留原始資料、檢查引用和程式輸出,並用自己已知答案的任務測試。

由於產品強調上傳材料、保存工作區和累積互動紀錄,而公開頁面與研究報告沒有完整說明服務端如何保存、使用或刪除上傳資料,涉及病歷、個人資料、未公開研究結果或商業機密時,應先確認平台條款並取得所需機構許可。免費帳號或研究用途都不會自動解決資料治理問題。

ScienceBuddy 的程式庫有公開研究程式碼。GitHub 說明指出,公開內容是簡化版的自我改進實驗,並未包含由官方維運的雲端工作區前端、帳號系統,以及連接產品功能的服務端程式。因此,公開了研究程式碼不代表目前可以自行架設完整服務,也不代表雲端資料處理方式已經公開透明。

常見問題

ScienceBuddy 是免費的嗎?

PhAI Labs 在 2026 年 9 月 23 日的 X 貼文表示,可以在 ScienceBuddy 免費使用 GPT-6。貼文沒有列出免費額度、使用期限或具體模型版本,實際條件仍以官方服務當下公告為準。

ScienceBuddy 會在每次對話後立刻訓練自己嗎?

不會。研究報告描述的是先累積互動和執行證據,再經過工作流程修改、評估與模型訓練,最後部署更新版本。它不是每次使用都即時改寫模型。

ScienceBuddy 已經證明可以自主做科學發現嗎?

還沒有。論文展示了兩個研究者互動案例和多項基準測試,但沒有證明平台獨立產生並完成實驗驗證的新發現。現階段適合把它當成研究助理工作區,由人類檢查重要步驟與結論。

ScienceBuddy 完整開源了嗎?

研究實驗程式碼有公開,但完整雲端產品的前端、帳號與服務端程式不在公開程式庫中。若要自行架設完整 ScienceBuddy,現有公開 Repo 並未提供全部所需元件。

結語:值得試用,先把它當研究助理

ScienceBuddy 把文獻、資料、程式工具、執行紀錄和研究者回饋放進同一個工作流程,並嘗試用兩層改進機制降低代理一再犯同類錯誤的機會。團隊公布的基準數據值得後續追蹤,免費體驗 GPT-6 的公告也降低了試用門檻。

目前證據支持的結論是:在特定設定下,代理於有限科研基準任務上的表現有所提升。真實科學發現的能力仍待更大規模的獨立驗證。如果目前的免費條件、模型身份和資料政策都符合你的需求,可以先用公開資料試試。現階段最適合把它當成可檢查、需研究者把關的 AI 助理。

想試用的話,可以從 ScienceBuddy 公開預覽工作區開始,先用公開論文或一般性資料跑一個容易驗收的小任務。

資料來源