【深度專題】避免資料殖民!解決資料荒的下一步?來自日本的新創 APTO
生成式 AI 正在爆發成長,但背後最關鍵的燃料──高品質資料──卻正面臨全球枯竭。研究指出,現有語料可能在 2026 年前耗盡,讓模型面臨「吃不飽、吃不對」的雙重危機。 更嚴重的是,當前主流 AI 訓練大多仰賴英語世界的資料,讓模型在處理非西方語境時失準,也讓全球多數地區陷入「資料殖民」——只能使用別人定義的語言與知識。 在這場資料競賽中,日本新創 APTO 推出社群標註平台 harBest,讓資料不再專屬於少數科技巨頭,而能由全民參與、在地生產、專業分工。對台灣而言,這樣的平台不是「可以有」,而是「應該有」。
AI 正在快速進化,但真正能餵飽它的「高品質資料」卻正在快速枯竭。
根據 Epoch AI 的預估,我們可能在 2026–2032 年間,耗盡現有的高品質公開文字資料庫;美國公共電視主播 PBS 也指出,AI 系統可能在 2026 年前「吃光」人類書寫的資料 。這不是某家公司的問題,而是整個 AI 產業面臨的全球性挑戰。
OpenAI 更在技術報告中坦言:「高品質人類標註資料」是模型性能提升的關鍵,也是一切最難的來源。傳統的資料收集與清洗流程,如今正面臨「量不夠、速度慢、成本高」的三重壓力。
但資料問題不只是「不夠」,還可能是「不對」。
目前主流訓練多依賴英語世界的資料,導致模型在其他文化、語言或地區使用時往往失準。這促使各國政府和企業提出「主權 AI」概念:資料的蒐集、訓練與使用應該在地化,以確保 AI 符合在地語言習慣與倫理標準。
延伸閱讀: 台灣也能打造自己的「主權 AI」?
這也讓「共享 AI 標註」成為未來的可能解方之一:如果資料無法複製,能否動員社群共同生產?
不少新創已著手嘗試。例如 Surge AI 推出「人+AI」雙重品控模式,協助企業建立高品質訓練資料;Centaur Labs、Karya 等則在醫療與印度在地語言上,發展社群式標註網路,嘗試解決在地資料缺乏與資料殖民的問題。

而來自日本的 APTO,也用一套極具操作性的系統給出回應:harBest,一個讓全民與專業標註者都能參與資料建設的開放平台。
harBest:把資料建設,變成一場全民任務
在資料供需失衡、主權 AI 崛起的背景下,日本新創 APTO 給出一個務實又可執行的方案——harBest。
它不是傳統的資料外包公司,也不是匿名接案平台,而是一套「資料協作網絡」:
企業可以在平台上發起任務,明確說明想收集什麼樣的語音、圖片或文字資料;
一般用戶或特定領域專家,則能透過手機或電腦完成標註、回答問卷、分類資訊,並獲得點數獎勵。

就像是把 AI 模型訓練所需的「資料工地」攤開給社群參與。
但 harBest 更關鍵的設計,在於它不只是把任務外包給人群,而是重新定義了「什麼叫做可用的資料」:
- 每筆資料都能被多位用戶交叉驗證;
- 標註結果會經過 AI 初步過濾與邏輯一致性檢查;
- 每位標註者的表現會被長期追蹤、分級、影響接案權重。
APTO 把這套機制稱作一種「人與 AI 的雙向信任系統」——
AI 幫助人做得更準,人讓 AI 學得更穩。
相較於過往標註平台只重數量與速度,harBest 更像是為了「品質與在地性」而生的資料共建系統。
標註不只是人力外包,而是一種演算法設計
harBest 的核心優勢,不只是把資料任務釋出給群眾,而是設計了一整套「讓資料變乾淨」的流程。
1. 多重交叉驗證:讓錯誤標註無所遁形
每筆資料都會交由多位用戶標註,平台根據回覆一致性與語意差異計算信任度。
如果某位用戶反覆給出偏離共識的答案,不僅該筆標註會被過濾,該用戶的整體評級也會下降。
2. AI 輔助品質控管:NeMo Curator 的加入
APTO 與 NVIDIA 合作導入 NeMo Curator 模組,能自動剔除短句、錯字、不自然語句,並對資料做初步語意檢查。
這讓 harBest 成為少數同時結合「人力標註+AI 清洗」的雙軌平台,標註品質不再只能靠人力補破網。
3. 分級制度與專業模式:讓標註也能職涯進階
平台內建「標註等級制度」,新用戶從簡單任務做起,表現穩定後能逐步解鎖更高單價、更複雜的任務。
而針對醫療、金融、機械等需要專業知識的領域,harBest 推出 Expert 模式,媒合具備特定背景的標註者,協助企業訓練高難度、在地化的 LLM。
誰在用 harBest?資料平台的 B2B 滲透力
目前,harBest 已與日本境內多家企業合作,從客服對話分類、App 回饋標註,到金融服務的自然語言風險分析,累積大量具備「地區性語言特徵」的微型資料集。
日本各地語調差異極大,從東京的標準語,到大阪、福岡、北海道等地的方言,不只發音不同,連語尾、敬語強度與句型邏輯也各有文化背景。其中一個應用亮點,是 APTO 為日本在地語音助手建構「口語口氣」資料集:
透過 harBest 平台,讓上千位使用者錄下各種生活場景下的語音指令(如疲勞時語調、禮貌用語差異),成功提升模型對日本語系自然語調的識別準確率。這類資料過去難以靠公用語料取得,卻是日系 AI 應用中的真實痛點。
此外,harBest 本身也正在成為一種「資料資產聚合平台」:
隨著任務與標註行為的累積,APTO 可根據企業需求整合現有標註資料,提供具特定語境、用途、格式的客製資料包,快速支援模型調教或評測用途。
對中小型企業而言,這代表:即便沒有 AI 團隊,也能快速擁有可訓練、可用的資料集。
對台灣來說,這樣的平台並不是「可以有」,而是「應該有」
生成式 AI 的進展,正在從模型競賽,轉向資料競賽。
而台灣,不論是產業還是語言文化,早已暴露在這場資料競爭的邊緣——
多數企業沒有資源清洗資料,更談不上打造屬於自己的 AI 訓練集;
市面主流語料模型又多數來自矽谷與中國,對台灣的語氣、法規、用語習慣根本無法對應。
這也是為什麼我們不只需要會「用 AI」,更需要能「養 AI」的平台。
像 harBest 這樣結合社群協作、AI 品質管控、專業分層的標註平台,正是一種可能的起點。
這不只是企業端的資料解方,
也是我們打造主權 AI、累積本地語料資產、為下一代模型鋪路的關鍵基礎。
資料主權不能靠別人分配,必須靠我們自己建立。
我們不是等待世界給我們 AI,而是應該問自己:台灣的 AI,要學誰的語言?