AI新聞
Gemini Live 推出 Guided Vision:用語音讀懂鏡頭畫面,為視覺協助設計
Google 在 Android 的 Gemini Live 推出 Guided Vision,可用語音描述鏡頭畫面、讀文字與提示調整取景。本文整理使用入口、支援條件,以及它不能取代行動輔具的原因。
AI新聞
Google 在 Android 的 Gemini Live 推出 Guided Vision,可用語音描述鏡頭畫面、讀文字與提示調整取景。本文整理使用入口、支援條件,以及它不能取代行動輔具的原因。
AI新聞
Olmo-core 3 更新開放 MoE 訓練系統,改善 GPU 分工與資料路由。本文解釋專家混合模型、2.7 倍吞吐量比較,以及兆級參數測試與模型品質的差別。
AI新聞
ServiceNow 公布 AutoSynthData,從企業代理的能力缺口產生訓練任務,並驗證正確與錯誤結果。本文整理流程與實驗數據,說明生成資料為什麼不能只看數量。
AI新聞
Ai2 開源 AstaBrief 8B 與訓練資料,讓研究問題和文獻片段轉成附引用報告。本文說明 Fast mode 的速度、模型用途,以及閱讀評測與核對引用時的界線。
AI新聞
Unity 官方遊戲開發外掛支援 Grok、Claude Code 與 Codex,涵蓋介面、圖形與商業功能。本文解釋技能外掛與 Unity CLI 的用途,以及專案修改前該保留的版本紀錄。
AI新聞
xAI 官方 TypeScript SDK 提供 Grok 串流、結構化輸出、工具與多媒體 API 支援。本文解釋 SDK 的用途、執行環境要求,以及正式整合前需要注意的版本變動。
AI新聞
Maket 2.0 整合 AI 平面圖、既有格局上傳與 3D 視覺化。本文搭配官方影片,整理適合的設計探索情境,以及為什麼成品仍需專業人員審查。
AI新聞
Intent 新增 Stacks 介面,協助開發者查看與引導多個 AI 代理。本文搭配官方影片,解釋任務工作區、共用規格與分工,並說明人工驗收仍然重要。
AI新聞
Suno Speech beta 可以共同生成語音與背景音樂,適合故事、詩與創意朗讀。本文整理操作概念、官方展示,以及口音、停頓與內容核對的重點。
AI新聞
NVIDIA 與滑鐵盧大學發布 PixelUMM,直接處理像素來理解與生成圖片、影片。本文用白話解析架構、官方展示與仍存在的畫面限制。
AI新聞
Nathan Lambert 與 Tom Zick 成立非營利 Trillium Labs,從開放後訓練配方出發。本文解析研究目標、初期支持與開放模型生態的實際意義。
AI新聞
Hugging Face 發布多框架強化學習指南,讓開放模型在 Claude Code、Codex 等工具內練習。本文解析任務成功率、工具呼叫下降與實際導入意義。