從圖像到音頻,Stability AI 的擴散模型將改變音樂製作的遊戲規則

Stability AI,一家主要以 AI 生成視覺效果而聞名的公司,推出 Stable Audio 的文字到音頻生成式 AI 平台。Stable Audio 使用的是一種擴散模型,與該公司受歡迎的圖像工具 Stable Diffusion 所使用的 AI 模型相同,但訓練的是音頻而非圖像,使用者可以使用它來生成歌曲或任何項目的背景音樂。

Share
從圖像到音頻,Stability AI 的擴散模型將改變音樂製作的遊戲規則

Stability AI,以 AI 生成視覺效果而聞名的公司,推出 Stable Audio 的文字到音頻生成式 AI 平台。Stable Audio 使用的是一種擴散模型,與該公司受歡迎的圖像工具 Stable Diffusion 所使用的 AI 模型相同,但訓練的是音頻而非圖像,使用者可以使用它來生成歌曲或任何項目的背景音樂。

音頻擴散模型傾向於生成固定長度的音頻,這對音樂製作來說是一個問題,因為歌曲的長度可能會有所不同。Stability AI 的新平台允許用戶製作不同長度的聲音,這需要該公司在音樂上進行訓練,並添加有關歌曲開始和結束時間的文本元數據。

根據該公司的說法,它使用“由超過 800,000 個音頻文件組成的數據集進行訓練,這些文件包含音樂、音效和單一樂器的主幹音軌”,以及來自庫存音樂許可公司 AudioSparx 的文本元數據。該數據集代表了超過 19,500 小時的聲音。Stability AI 表示,通過與一家許可公司合作,它有權使用受版權保護的材料。

與其他生成式 AI 音頻平台一樣,Stable Audio 的潛在使用案例將主要用於製作Podcast或視頻的背景音樂,用以加快這些工作流程。Stability AI 也在去年宣布計劃擴展到音頻生成、視頻和 3D 圖像。

Read more

Meta 推出能替你結帳的 AI Agent Muse:訂票、寄信、買東西都交給它?

Meta 推出能替你結帳的 AI Agent Muse:訂票、寄信、買東西都交給它?

AI 小道消息 01 Google DeepMind 發表新一代天氣預報模型 WeatherNext 3,直接學習即時衛星影像,解析度從 25 公里提升至 5 公里、每小時更新一次,宣稱降水預報準確度最多提升 50%,將整合進 Search、Maps、Gemini 與 Earth。 02 舊金山新創 Atlas 開放旗艦 EEG 穿戴裝置 Atlas 1.0 Pioneer Edition 預購,售價 $499 另加 $29.99/月訂閱,號稱能整天量測專注、壓力與心神疲勞,首批預購數日內售罄,預計 2027 年第一季出貨。 03 電力公司正競相與核融合新創結盟以因應 AI

OpenAI 官方宣布推出 ChatGPT 中小企業精選插件集合主視覺

一人公司與小團隊必看!OpenAI 推出 ChatGPT「中小企業 16 大精選插件」:串聯 QuickBooks、Stripe 與 Docusign,打造 24 小時自主營運總部

告別在 10 個軟體間切換的惡夢!OpenAI 官方推出「Small Business Collection」中小企業精選插件集合,深度整合 QuickBooks、Stripe、DocuSign、Dropbox、HubSpot、Mercury、Shopify 等 16 款頂級商務工具。本文深度解析如何透過自然語言一站完成合約起草、金流收款、發票記帳與客戶管理,並揭秘「人機協同」審批防護機制。