Nvidia 加強生成式 AI 運行,全力推廣 TensorRT

Nvidia 最近宣布了一個大舉動,他們將 TensorRT-LLM SDK 擴展到 Windows 和更多的大型語言模型(LLMs),像是 Stable Diffusion。這個舉動的背後目的很簡單,就是要讓這些大型語言模型和相關的 AI 工具運行得更快、更順暢。

Share
Nvidia 加強生成式 AI 運行,全力推廣 TensorRT

Nvidia 最近宣布了一個大舉動,他們將 TensorRT-LLM SDK 擴展到 Windows 和更多的大型語言模型(LLMs),像是 Stable Diffusion。這個舉動的背後目的很簡單,就是要讓這些大型語言模型和相關的 AI 工具運行得更快、更順暢。

那 TensorRT 到底是什麼呢?簡單來說,它是一個幫助加速「推理」的工具。推理是一個過程,通過已經訓練好的資料和計算概率來得出結果。有了 TensorRT,Nvidia 希望在這個生成式 AI 的領域扮演更重要的角色。

TensorRT-LLM 的厲害之處在於,它可以讓像 Meta 的 Llama 2 和 Stability AI 的 Stable Diffusion 這樣的大型語言模型,在 Nvidia 的 H100 GPU 上運行得更快。Nvidia 自己也說,用 TensorRT-LLM 來運行這些模型,使用者的體驗會有顯著的提升,特別是在更複雜的應用,像是寫作和編碼助手。

這樣一來,Nvidia 不只是提供強大的 GPU 來訓練和運行這些大型語言模型,還提供了這個讓模型運行更快的軟件,這意味著用戶不需要尋找其他替代方案來降低生成式 AI 的成本。Nvidia 也表示,TensorRT-LLM 會對外開放,任何人都可以使用或整合它。

但 Nvidia 也看到了未來的挑戰,雖然他們在生成式 AI 的硬件方面是領頭羊,但隨著生成式 AI 的快速發展,不需要大量昂貴 GPU 的新方法也在出現。像是 Microsoft 和 AMD,已經宣布他們會製造自己的晶片,減少對 Nvidia 的依賴。因此 Nvidia 正在積極尋找新的機會,確保他們在這個領域繼續領先。

Read more

Anthropic 官方重構發表 Claude Projects:從資料夾走向對話

Claude 專案大重構!告別靜態資料夾:Projects 化身「對話式幕僚長」,並行調度多 Threads、跨 Repo 自動開 PR 與共享記憶體深度解析

Anthropic 震撼重構 Claude Projects!告別過去「靜態資料夾」架構,進化為「對話式技術幕僚長」。只需交代目標,Claude 自動拆解需求、雲端平行調度多條 Threads 獨立拉分支開發、跨 API/Web/Mobile 三大倉庫提 PR 並排序合併依賴,更具備跨執行緒動態記憶庫與手機離線接力。本文全面深度解析。

智譜 Z.ai 官方發布:Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure

智譜 Z.ai 重磅揭密「模型自造基礎設施」!GLM-5.3 帶領 Infra Agent 於 10 萬國產算力卡兩週吞吐飆 3 倍:Ox Alpha 身分正式揭曉、稠密反饋擊破 GIL 鎖死瓶頸與遞歸自我改進(RSI)黎明深度解析

智譜 AI(Z.ai)發表《Toward Recursive Self-Improvement》技術震撼彈!證實 8 月在 OpenRouter 橫掃 62 兆 Token 的匿名模型 Ox Alpha 真身為 GLM-5.3-Flash。更首度揭露 GLM-5.3 驅動的 Infra Agent 如何在超過 10 萬張國產算力卡叢集上自主修復底層算子精度與 Python GIL 鎖死,兩週內將推論吞吐拉升 3 倍,能效逼平 NVIDIA。深度剖析稠密反饋機制與「模型優化系統,系統運行模型」的 RSI 黎明。