GetChain News
中简 中繁 EN
GetChain News
Toggle sidebar
Inference

Inference

運營中

用於 LLM 推理的分佈式 GPU 集羣

新聞熱度趨勢

項目概述

Inference 是一個基於 Solana、用於 LLM 推理的分佈式 GPU 集羣,爲DeepSeek V3和Llama 3.3等模型提供快速、可擴展、按 Token 付費的 API 。

大摩:CoreWeave 單季新增 500MW 產能創紀錄,高負債與客戶集中度壓制估值

據潮向研究,摩根士丹利 8月 Q2 業績報告指出,CoreWeave 單季新增淨活躍電力 500MW,超過歷史上任何一個季度,同比超過上年同期的三倍,管理層重申 2030 年前至少達到 8GW 目標。FY26 營收指引中值上調 2%至 124 億到 132 億美元,ARR 中值上調 3%至 185 億到 195 億美元。公司上調全年資本開支指引中值 12%至 355 億到 390 億美元,Q3 資本開支指引 115 億到 135 億美元,高於市場預期的 100 億美元。Managed Inference 平臺(託管推理平臺)ARR 從100 萬美元增長至超過 1 億美元,預計年底至少達 2.5 億美元。 研報判斷,Q2 調整後營業利潤率約 8%高於預期,但 Q3 利潤率指引 5.8%到 7.2%低於市場預期,Q4 利潤率需大幅提升才能實現全年指引。大摩預計 CoreWeave FY27 運營利潤率 15.9%、FY28爲 22.4%,自由現金流至 2028 年仍爲負,債務預計 2026 年底增至約 380 億美元。大摩維持 Equal-weight(與大盤持平)評級和 99 美元目標價

AI推理初創公司General Compute獲4億美元貸款,以推理專用ASIC芯片抵押

AI 推理雲初創公司 General Compute 從 Upper90 取得 4 億美元貸款,該筆交易爲全球首例以推理專用芯片作爲抵押品的融資項目。公司基於 SambaNova 自研 ASIC 芯片搭建專屬 AI 推理雲平臺,主打 Agent 類 AI 算力負載,相較傳統 GPU 雲擁有更快令牌處理速度和更低運行延遲;硬件可直接部署在傳統數據中心與閒置加密礦場設施。(mezha.net)

DeepSeek 自研 AI 推理芯片,擬擺脫英偉達與華爲依賴

據路透社報道,中國 AI 初創公司 DeepSeek 正在開發自研 AI 芯片,三位知情人士透露,該芯片專爲推理場景設計,而非用於模型訓練。項目啓動約一年前,目前仍處早期階段,公司已與芯片設計、晶圓代工及存儲企業展開接觸,並悄然增招芯片設計工程師,未公開發布招聘信息。 若研發成功,DeepSeek 將減少對英偉達及華爲 Ascend 芯片的依賴,跟隨 OpenAI、Anthropic 等全球 AI 巨頭自研硬件的趨勢。受美國出口管制影響,DeepSeek 此前已從英偉達 H800 轉向華爲芯片,此次自研芯片被視爲重大戰略轉型。與此同時,DeepSeek 還計劃完成首輪外部融資,募資規模約 70 億美元,估值達 520 億至 590 億美元。

AMD推出AI編程平臺Instinct Coder,可降低企業AI編碼成本70%

半導體巨頭 AMD 宣佈推出企業級 AI 編程平臺 AMD Instinct Coder,該平臺結合 AMD 芯片、Supermicro 服務器及 Spectro Cloud 軟件,旨在幫助企業在本地部署 AI 編碼助手,降低雲端 AI 模型使用成本並保護代碼及數據安全。AMD 表示,Instinct Coder 是一套“開箱即用”的端到端 AI 開發平臺,整合了 AMD EPYC 處理器、AMD Instinct GPU、Supermicro AI 服務器、Spectro Cloud PaletteAI Inference Launchpad 軟件,以及經過 AMD 優化的 GLM-5.2 模型,可用於代碼生成、應用現代化、自動化測試、代碼審查等軟件開發場景。AMD 稱,與依賴雲端前沿 AI 模型相比,Instinct Coder 可幫助企業降低最高 70%的總擁有成本(TCO),投資回收期最快可縮短至 6 個月。AMD 表示,越來越多企業希望利用 AI 提升開發效率,但同時面臨兩大挑戰:一方面,調用頂級雲端模型成本不斷增加;另一方面,將企業源代碼、知識產權和敏感數據交由第三方服務存在安全和合規風險。通過本地部署模式,Instinct Coder 可讓企業保持對數據和代碼的控制,同時提供更可預測的基礎設施成本。該平臺支持 Claude Code、OpenAI Codex、Visual Studio Code 和 Cursor 等開發工具,每個節點最多支持 50 名用戶(30 名併發用戶)。此外,Spectro Cloud 提供的 PaletteAI Inference Launchpad 可實現 AI 工作負載管理、模型路由、請求審計和成本監控,並支持在需要時調用 Anthropic、OpenAI、Google 或 xAI 等外部模型。AMD 表示,Instinct Coder 旨在幫助企業擺脫高昂雲端 AI 服務成本,在保障數據安全和自主控制的同時,加速 AI 驅動的軟件開發流程。

Serenity:美國AI公司需要壓低推理成本以應對“模型蒸餾”挑戰

“白毛股神”Serenity 發文表示,儘管 UBS 報告中的部分觀察具有軼事層面的真實性,但更值得關注的是,關於 Anthropic 模型被蒸餾的相關中文報告正在增多。目前不少美國初創公司與科技企業在 AI 應用中,傾向使用更便宜的中國模型(如 DeepSeek),原因在於其單位任務成本顯著低於 Gemini、OpenAI 及 Anthropic 等推理模型。Serenity 認爲,這種趨勢在資本主義驅動下形成“典型悖論”——企業天然會選擇更低成本方案,從而削弱美國模型的領先優勢,同時提出美國需要在兩方面發力應對:一是構建更強的訪問控制與認證體系,例如面向美國本土的“重 KYC 前沿模型”,以及針對盟友的分級訪問機制,以降低模型被蒸餾與濫用風險;同時可引入類似“AI 版銀行級認證”的身份驗證體系(如生物識別+短時權限令牌),提升模型調用門檻,並通過監管手段限制賬號共享與訪問轉售。二是提升推理模型的成本效率,使其在價格與性能上全面壓制 DeepSeek 等競爭對手。Serenity 同時表示,當前一些高端模型頻繁被“蒸餾利用”,理想情況下應對接近 AGI 級別的模型訪問,增加更多摩擦成本。總結來看,美國 AI 產業的核心挑戰在於:既要實現“低成本推理能力”,也要建立類似金融體系級別的模型訪問安全機制。

消息人士:英偉達擬向中國客戶推銷Vera AI CPU,部分雲廠商擬啓動測試部署

知情人士稱,英偉達開始向中國客戶推銷其首款獨立中央處理器(CPU)產品 Vera。該芯片專爲 Agentic AI(自主智能體)系統設計,目前已進入量產階段,標誌着英偉達正嘗試通過 CPU 產品進一步拓展中國市場。消息人士稱,部分中國客戶已對 Vera 表現出興趣。其中一家大型中國雲計算公司計劃採購 300 餘臺搭載雙 Vera CPU 的服務器進行測試,並將在測試完成後決定是否擴大采購規模。Vera 基於 Arm Holdings 架構打造,是英偉達首次推出的獨立 CPU 產品。英偉達此前表示,Vera 在 AI 智能體相關計算任務中的性能可達到競爭對手同類產品的 1.8 倍,並預計該產品將在本財年結束前(截至明年 1 月底)貢獻約 200 億美元收入。報道指出,隨着 AI 行業重心逐步從模型訓練轉向推理計算(Inference),CPU 與定製芯片正獲得更多關注。Vera 也使英偉達直接與長期主導服務器 CPU 市場的 Intel 和 Advanced Micro Devices(AMD)展開競爭。知情人士表示,由於美國對高端 GPU 出口實施嚴格限制,相較於 GPU 產品,CPU 在中國市場面臨的監管障礙相對較小。目前部分中國客戶計劃先在海外數據中心部署 Vera 芯片進行測試。與此同時,軟件生態兼容性以及現有國產 AI 芯片部署體系,仍可能影響 Vera 後續的大規模採用。(Reuters)

Anthropic升級Claude新增預算控制、區域推理、技能加載與模型顧問功能

Anthropic 本週對 Claude 進行升級,爲 Claude Managed Agents 推出四項重要更新,進一步增強企業級 AI Agent 的可控性、部署靈活性和任務執行能力,包括:1、新增會話預算控制功能,用戶現在可以爲 Agent 會話設置預算上限,以實現更精準的成本管理。當會話達到預算限制後,系統將觸發事件並暫停運行,用戶可提高預算後恢復任務執行。2、開放推理區域控制能力,用戶可以選擇 Claude Managed Agents 運行位置,在全球可用資源中調度運行並按照標準價格計費,如果限制在美國區域運行,滿足區域部署需求,但費用爲標準價格的 1.1 倍。3、支持自動加載用戶倉庫中的 Skills 能力模塊;4、新增顧問模型功能。用戶可以配置一個更強大的模型作爲“顧問”,讓執行任務的 Agent 在會話過程中調用顧問模型進行第二意見分析,提高複雜任務處理質量。

AMD推出AI編程平臺Instinct Coder,可降低企業AI編碼成本70%

半導體巨頭 AMD 宣佈推出企業級 AI 編程平臺 AMD Instinct Coder,該平臺結合 AMD 芯片、Supermicro 服務器及 Spectro Cloud 軟件,旨在幫助企業在本地部署 AI 編碼助手,降低雲端 AI 模型使用成本並保護代碼及數據安全。AMD 表示,Instinct Coder 是一套“開箱即用”的端到端 AI 開發平臺,整合了 AMD EPYC 處理器、AMD Instinct GPU、Supermicro AI 服務器、Spectro Cloud PaletteAI Inference Launchpad 軟件,以及經過 AMD 優化的 GLM-5.2 模型,可用於代碼生成、應用現代化、自動化測試、代碼審查等軟件開發場景。AMD 稱,與依賴雲端前沿 AI 模型相比,Instinct Coder 可幫助企業降低最高 70%的總擁有成本(TCO),投資回收期最快可縮短至 6 個月。AMD 表示,越來越多企業希望利用 AI 提升開發效率,但同時面臨兩大挑戰:一方面,調用頂級雲端模型成本不斷增加;另一方面,將企業源代碼、知識產權和敏感數據交由第三方服務存在安全和合規風險。通過本地部署模式,Instinct Coder 可讓企業保持對數據和代碼的控制,同時提供更可預測的基礎設施成本。該平臺支持 Claude Code、OpenAI Codex、Visual Studio Code 和 Cursor 等開發工具,每個節點最多支持 50 名用戶(30 名併發用戶)。此外,Spectro Cloud 提供的 PaletteAI Inference Launchpad 可實現 AI 工作負載管理、模型路由、請求審計和成本監控,並支持在需要時調用 Anthropic、OpenAI、Google 或 xAI 等外部模型。AMD 表示,Instinct Coder 旨在幫助企業擺脫高昂雲端 AI 服務成本,在保障數據安全和自主控制的同時,加速 AI 驅動的軟件開發流程。

AI推理初創公司General Compute獲4億美元貸款,以推理專用ASIC芯片抵押

AI 推理雲初創公司 General Compute 從 Upper90 取得 4 億美元貸款,該筆交易爲全球首例以推理專用芯片作爲抵押品的融資項目。公司基於 SambaNova 自研 ASIC 芯片搭建專屬 AI 推理雲平臺,主打 Agent 類 AI 算力負載,相較傳統 GPU 雲擁有更快令牌處理速度和更低運行延遲;硬件可直接部署在傳統數據中心與閒置加密礦場設施。(mezha.net)

Meta 自研 AI 芯片"Iris"計劃於9月啓動量產,2027年算力目標達14吉瓦

據路透社報道,Meta 計劃自 9 月起量產自研數據中心 AI 芯片“Iris”,作爲其 Meta Training and Inference Accelerators 四代項目的一部分,以提升 Facebook和 Instagram 等平臺 AI 能力並降低對 Nvidia、AMD 等外部 GPU 依賴。內部備忘錄顯示,Iris 僅用 6 周完成測試,無重大缺陷;Meta 計劃今年部署 7 吉瓦算力,並在 2027 年增至 14 吉瓦,2024年 AI 基礎設施支出最高或達 1450 億美元。爲保障擴張,公司已與三星電子、Sandisk 和住友電工簽署長期供應協議,應對內存與 AI 芯片“漲價”與短缺。

DeepSeek 自研 AI 推理芯片,擬擺脫英偉達與華爲依賴

據路透社報道,中國 AI 初創公司 DeepSeek 正在開發自研 AI 芯片,三位知情人士透露,該芯片專爲推理場景設計,而非用於模型訓練。項目啓動約一年前,目前仍處早期階段,公司已與芯片設計、晶圓代工及存儲企業展開接觸,並悄然增招芯片設計工程師,未公開發布招聘信息。 若研發成功,DeepSeek 將減少對英偉達及華爲 Ascend 芯片的依賴,跟隨 OpenAI、Anthropic 等全球 AI 巨頭自研硬件的趨勢。受美國出口管制影響,DeepSeek 此前已從英偉達 H800 轉向華爲芯片,此次自研芯片被視爲重大戰略轉型。與此同時,DeepSeek 還計劃完成首輪外部融資,募資規模約 70 億美元,估值達 520 億至 590 億美元。

消息人士:英偉達擬向中國客戶推銷Vera AI CPU,部分雲廠商擬啓動測試部署

知情人士稱,英偉達開始向中國客戶推銷其首款獨立中央處理器(CPU)產品 Vera。該芯片專爲 Agentic AI(自主智能體)系統設計,目前已進入量產階段,標誌着英偉達正嘗試通過 CPU 產品進一步拓展中國市場。消息人士稱,部分中國客戶已對 Vera 表現出興趣。其中一家大型中國雲計算公司計劃採購 300 餘臺搭載雙 Vera CPU 的服務器進行測試,並將在測試完成後決定是否擴大采購規模。Vera 基於 Arm Holdings 架構打造,是英偉達首次推出的獨立 CPU 產品。英偉達此前表示,Vera 在 AI 智能體相關計算任務中的性能可達到競爭對手同類產品的 1.8 倍,並預計該產品將在本財年結束前(截至明年 1 月底)貢獻約 200 億美元收入。報道指出,隨着 AI 行業重心逐步從模型訓練轉向推理計算(Inference),CPU 與定製芯片正獲得更多關注。Vera 也使英偉達直接與長期主導服務器 CPU 市場的 Intel 和 Advanced Micro Devices(AMD)展開競爭。知情人士表示,由於美國對高端 GPU 出口實施嚴格限制,相較於 GPU 產品,CPU 在中國市場面臨的監管障礙相對較小。目前部分中國客戶計劃先在海外數據中心部署 Vera 芯片進行測試。與此同時,軟件生態兼容性以及現有國產 AI 芯片部署體系,仍可能影響 Vera 後續的大規模採用。(Reuters)

相關新聞

大摩:CoreWeave 單季新增 500MW 產能創紀錄,高負債與客戶集中度壓制估值

據潮向研究,摩根士丹利 8月 Q2 業績報告指出,CoreWeave 單季新增淨活躍電力 500MW,超過歷史上任何一個季度,同比超過上年同期的三倍,管理層重申 2030 年前至少達到 8GW 目標。FY26 營收指引中值上調 2%至 124 億到 132 億美元,ARR 中值上調 3%至 185 億到 195 億美元。公司上調全年資本開支指引中值 12%至 355 億到 390 億美元,Q3 資本開支指引 115 億到 135 億美元,高於市場預期的 100 億美元。Managed Inference 平臺(託管推理平臺)ARR 從100 萬美元增長至超過 1 億美元,預計年底至少達 2.5 億美元。 研報判斷,Q2 調整後營業利潤率約 8%高於預期,但 Q3 利潤率指引 5.8%到 7.2%低於市場預期,Q4 利潤率需大幅提升才能實現全年指引。大摩預計 CoreWeave FY27 運營利潤率 15.9%、FY28爲 22.4%,自由現金流至 2028 年仍爲負,債務預計 2026 年底增至約 380 億美元。大摩維持 Equal-weight(與大盤持平)評級和 99 美元目標價

Anthropic升級Claude新增預算控制、區域推理、技能加載與模型顧問功能

Anthropic 本週對 Claude 進行升級,爲 Claude Managed Agents 推出四項重要更新,進一步增強企業級 AI Agent 的可控性、部署靈活性和任務執行能力,包括:1、新增會話預算控制功能,用戶現在可以爲 Agent 會話設置預算上限,以實現更精準的成本管理。當會話達到預算限制後,系統將觸發事件並暫停運行,用戶可提高預算後恢復任務執行。2、開放推理區域控制能力,用戶可以選擇 Claude Managed Agents 運行位置,在全球可用資源中調度運行並按照標準價格計費,如果限制在美國區域運行,滿足區域部署需求,但費用爲標準價格的 1.1 倍。3、支持自動加載用戶倉庫中的 Skills 能力模塊;4、新增顧問模型功能。用戶可以配置一個更強大的模型作爲“顧問”,讓執行任務的 Agent 在會話過程中調用顧問模型進行第二意見分析,提高複雜任務處理質量。

AMD 將收購 AI 推理芯片初創公司 Taalas,強化推理市場佈局

據路透社報道,AMD 宣佈將收購 AI 推理芯片初創公司 Taalas,交易金額尚未披露。此次收購旨在增強 AMD 在 人工智能推理芯片 領域的技術能力,並計劃將 Taalas 的技術整合進其 Instinct GPU 加速器路線圖,進一步推進系統級解決方案開發。

AMD收購AI推理芯片公司Taalas

AMD 宣佈已達成收購 AI 推理芯片公司 Taalas 的最終協議,旨在加強其在快速增長的 AI 推理市場中的技術競爭力。此次收購旨在強化 AMD 在快速增長的 AI 推理市場中的技術優勢,並進一步推進其 AI 計算路線。AMD 表示,計劃將 Taalas 技術整合至 AMD Instinct GPU 及 AI 加速器路線中,開發系統級 AI 計算解決方案。

AMD推出AI編程平臺Instinct Coder,可降低企業AI編碼成本70%

半導體巨頭 AMD 宣佈推出企業級 AI 編程平臺 AMD Instinct Coder,該平臺結合 AMD 芯片、Supermicro 服務器及 Spectro Cloud 軟件,旨在幫助企業在本地部署 AI 編碼助手,降低雲端 AI 模型使用成本並保護代碼及數據安全。AMD 表示,Instinct Coder 是一套“開箱即用”的端到端 AI 開發平臺,整合了 AMD EPYC 處理器、AMD Instinct GPU、Supermicro AI 服務器、Spectro Cloud PaletteAI Inference Launchpad 軟件,以及經過 AMD 優化的 GLM-5.2 模型,可用於代碼生成、應用現代化、自動化測試、代碼審查等軟件開發場景。AMD 稱,與依賴雲端前沿 AI 模型相比,Instinct Coder 可幫助企業降低最高 70%的總擁有成本(TCO),投資回收期最快可縮短至 6 個月。AMD 表示,越來越多企業希望利用 AI 提升開發效率,但同時面臨兩大挑戰:一方面,調用頂級雲端模型成本不斷增加;另一方面,將企業源代碼、知識產權和敏感數據交由第三方服務存在安全和合規風險。通過本地部署模式,Instinct Coder 可讓企業保持對數據和代碼的控制,同時提供更可預測的基礎設施成本。該平臺支持 Claude Code、OpenAI Codex、Visual Studio Code 和 Cursor 等開發工具,每個節點最多支持 50 名用戶(30 名併發用戶)。此外,Spectro Cloud 提供的 PaletteAI Inference Launchpad 可實現 AI 工作負載管理、模型路由、請求審計和成本監控,並支持在需要時調用 Anthropic、OpenAI、Google 或 xAI 等外部模型。AMD 表示,Instinct Coder 旨在幫助企業擺脫高昂雲端 AI 服務成本,在保障數據安全和自主控制的同時,加速 AI 驅動的軟件開發流程。

Marvell 推出 AI 基礎設施內存解決方案組合,瞄準 Agentic AI 推理瓶頸

數據基礎設施半導體巨頭 Marvell Technology 宣佈,推出面向 AI 基礎設施的新一代內存解決方案組合,覆蓋服務器級 AI 存儲、機架級 CXL 內存擴展與池化,以及多機櫃光互聯共享內存,旨在解決 Agentic AI 推理過程中日益增長的內存容量和帶寬瓶頸。Marvell 表示,隨着 AI 模型規模擴大、上下文窗口延長以及 KV Cache 需求增長,傳統計算與內存緊耦合架構正限制 AI 推理效率。通過內存解耦(memory disaggregation),可以讓內存資源更加獨立於計算資源擴展,提高 GPU 利用率並降低數據移動延遲。