GetChain News
中简 中繁 EN
GetChain News
Toggle sidebar

英偉達推出NeMo Switchyard,利用AI模型路由技術降低智能體運行成本

來源: developer.nvidia.com 事件類型: 上線/更新
英偉達(NVIDIA)推出 AI 模型路由系統 NeMo Switchyard,旨在幫助開發者在多個大模型之間動態分配 AI 智能體(AI Agent)任務,在保證性能的同時降低成本和延遲。英偉達表示,構建 AI 智能體並不意味着必須依賴單一大模型。不同模型在推理能力、響應速度和運行成本方面各有優勢,例如分類任務可能適合輕量模型,複雜推理則需要更強大的前沿模型。如果所有請求都發送至最大規模模型,將導致成本和延遲增加;而全部使用小模型則可能降低複雜任務完成質量。NeMo Switchyard 通過智能路由機制,根據任務需求、模型能力、成本、延遲以及系統狀態等因素,在多個專用模型和前沿模型之間自動選擇最合適的執行模型。該系統支持開發者在不改變應用架構的情況下切換不同模型供應商和模型版本。英偉達介紹,NeMo Switchyard 提供多種路由策略,包括無需訓練的 LLM 分類器路由、階段路由(Stage Router)、升級路由(Escalation Router),以及基於真實工作負載數據訓練的可調節路由模型。其中,升級路由會優先將任務分配給低成本模型,並在檢測到任務複雜度提升、持續錯誤或執行停滯時,將請求升級至更強模型,從而實現性能與成本之間的平衡。英偉達表示,在相關測試中,NeMo Switchyard 通過在不同模型之間分配任務,在保持較高任務完成率的同時顯著降低 AI Agent 運行成本。例如,與僅使用前沿模型相比,基於升級路由的方案在 LangChain 多輪智能體測試中降低約 74%的成本,僅有 7%的請求需要調用前沿模型。此外,英偉達已與 Cognition、Nous Research、Ramp、LangChain、LiteLLM、Kong 等企業合作,將 NeMo Switchyard 集成至 AI Agent 開發流程和企業應用基礎設施中。

相關專案