NVIDIA Nemotron 3 Nano:320億參數MoE模型僅激活3.6B,百萬token上下文窗口
NVIDIA發布Nemotron 3 Nano,320億參數MoE模型運行時僅激活3.6B,100萬token上下文窗口,專為高效智能體任務設計。
NVIDIA於2026年3月發布Nemotron 3 Nano,採用MoE架構總參數320億但推理時僅激活3.6億——成本降低約90%。100萬token超長上下文窗口。針對工具呼叫、結構化輸出、多步驟推理等智能體任務優化。在函數呼叫基準測試中性能接近GPT-4o,可在消費級GPU上運行。
Sources
FAQ
什么是MoE架构?
混合专家(Mixture of Experts)架构将模型分为多个「专家」子网络,推理时只激活最相关的少数专家,大幅降低计算成本同时保持性能。
3.6B活跃参数意味着什么?
虽然模型总共有320亿参数,但每次推理只使用3.6亿,计算成本接近一个小模型,但能力远超同规模模型。
100万token上下文有什么用?
可以一次处理约75万字的文本,足够分析整本书、大型代码库或超长对话历史。