NVIDIA Nemotron 3 Nano:320億參數MoE模型僅激活3.6B,百萬token上下文窗口

Published 2026-03-15 · AI Daily — AI-assisted deep research, methodology & disclosure

NVIDIA發布Nemotron 3 Nano,320億參數MoE模型運行時僅激活3.6B,100萬token上下文窗口,專為高效智能體任務設計。

NVIDIA於2026年3月發布Nemotron 3 Nano,採用MoE架構總參數320億但推理時僅激活3.6億——成本降低約90%。100萬token超長上下文窗口。針對工具呼叫、結構化輸出、多步驟推理等智能體任務優化。在函數呼叫基準測試中性能接近GPT-4o,可在消費級GPU上運行。

Sources

FAQ

什么是MoE架构?

混合专家(Mixture of Experts)架构将模型分为多个「专家」子网络,推理时只激活最相关的少数专家,大幅降低计算成本同时保持性能。

3.6B活跃参数意味着什么?

虽然模型总共有320亿参数,但每次推理只使用3.6亿,计算成本接近一个小模型,但能力远超同规模模型。

100万token上下文有什么用?

可以一次处理约75万字的文本,足够分析整本书、大型代码库或超长对话历史。