该系列于7月17日开源,提供8B及双1B版本支持34种语言与32K上下文,面向检索增强生成及智能体场景免费开放权重。
NVIDIA于7月17日正式发布Nemotron-3-Embed系列嵌入向量模型,旨在优化生产级检索增强生成(RAG)、代码检索及智能体记忆等应用场景。该系列包含三个开放权重的检查点版本,支持34种语言,最大序列长度达到32,768个token。官方表示,通过提供高精度检索能力,该系列可减少AI智能体的重复检索行为,降低推理触发频率并节省Token消耗。模型已通过Hugging Face与NVIDIA NIM平台免费提供,并采用OpenMDW-1.1许可协议允许商业使用。
在技术规格方面,旗舰版本Nemotron-3-Embed-8B-BF16基于Ministral-3-8B-Instruct-2512构建,参数规模为80亿,专为高风险企业场景设计;轻量化版本Nemotron-3-Embed-1B-BF16参数量为11.4亿,源自Ministral-3-3B-Instruct-2512,侧重于低延迟与成本控制。针对Blackwell架构优化的Nemotron-3-Embed-1B-NVFP4版本采用4比特量化技术,在保留精度的同时提升吞吐量。1B模型的构建路径并非直接小规模训练,而是先通过神经架构搜索将3B基础模型剪枝至2B,再利用8B教师模型进行知识蒸馏迭代至1.14B参数。NVFP4版本在此基础上进一步引入量化感知蒸馏,使用512个样本校准及2万个样本进行优化。
性能测试数据显示,Nemotron-3-Embed-8B-BF16在RTEB基准的16项任务中平均NDCG@10得分为78.46,位列当前开源模型第一;在MMTEB检索任务中得分为75.5。轻量化版本Nemotron-3-Embed-1B-BF16得分72.38,较上一代基线llama-nemotron-embed-vl-1b-v2提升10.4分。Blackwell优化版相比BF16版本在精度上仅损失0.38分,相当于保留99.5%的精度,同时在该架构上吞吐量提升2倍。该系列模型均基于双向注意力掩码训练的Transformer编码器架构,标志着NVIDIA在检索模型领域的进一步布局,旨在通过开源策略推动行业在复杂检索场景下的技术标准化。