该实验性开源模型基于Gemma 4架构,采用非自回归扩散机制,旨在解决本地设备内存带宽瓶颈,为开发者提供高并发低延迟的文本生成新路径。
谷歌于2026年6月10日至11日期间正式发布了名为DiffusionGemma的实验性开源人工智能模型。该模型基于Gemma 4家族架构,核心创新在于采用文本扩散机制替代传统的自回归架构,通过并行去噪处理而非逐Token生成来实现输出。官方数据显示,在专用GPU环境下,其推理速度相比同规模自回归模型最高提升4倍,旨在优化本地端侧部署及低带宽场景下的计算效率。该模型已依据Apache 2.0许可证向公众开放,开发者可通过Hugging Face平台获取模型权重进行技术验证与探索。
在技术规格方面,DiffusionGemma被定义为参数总量为26B的混合专家模型(MoE),实际推理时仅激活3.8B参数。该架构设计使得模型在量化后仅需18GB显存即可运行,支持在消费级显卡如RTX 4090上部署。NVIDIA方面宣布提供首日支持,覆盖GeForce RTX系列、RTX PRO平台及DGX系统全系硬件,并通过Tensor Core与CUDA软件栈进行深度优化。实测数据显示,在单块H100 GPU上其生成速度可达每秒1000至1479个Token,单次生成耗时约0.84秒;在消费级RTX 5090上速度约为每秒700+ Token,在DGX Spark系统上达到每秒150 Token。模型支持256K上下文长度,并具备在生成过程中迭代纠错的能力,以维持输出稳定性。
尽管推理速度显著提升,谷歌官方明确界定该模型当前定位为面向研究人员与开发者的实验性产品,建议在生产环境中优先使用标准Gemma 4版本。性能测试表明,DiffusionGemma在代码生成任务中表现优异,HumanEval得分为89.6%,LiveCodeBench为30.9%,BigCodeBench为45.4%,数学能力AIME 2025得分为23.3%。然而在科学推理(GPQA Diamond 40.4%)与复杂逻辑推理(BIG-Bench Extra Hard 15.0%)等基准测试中,其得分低于对比模型。该技术的推出被视为对非自回归架构在文本生成领域潜力的一次重要探索,为未来大模型在本地实时交互场景的应用提供了新的技术路径。