Google 发布实验性开源模型 DiffusionGemma,采用文本扩散技术并行生成 256 token 块,推理速度最高提升 4 倍。该 26B MoE 模型仅激活 3.8B 参数,量化后适配 18GB VRAM 消费级 GPU,在单张 H100 上达 1000+ tokens/s。
模型
·Google AI:DEV 作者专属(RSS)
DiffusionGemma 发布:文本扩散模型实现 4 倍加速推理
— DiffusionGemma: 4x faster text generation