蚂蚁集团副总裁周俊提出,万亿参数模型每运行15分钟算力成本约相当于一辆特斯拉,效率是智能体时代必须最先解决的问题。团队通过7份Lightning Attention搭配1份MLA的混合线性改造,将256K长上下文成本从指数级降至线性级,配合Kpop算法与真实环境训练,使Token输出减少约4倍,千亿参数模型在真实Agent任务上超过部分更大规模模型。
技巧
·公众号:蚂蚁百灵(Ling)
蚂蚁集团周俊:如何用混合线性改造提升万亿参数模型的Token密度
— 演讲实录 | 从 Token 数量到 Token 密度:万亿参数规模下的高效智能体智能