Ant Bailing 推出了 Ling-3.0-Flash,这是一种混合推理模型,其总参数量为 1240 亿,其中处于激活状态的参数为 51 亿。在推理能力及长文本处理任务方面的表现足以媲美甚至超越规模是其两到三倍的模型。该模型采用了 5:1 的混合注意力架构(包含 KDA 线性层与 MLA 层),并设置了 1/64 的专家激活比例,以此提升运行效率。针对拥有超过 10,000 种训练场景的智能体应用进行了优化,通过分层缓存技术可将首个token的处理延迟降低 60% 至 80%。目前该模型可在 OpenRouter 上免费试用一周,之后将正式开源。
评论 (0)
0/300





首页
