蚂蚁百灵开源Ling-2.6-flash,4卡H20条件下推理速度最快达340 tokens/s

市场资讯 2026-04-29 12:00:04
10秒看完全文要点
看要点

4月29日,蚂蚁集团旗下百灵大模型宣布Ling-2.6-flash正式开源,同步提供BF16、FP8、INT4等多个版本。这款总参数量104B、激活参数仅7.4B的Instruct模型,两周前曾以“Elephant Alpha”的匿名身份悄然登陆OpenRouter。

先匿名测试、再官宣开源,这种发布节奏并不多见。

据百灵大模型公众号披露,过去两周里团队持续收集来自开发者的真实反馈,针对使用体验进行了多轮优化,进一步改善了中英文自然切换能力,并提升了主流Coding框架中的适配效果。

一个细节值得注意:Ling-2.6-flash采用了混合线性架构,从底层优化计算效率。据官方数据,在4卡H20条件下,推理速度最快可达340 tokens/s,Prefill吞吐达到英伟达Nemotron-3-Super的2.2倍。

总参数量104B而激活参数仅7.4B,推理时约7%的参数被激活。配合FP8、INT4等量化版本的开放,实际部署的算力门槛被压到更低。

据百灵大模型官方披露,早期测试阶段的开发者反馈显示,Ling-2.6-flash在Agent任务和代码生成场景中的表现超出预期,中文长文本理解能力是其差异化优势之一。

从训练策略看,百灵团队在Token效率上做了针对性校准,力求以更精简的输出完成既定目标。这种“智效比”导向的设计思路,与此前开源社区对模型过度追求参数量扩张的反思形成呼应。

Ling-2.6-flash的开源是近期中国科技公司模型开源浪潮的最新一例。仅在4月28日至29日两天内,小米开源了MiMo-V2.5系列,商汤科技开源了SenseNova U1 Lite系列,英伟达也推出了Nemotron 3 Nano Omni。

蚂蚁百灵方面表示,多版本并行策略是为了方便开发者根据不同的硬件环境、推理成本和部署需求灵活选择。BF16版本适合追求精度的场景,FP8和INT4则分别面向成本敏感型和边缘端部署需求。

市场有风险,投资需谨慎。本文为AI基于第三方数据生成,仅供参考,不构成个人投资建议。

热搜

科技财经资讯风格

财经频道更多独家策划、专家专栏,免费查阅>>

金融界提醒:本文内容、数据与工具不构成任何投资建议,仅供参考,不具备任何指导作用。股市有风险,投资需谨慎!
全部评论
谈谈您的想法...
AI解读分析
打开App
推荐 要闻 7x24 理财 财 经 导航