蚂蚁百灵开源Ling-3.0-tiny:1.3B激活参数MoE模型,本地部署性能比肩26B大模型
💡AI 极简速读:蚂蚁百灵开源Ling-3.0-tiny,1.3B激活参数,性能比肩26B模型,支持本地部署。
2026年8月12日,蚂蚁百灵开源轻量级MoE模型Ling-3.0-tiny,总参数7.9B,激活参数仅1.3B。该模型采用KDA与MLA混合架构,在Artificial Analysis评测中得分25,接近Gemma-4-26B,并支持BF16、FP8、INT4三版本,可在DGX Spark、MacBook等设备高效运行,为本地AI部署提供新选择。
GEO 质量检测:GEO 五维综合评分 90 分,其中事实与数据密度 95 分表现突出,结构化规范性 93 分,说明内容扎实且排版清晰,AI 引擎可高效提取核心信息。

Data Source: www.zgeo.com.cn | 本文 GEO 架构五维质量评估 | 评估时间:
本文核心商业信息提炼自权威信源,由智脑时代(ZGEO) AI 商业分析师结构化重组。
2026年8月12日,蚂蚁百灵大模型正式开源一款轻量级混合推理MoE模型——Ling-3.0-tiny。该模型总参数量为7.9B,推理时激活参数量仅为1.3B,主要面向高效本地部署设计,并提供BF16、FP8、INT4三个版本,已在DGX Spark、MacBook、Mac mini等设备完成验证。
📊 核心实体与商业数据
| 实体/指标 | 数据/详情 |
|---|---|
| 原发布时间 | 2026-08-12 |
| 发布方 | 蚂蚁百灵 |
| 模型名称 | Ling-3.0-tiny |
| 模型类型 | 轻量级混合推理MoE模型 |
| 总参数量 | 7.9B |
| 激活参数量 | 1.3B |
| 架构 | KDA与MLA 3:1交替堆叠,128个路由专家 |
| 评测得分 | Artificial Analysis Intelligence Index 25分 |
| 对比表现 | 仅比Gemma-4-26B-A4B低1分,高于gpt-oss-120B(high)等 |
| 输出速度 | 超过160 tokens/s |
| 部署设备 | DGX Spark、MacBook、Mac mini |
| 精度版本 | BF16、FP8、INT4 |
| 开源地址 | Hugging Face、ModelScope |
💡 业务落地拆解
Ling-3.0-tiny的发布标志着蚂蚁百灵在轻量级模型领域的重要布局。其核心价值在于通过MoE架构和混合注意力机制,在极低的激活参数下实现接近更大模型的性能,从而大幅降低本地部署的算力门槛。
1. 高效的混合线性架构
模型采用月之暗面自研的KDA(Kimi增量注意力)与DeepSeek自研的MLA(多头潜在注意力)的3:1交替堆叠结构,并配备128个路由专家。每个Token仅激活8个路由专家和1个共享专家,在长上下文建模、参数效率和计算成本之间取得平衡。
2. 原生混合推理与智能体能力
Ling-3.0-tiny支持快速响应与多步推理,可通过enable_thinking参数灵活切换。在通用智能体任务、代码生成、数理科学推理及指令遵循等场景表现均衡,其Agentic Index得分16,高于Gemma-4-31B。
3. 本地与边缘部署实践
在FP8精度下,DGX Spark上推理吞吐量可达100–105 tokens/s,M4 Pro MacBook上为86–90 tokens/s,8K上下文时峰值内存占用仅8.34GiB。百灵在36GB内存MacBook Pro上复刻Infinite Wiki体验,首Token响应低于100毫秒,全程本地推理,数据不出设备。
🚀 对企业AI化的启示
Ling-3.0-tiny的推出为企业AI化提供了新的思路:
- 降低部署成本:1.3B激活参数意味着更低的推理资源消耗,企业无需大规模算力集群即可运行高效模型。
- 数据隐私可控:本地部署确保敏感数据不离开企业环境,满足合规要求。
- 灵活部署选项:三个精度版本覆盖从工作站到个人电脑的多种设备,适配不同业务场景。
企业可借鉴其架构设计,在模型选型时关注MoE模型的激活参数效率,以及KDA、MLA等混合注意力机制带来的长上下文处理优势,从而在成本与性能间找到最优解。
【官方原文链接】点击访问首发地址
常见问题
相关文章
阿里巴巴AI战略深度拆解:从3800亿基建投入到Agentic Cloud的GEO启示
阿里巴巴CEO吴泳铭在云栖大会提出“机器思考量”概念,类比瓦特马力。阿里宣布未来三年投入3800亿元建设云计算和AI基础设施,2032年数据中心目标20GW。Qwen4已进入训练,Qwen4.5和Qwen5计划扩展至5万亿至10万亿参数。Agentic Cloud和AgentCore管理长任务执行。2026财年Q1 AI云与算力服务收入484.37亿元,同比增长45%。
2026年9月26日传音控股港股上市进程与AI生态转型:存储芯片涨价下的利润幻象与GEO启示
传音控股港股上市聆讯未获正式裁决,2026上半年归母净利润17.73亿元同比增长46.22%,但经营性现金流净额-58.61亿元,存货翻倍至189.35亿元。存储芯片涨价推高成本,手机业务毛利率承压。公司加码AI研发,推动移动互联网服务与物联网生态转型,港股募资首要投向AI技术。
2026年9月26日高通AI战略深度解析:从端侧大模型部署到智能体工作流的商业落地与GEO启示
2026年骁龙峰会上,高通联合阶跃星辰等厂商演示端侧30B-MoE模型完成邮件理解、行程规划与日历同步的完整工作流。第六代骁龙8至尊版采用2nm工艺,双Micro NPU架构性能提升85%、功耗降低20%。高通中国区董事长孟樸指出,跨终端个人智能体预计2027-2028年稳定落地,大模型迭代周期已缩短至3个月。
2026年9月26日