模型Inkling-Small:开放权重多模态模型上线
此模型热度与下载量显示开发者对多模态开放权重模型的兴趣,其稀疏 MoE 架构可能提升推理效率,对应用开发有潜在影响。
TOPIC · CURATED VIEW
追踪基础模型、推理能力、上下文与训练方法的关键变化,不收录只有参数宣传的更新。
此模型热度与下载量显示开发者对多模态开放权重模型的兴趣,其稀疏 MoE 架构可能提升推理效率,对应用开发有潜在影响。
Qwen3.8 是开源 Qwen 系列最新一代,相比 Qwen3.5 和 3.6 在核心能力上有实质性提升,且 27B 为紧凑型稠密模型,易于部署,并原生支持图像视频,扩展了多模态应用场景,对开源社区和开发者有重要意义。
Inkling是开放权重的多模态模型,同时支持文本、图像和音频输入,可降低开发者构建多模态AI应用的门槛。此前多模态模型多由大公司闭源提供,Inkling为社区提供了可自由定制和部署的选择。
这是首个在消费级硬件上无需云端即可运行的、整合了完整代理能力(推理、工具调用、故障恢复)的 300 亿参数模型,可能改变了代理类应用的部署模式,降低了对云端的依赖。
Ling-3.0-flash 以远小于前代旗舰模型的参数规模(活跃参数仅为前者的 8.1%)宣称达到同等或更优性能,且主打长上下文效率和生产环境部署能力,可能改变高效推理模型的竞争格局。
此前主流开源大模型在长上下文场景下推理成本极高或上下文窗口有限。Solar-Open2-250B通过混合注意力和稀疏激活,以接近小模型的推理成本提供大模型能力,同时支持百万token,为代理型应用(如文档分析、代码生成)提供了更实用的开源选择。
以往推理模型为提高准确性往往需要大量思考token,ThinkingCap通过微调在不牺牲质量的前提下大幅压缩token,使模型在保持性能的同时显著提升推理速度并降低成本。
该模型以不到其他模型三分之一参数实现超越,证明循环架构能有效提升小模型代理能力。此前小模型在复杂代理任务上表现较弱,Nanbeige4.2-3B填补了这一空白,为资源受限场景提供可行方案。
此前多模态模型多依赖预训练视觉编码器并均匀采样视频帧,导致实时流式感知时计算开销大、速度慢。Mage-VL 直接从零训练视觉编码器,并依据编解码器原理动态分配视觉标记,大幅减少标记数量,提升推理速度,为视频理解提供新的高效思路。
Hy3在Hy3 Preview基础上收集50+产品反馈并提升后训练数据质量,以21B激活参数达到更大模型的性能水平,降低部署成本同时增强agent能力,对中小规模AI应用落地意义重大。
该模型是蚂蚁百灵开源的 MoE 模型,总参数达 124B,激活参数仅 5.1B,显著降低推理成本,并提供多种量化版本,体现开源生态在模型效率和部署灵活性上的进展。
此前小型模型较少具备与更大模型竞争的智能体能力,LFM2.5-2.6B 以 2.6B 参数在工具使用和指令遵循上对标大 4 倍的模型,且能在常见消费级硬件上流畅运行,可能推动设备端智能体应用普及。
这是微软首次推出自研推理模型,表明其不再仅依赖外部模型或合作,而是独立构建核心推理能力,标志着其在AI推理领域的战略布局进入新阶段。
此前开源模型多在总参数量上竞争,而 Ling-3.0-tiny 强调推理时仅激活 1.3B 参数,总参数达 7.9B,这种“原生混合推理”设计有望在保持性能的同时降低推理成本,为小参数量模型的开源生态提供新思路。
腾讯混元推出 Hy ASR 3.0 preview,将语音识别与语义理解结合,支持上下文纠错和热词注入,相比传统 ASR 在准确性和场景适应性上有实质提升,尤其在粤语和高噪环境下表现突出,已落地腾讯云和元宝 App。
此前大模型性能提升主要依赖参数扩张,而 Agents‑A1 证明:通过横向扩展智能体能力(长程任务、多领域工具调用),较小的 MoE 模型也能达到同等效果,可能重塑模型研发成本与部署策略。
Inkling-Small 以四分之一的总参数规模实现与原版相当的性能,且仅需 12B 激活参数,意味着在保持性能的同时大幅降低了资源消耗。这标志着高效模型在保持能力上取得进展,可能推动大模型在更广泛场景的部署。
2.8万亿参数规模是国产大模型的显著突破,原生视觉理解与100万token上下文窗口大幅扩展应用场景;规模化效率提升2.5倍意味着相同算力下可处理更多任务,开源权重与Infra技术降低复现和二次开发门槛。
该模型以极低激活参数量实现与上一代旗舰模型相当的性能,大幅降低推理计算成本与延迟,尤其对长文本场景的响应速度提升显著,使高效部署低资源设备成为可能。