模型Inkling-Small:开放权重多模态模型上线
此模型热度与下载量显示开发者对多模态开放权重模型的兴趣,其稀疏 MoE 架构可能提升推理效率,对应用开发有潜在影响。
TOPIC · CURATED VIEW
关注模型跨文本、图像、音频和视频理解与交互的能力进展。
此模型热度与下载量显示开发者对多模态开放权重模型的兴趣,其稀疏 MoE 架构可能提升推理效率,对应用开发有潜在影响。
Qwen3.8 是开源 Qwen 系列最新一代,相比 Qwen3.5 和 3.6 在核心能力上有实质性提升,且 27B 为紧凑型稠密模型,易于部署,并原生支持图像视频,扩展了多模态应用场景,对开源社区和开发者有重要意义。
Inkling是开放权重的多模态模型,同时支持文本、图像和音频输入,可降低开发者构建多模态AI应用的门槛。此前多模态模型多由大公司闭源提供,Inkling为社区提供了可自由定制和部署的选择。
这是首个在消费级硬件上无需云端即可运行的、整合了完整代理能力(推理、工具调用、故障恢复)的 300 亿参数模型,可能改变了代理类应用的部署模式,降低了对云端的依赖。
以往推理模型为提高准确性往往需要大量思考token,ThinkingCap通过微调在不牺牲质量的前提下大幅压缩token,使模型在保持性能的同时显著提升推理速度并降低成本。
此前多模态模型多依赖预训练视觉编码器并均匀采样视频帧,导致实时流式感知时计算开销大、速度慢。Mage-VL 直接从零训练视觉编码器,并依据编解码器原理动态分配视觉标记,大幅减少标记数量,提升推理速度,为视频理解提供新的高效思路。
通义千问兑现开源承诺,推出参数更小的Qwen3.8-27B,性能却超越前代Plus级模型,且支持极长上下文,并采用宽松的Apache 2.0许可,这降低了开发者使用和二次开发的门槛。同时开放2.4T超大规模模型权重,为研究社区和商业应用提供了新的选择,可能推动多模态和长文本场景的落地。
dots3-note Preview 的开源为开发者提供了一个轻量且支持长上下文和多模态的模型选择,降低了长程智能体与多模态应用的门槛,可能推动相关领域的技术普及。
这是世界首个开放的3T级模型,通过新架构KDA和AttnRes以及Stable LatentMoE框架,激活16/896专家,整体缩放效率比上一代Kimi K2提升约2.5倍,使更大规模的开源多模态智能体模型成为可能。
相比以往需分块处理的 OCR 模型,Unlimited-OCR 宣称支持一次性长视界解析,可能降低复杂文档(如长合同、书籍)的多步预处理成本,提升整体处理效率。
该模型相比前代 K2.6 在编码代理能力上有实质性提升,同时显著降低了推理时的思考 token 消耗,这意味着在复杂软件工程任务中可更高效地使用模型,降低算力成本。
此前多模态模型多针对单模态或简单组合,此次 FLUX 3 Video 在 OpenRouter 平台向所有人开放,提供一个基础上同时覆盖视频、音频、图像和动作预测的统一模型家族,降低了多模态应用开发的接入门槛。
以往推理与图像生成通常由不同模型或流程完成,SenseNova U1 将两者统一,可能简化多模态任务的处理方式,降低集成复杂性,并提高内容生成的连贯性。
商汤发布轻量级开源模型,以8B参数实现接近闭源商业模型的多模态生成与编辑质量,可能降低高质量多模态模型的使用门槛,并加剧开源与闭源模型的竞争。
此前开源视频模型多在分辨率、时长或音频能力上有所取舍,H3同时支持2K分辨率、15秒时长和32kHz原生立体声,且统一处理多模态输入,标志着开源模型在多模态生成能力上的新水平。
Kimi K3 是首个 2.8T 参数的开源 MoE 模型,并具备原生视觉理解与 1M token 超长上下文。每单位计算智能提升 2.5 倍,意味着更强的性能与更低的推理成本,且开源了配套基础设施,降低了多模态、长上下文应用的开发门槛。