新闻新基准测试证实 AI 模型视觉感知能力仍不佳
此前评估多模态模型时,常将错误归因于推理环节。PerceptionBench 将视觉感知与逻辑推理分离,揭示多数错误发生在早期图像读取阶段,这改变了人们对模型能力瓶颈的认知,有助于更精准地定位和解决基础感知问题。
TOPIC · CURATED VIEW
关注模型跨文本、图像、音频和视频理解与交互的能力进展。
此前评估多模态模型时,常将错误归因于推理环节。PerceptionBench 将视觉感知与逻辑推理分离,揭示多数错误发生在早期图像读取阶段,这改变了人们对模型能力瓶颈的认知,有助于更精准地定位和解决基础感知问题。
QwenLM 团队发布了 Qwen-MM-Plugins,这是一套插件,旨在让智能体原生支持多模态能力。它能够处理图片、视频和文档,支持视频编辑以及 3D/CAD 数据处理,从而将多模态模型升级为多模态智能体。该项目的演示效果可在其 GitHub 仓库中查看。
此模型热度与下载量显示开发者对多模态开放权重模型的兴趣,其稀疏 MoE 架构可能提升推理效率,对应用开发有潜在影响。
此前关于LLM服务的研究多聚焦于技术提案,缺乏对其实际采用情况的了解。该研究揭示了真实项目中框架和方法的使用模式,有助于产品经理和技术决策者理解市场现状,指导技术选型和架构设计。
该视频将前沿VLM/VLA模型引入实际机器人操作,区别于以往单纯模型演示,展示了从模型选型到物理控制的完整路径,可能降低开发者构建物理AI应用的门槛。
Meta AI 超级智能实验室发布了首个开放权重模型 Muse Glimmer,并已上线 OpenRouter。这是一款 30B 参数的密集文本+图像模型,采用 Apache 2.0 许可证,定位为可靠的本地智能体,MCP Atlas 得分 75.5,SWE-Bench Pro 得分 51.2。
Qwen3.8 是开源 Qwen 系列最新一代,相比 Qwen3.5 和 3.6 在核心能力上有实质性提升,且 27B 为紧凑型稠密模型,易于部署,并原生支持图像视频,扩展了多模态应用场景,对开源社区和开发者有重要意义。
相比依赖云端的健康助手,ECHO 可在消费硬件本地运行,数据不外传,符合 GDPR 和 KVKK,可能降低隐私合规成本。其安全层超越零样本 LLM,如 Llama 3.3 70B,表明小型模型结合专用模块可达到实用水平,对资源受限场景有意义。
机器人基础模型此前多依赖单一方法,而 WAM 和 VLA 各有优劣。Cosmos 3 将动作作为原生模态,并开源模型、数据集和配方,可能改变机器人策略的训练与部署方式,值得关注。
Inkling 是一个开放权重(open weights)的多模态模型,参数量达 975B,专为微调(fine-tuning)场景设计。该产品允许开发者直接获取预训练权重,并在此基础上针对特定任务进行后训练或定制化调整。目前未公布发布方及具体部署方式,但开放权重特性暗示用户可自行托管和修改模型。
Inkling是开放权重的多模态模型,同时支持文本、图像和音频输入,可降低开发者构建多模态AI应用的门槛。此前多模态模型多由大公司闭源提供,Inkling为社区提供了可自由定制和部署的选择。
现有智能体系统在跨设备场景中缺乏有效状态管理,多智能体系统也未维护跨设备、跨时间的紧凑携带状态。该论文提出以状态设计为核心的原则,并通过基准测试证明其优势在多种 MLLM 设置下稳健,为跨设备智能体的设计提供了新方向。
此前自动驾驶模型多为前视单摄像头,缺乏全景上下文;人工标注长尾驾驶场景成本高、周期长。Alpamayo 2 Super通过开源与自动标注技术,显著降低开发成本和时间,并扩展至任意驾驶领域和地理区域,可能推动自动驾驶研发范式转变。
小红书技术团队开源 BigMac,一种针对多模态大模型训练的依赖安全嵌套流水线新范式。它利用 LLM 流水线作为主干,在不打乱执行顺序的前提下嵌入编码器和生成器计算,相比基线实现 1.08x-1.9x 加速,同时保持激活显存有界。BigMac 已作为 dots 多模态模型训练的核心组件投入生产。
这是首个在消费级硬件上无需云端即可运行的、整合了完整代理能力(推理、工具调用、故障恢复)的 300 亿参数模型,可能改变了代理类应用的部署模式,降低了对云端的依赖。
此前多模态时间序列LLM难以处理临床数据的稀疏性、异步性和不规则采样模式。ClinPRISM通过专用架构解决了这一关键局限,并以极低的计算成本(仅16个令牌)实现了快速推理(0.15秒),使临床问答更实用。
Inkling 是罕见的大规模开源多模态 MoE 模型,原生统一处理图像、文本和音频,无需独立编码器,并拥有 1M 上下文窗口。其 Day-0 工具支持和多种量化版本降低了本地部署门槛,可能推动多模态应用和长上下文任务的发展。
以往推理模型为提高准确性往往需要大量思考token,ThinkingCap通过微调在不牺牲质量的前提下大幅压缩token,使模型在保持性能的同时显著提升推理速度并降低成本。
此前 ISAC 相关研究(如基于学习的感知、资源分配、RIS、边缘智能、多智能体协调和弹性网络)大多孤立发展,缺乏统一视角。该综述首次将智能体 AI 与 ISAC 系统性地结合,提出闭环框架和成熟度分级,为这一领域提供了统一的研究坐标系,有助于后续研究聚焦、比较和推进。
多模态模型从任务专用走向统一模型,试图打通感知、理解、推理与生成,这一变化可能重塑模型架构和评测标准,对多模态 AI 产品的发展方向有潜在影响。
此前多模态模型多依赖预训练视觉编码器并均匀采样视频帧,导致实时流式感知时计算开销大、速度慢。Mage-VL 直接从零训练视觉编码器,并依据编解码器原理动态分配视觉标记,大幅减少标记数量,提升推理速度,为视频理解提供新的高效思路。
此前训练后适配技术文献分散,不同技术族、模型类别与部署场景之间难以比较,也缺乏统一术语,导致无法清晰描述模型如何被修改。该论文首次引入系统化六维分类法,统一了术语并为模型变更追踪和治理提供了分析框架,填补了这一空白。
此前视频生成与编辑模型均为离线处理,需完整处理整段视频后才能查看结果,无法边播边改。JoyAI-Video-Edit首次将流式与实时结合,达到24帧流畅播放门槛,使实时编辑直播、视频通话等活视频流成为可能,改变了视频编辑的交互范式。
通义千问兑现开源承诺,推出参数更小的Qwen3.8-27B,性能却超越前代Plus级模型,且支持极长上下文,并采用宽松的Apache 2.0许可,这降低了开发者使用和二次开发的门槛。同时开放2.4T超大规模模型权重,为研究社区和商业应用提供了新的选择,可能推动多模态和长文本场景的落地。
此前开源统一多模态模型在生成质量和速度上普遍落后于闭源系统,Boogu-Image-0.1证明在有限算力下通过优化数据质量、训练管道和推理时缩放即可达到接近闭源产品的水平,且完全开源,降低了高端图像生成与编辑模型的使用和定制门槛。
此前用户只能输入碎片化关键词获得蓝色链接列表;现在搜索框成为一个多模态对话界面,能接受文件、图片等,并引导用户提问。这是 Google 搜索产品定位的根本转变——从结果检索变为 AI 对话入口。
dots3-note Preview 的开源为开发者提供了一个轻量且支持长上下文和多模态的模型选择,降低了长程智能体与多模态应用的门槛,可能推动相关领域的技术普及。
通用病理基础模型在细粒度亚型分型上表现不足,而 CorePath 展示了针对乳腺专科微调的有效性,在公开基准上超越了领先模型,并显著降低非乳腺幻觉,意味着专科化基础模型可能成为病理 AI 提升临床可用性的关键路径。
Qwen 3.8将超大参数规模多模态模型以开源权重形式开放,直接对标闭源领先模型,可能降低高端AI能力的获取门槛,推动开源生态竞争。
这是世界首个开放的3T级模型,通过新架构KDA和AttnRes以及Stable LatentMoE框架,激活16/896专家,整体缩放效率比上一代Kimi K2提升约2.5倍,使更大规模的开源多模态智能体模型成为可能。