AI 周报
2026 年第 29 周
- 本期重点
- 24
- 预计阅读
- 13 分钟
本周AI领域呈现多重结构性变化:开放权重多模态模型(Inkling)、超长上下文模型(GLM-5.2)及高效推理模型(ThinkingCap、Hy3)集中涌现,推动部署门槛下降;企业端AI采纳从试点转向规模化,三星、BBVA、MUFG等巨头全员部署ChatGPT;OpenAI联合Broadcom推出定制推理芯片Jalapeño,红队系统GPT-Red实现自博弈安全改进。产品侧,AI代理渗透至测试、医疗、股权管理、工作流等垂直场景。论文研究聚焦代理效率(E3框架)、治理(Traccia)及前瞻记忆评估(PM-Bench),多模态生成与推理能力持续提升。
PERIOD HIGHLIGHTS
本期看点
MODEL RADAR
模型进展
多模态开放权重模型Inkling、能力对标万亿参数规模的Agents‑A1、长上下文旗舰GLM-5.2(1M token)、高效推理ThinkingCap(减少50%思考token)及295B MoE模型Hy3等密集发布,共同推动模型在性能、效率与开源可及性上的突破。
Inkling:Hugging Face上新的通用多模态开放权重模型
2026年7月14日,Hugging Face上出现名为Inkling的多模态模型,支持文本、图像和音频输入,输出文本。该模型为66层decoder-only transformer架构,使用稀疏Mixture-of-Experts,每token激活6个专家和2个共享专家。开放权重,支持多种本地部署库和第三方API,适用于聊天、代码助手、RAG等场景。
ThinkingCap-Qwen3.6-27B:基于Qwen3.6微调减少50%思考token
ThinkingCap-Qwen3.6-27B是一个基于Qwen3.6-27B微调的模型,平均减少50%的思考token,最佳案例减少90%以上。在GPQA-Diamond、MMLU-Pro等多个基准测试中,准确率基本持平或略有提升,同时大幅降低了推理所需的token数量。
腾讯Hy3:295B参数MoE模型,性能超越同尺寸开源模型
腾讯Hy团队发布Hy3模型,总参数295B,激活参数21B,采用MoE架构,支持256K上下文。性能优于同尺寸模型,可媲美参数2-5倍的旗舰开源模型,在agent能力和产品可靠性方面有显著提升。
GLM-5.2 模型发布
GLM-5.2 在 Hugging Face 上发布,是一款长视野任务旗舰模型,首次实现稳定 1M token 上下文,并通过 IndexShare 架构将每 token FLOPs 降低 2.9 倍,MTP 层提升推测解码接受长度 20%。模型采用 MIT 开源许可,无地域限制。基准测试中,GLM-5.2 在 AIME 2026 上达到 99.2,在 HLE 上为 40.5(使用工具 54.7),在 CritPt 上为 20.9,均超越前代 GLM-5.1 并接近或超过部分竞品。当前热度分 230,点赞 4063,下载 534698。