AI 月报
2026 年 8 月
- 本期重点
- 28
- 预计阅读
- 19 分钟
2026年8月,开源模型竞争加剧,DeepSeek V4 Flash 0731与Inkling-Small相继发布,性能与效率并重,推动开源模型进入第一梯队。行业动态显示企业AI应用走向系统化,Univé借ChatGPT Enterprise构建AI劳动力,Thinking Machines则探索高效小模型路线。论文研究聚焦多模态智能体推理、硬件感知自主、递归自我改进、动态剪枝、运维基准及语言多样性,展现AI在可靠性、效率与伦理层面的多维进展。
PERIOD HIGHLIGHTS
本期看点
MODEL RADAR
模型进展
DeepSeek V4 Flash 0731开源,智能指数50分列开源前三;Inkling-Small以12B激活参数持平原版性能,均代表高效模型新进展。
Inkling-Small:开放权重多模态模型上线
Inkling-Small 是 Hugging Face Trending 上的一个多模态模型,支持文本、图像和音频输入并生成文本,采用 42 层解码器架构和稀疏 MoE(每 token 路由到 6/256 专家)。该模型发布于 2026-07-27,热度分 213,点赞 213,下载 3998,提供开放权重,支持 SGLang、vLLM 等本地部署。
Qwen3.8-27B:新一代视觉语言模型发布
Hugging Face 模型热度榜出现 Qwen3.8-27B,这是一个原生视觉语言模型,支持图像与视频理解,具备灵活思维控制,可执行复杂多步骤任务。该模型基于 Qwen3.5 架构,在编程、专业工作、研究和长程智能体任务方面有显著提升,并提供约 1M 上下文、内置工具等托管版本功能。模型热度分 9433,点赞 9803,下载 91917。
DeepSeek V4闪存版官方发布,智能体能力大幅增强
DeepSeek发布V4-Flash官方版(DeepSeek-V4-Flash-0731),替代预览版,在多个智能体基准上超越V4-Pro预览版,并接近或超过GLM-5.2和Opus-4.8等模型。该模型与V4-Flash-DSpark结构相同,附带了投机解码模块,且激活参数更少。
Qwen 发布开源模型 Qwen3.8-2.4T-A95B
Hugging Face 趋势榜出现新模型 Qwen3.8-2.4T-A95B,由 Qwen 团队发布,属开源文本生成模型,兼容 vLLM、SGLang 等推理框架。该模型是 Qwen3.8 系列的开源版本,宣称首次将 Qwen-Max 级能力开源,在编码、专业工作、研究和长程智能体任务上较 Qwen3.5 有全面提升,并支持官方云端服务。
Ling-3.0-flash 模型发布
Hugging Face 趋势榜出现新模型 Ling-3.0-flash,总参数 1240 亿,激活参数 51 亿,采用原生混合线性注意力架构,配备 1/64 稀疏 MoE。官方称其在关键基准上匹敌或超越前代旗舰模型,并集成 1 万多个交互式训练环境,用于编码、通用等任务。
PRODUCT
产品与商业
LaraCopilot:智能体 AI 工程师,可构建真实应用
LaraCopilot 是一款由 Product Hunt 发布的智能体 AI 工程师产品,其核心能力是能够自动构建真实可用的应用程序,为开发流程提供端到端的辅助。
Open Minis:端侧运行的开源安全 AI 代理
Open Minis 是一款在 Product Hunt 上发布的端侧 AI 代理产品,可直接在手机上运行,强调开放与安全。它试图将 AI 代理能力带到移动设备,让用户无需依赖云端即可使用。目前该产品尚处于早期发布阶段,具体功能和性能细节有限。
Inventory:搜索所有 AI Agent 与 IDE 对话
Inventory 是一款由未知团队在 Product Hunt 上发布的产品,其核心功能是让用户能够搜索所有 AI Agent 与 IDE 的对话记录。它旨在解决对话散落在不同工具中难以检索的问题,提供一个统一搜索入口。产品类型为效率工具,面向使用多个 AI 开发工具的开发者或团队。发布信息显示该产品于 2026 年 8 月 2 日在 Product Hunt 上线,但具体功能细节、价格及支持范围未在证据中说明。
ThreadPort:一键在不同 AI 助手间迁移聊天记录
ThreadPort 是 Product Hunt 上发布的一款工具,支持将 AI 聊天记录在 ChatGPT、Claude 和 Gemini 之间一键迁移,解决用户在不同 AI 助手间切换时无法保留对话上下文的问题。
INDUSTRY
行业动态
Univé案例表明企业AI转向全员能力建设与治理前置;Thinking Machines发布小模型Inkling Small,性能反超原版,影响市场预期。
OpenAI 为 ChatGPT Business 推出 125 美元高级席位,应对代理式 AI 高 token 消耗
OpenAI 面向 ChatGPT Business 客户推出 Premium Seats(高级席位),每个用户每月收费 125 美元,是现有 Standard Seats(标准席位)价格的五倍。新席位提供显著更高的容量,并取消了五小时使用时限。此举表明,此前 AI 提供商提供的统一定价模式无法持续,OpenAI 正通过差异化定价应对代理式 AI 带来的更高 token 消耗。
OpenAI首款AI硬件曝光;DeepSeek拟上调API定价;字节被曝将训练超5万亿参数模型
极客公园在2026年8月7日凌晨发布了一期新闻摘要,内容包括:OpenAI首款AI硬件曝光;DeepSeek拟上调API服务定价;字节跳动被曝计划训练超5万亿参数的超大模型。此外,还提到深圳出现国产消费级3D打印机'四小龙',小红书加大AI投入并关注情感陪伴,Bose推出新一代QuietComfort头戴式耳机。
Anthropic 推出水印检测 API,供第三方识别 Claude 生成的文本
Anthropic 宣布将推出水印检测 API,允许第三方检测文本是否由 Claude 生成。该技术基于 Google 的 SynthID 方法,通过调整选词随机性来实现,且不影响文本质量。但该方法在处理事实密集型文本、代码和重度改写时存在局限。
投资多智能体AI安全研究
Google DeepMind 与其合作伙伴于2026年6月10日宣布,将投入1000万美元资助多智能体人工智能安全研究,以推动该领域的进展。
OpenAI 预览 Ultrafast 模式:GPT-5.6 Sol 速度提升至 14 倍
RESEARCH
论文研究
八篇论文覆盖多模态推理、硬件感知、自我改进、动态剪枝、运维基准、语言多样性等,推动AI在可靠性与效率上的边界。
AiFlow:面向流式 LLM 应用的 Token 原生反应式编排与有界背压
arXiv AI 发布论文《AiFlow: Token-Native Reactive Orchestration with Bounded Backpressure for Streaming LLM Applications》,提出一种面向流式 LLM 应用的反应式编排模型。AiFlow 将 provider 增量标准化为 Context 事件,并通过有界背压机制管理队列和并发。实验显示,相比聚合方式,应用端首包时间(TTFPT)降低 70.9%-94.7%,队列深度下降 93.7%-96.5%。
多智能体评估对角色扮演语言智能体的对抗压力测试
arXiv 发布论文,提出多智能体对抗评估平台,用于压力测试角色扮演语言智能体(RPLAs)。系统含审讯代理、目标代理和评判代理,通过六种渐进对抗策略进行多轮对话测试。实验覆盖三种角色和三家前沿LLM,发现多策略对抗评估能揭示单策略遗漏的失败模式,平均降低鲁棒性评分0.17-0.20,并验证了跨模型一致性退化。
LLM服务的实证研究:框架、方法与系统设计
一项实证研究调查了开源软件系统中LLM服务框架和方法的使用情况,分析了vLLM、SGLang、TensorRT-LLM、LMDeploy和FlashInfer五个框架。结果显示vLLM在流行度和采用率上最突出,并行计算、内存管理和网络剪枝是最常用的服务方法类别,多框架使用有限但能互补。
现行AI基准未测项:模态、搜索与引用及其安全评估启示
一项针对广泛使用的LLM的审计研究发现,其评估结果受访问方式、是否启用网络搜索和重复运行次数影响。该研究比较了ChatGPT聊天界面和OpenAI API,使用来自BBQ和SafetyBench的401个提示共采集4812条响应。结果显示,启用网络搜索可使准确率下降最多8个百分点,且聊天界面在禁用搜索时准确率低于API。同一提示重复运行在最多21%的情况下产生不一致响应,且不同方式的引用依据和回避行为也不同。