AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
AILORE SIFT情报简报
日报周报月报

往期日报

8月16日星期日78月15日星期六148月14日星期五168月13日星期四148月12日星期三158月11日星期二108月10日星期一78月9日星期日98月8日星期六118月7日星期五98月6日星期四118月5日星期三128月4日星期二178月3日星期一108月2日星期日98月1日星期六97月31日星期五37月30日星期四117月29日星期三147月28日星期二177月27日星期一157月26日星期日87月25日星期六77月24日星期五107月23日星期四107月22日星期三117月21日星期二137月20日星期一107月19日星期日17月18日星期六57月17日星期五127月16日星期四10
返回情报流
AILORE SIFTDAILY · 2026.08.13

AI 日报

2026年8月13日星期四

本期重点
14
预计阅读
9 分钟
01模型进展202产品与商业303行业动态504论文研究4
00

PERIOD HIGHLIGHTS

本期看点

  1. 01Qwen 发布开源模型 Qwen3.8-2.4T-A95B模型
  2. 02微软首发自研推理模型MAI-Thinking-1模型
  3. 03LaraCopilot:智能体 AI 工程师,可构建真实应用产品
  4. 04BearDrive:团队 AI 代理的开源共享文件夹产品
  5. 05Cohesor:面向企业AI代理的中立控制平面产品
01

MODEL RADAR

模型进展

2 条
Hugging Face Model Radar1

Qwen 发布开源模型 Qwen3.8-2.4T-A95B

Hugging Face 趋势榜出现新模型 Qwen3.8-2.4T-A95B,由 Qwen 团队发布,属开源文本生成模型,兼容 vLLM、SGLang 等推理框架。该模型是 Qwen3.8 系列的开源版本,宣称首次将 Qwen-Max 级能力开源,在编码、专业工作、研究和长程智能体任务上较 Qwen3.5 有全面提升,并支持官方云端服务。

为什么值得看此前 Qwen-Max 级能力仅限闭源 API,本次 Qwen3.8-2.4T-A95B 将同类能力开源,使开发者可自行部署,降低了使用高性能模型的门槛,可能影响行业对开源与闭源模型的性能认知和选型。
AIHOT · X / 公众号精选1

微软首发自研推理模型MAI-Thinking-1

微软于2026年8月12日宣布其首个自研推理模型MAI-Thinking-1已上线,该模型从零开始构建,现已在Microsoft Foundry平台提供使用。

为什么值得看
这是微软首次推出自研推理模型,表明其不再仅依赖外部模型或合作,而是独立构建核心推理能力,标志着其在AI推理领域的战略布局进入新阶段。
02

PRODUCT

产品与商业

3 条
Product Hunt1

LaraCopilot:智能体 AI 工程师,可构建真实应用

LaraCopilot 是一款由 Product Hunt 发布的智能体 AI 工程师产品,其核心能力是能够自动构建真实可用的应用程序,为开发流程提供端到端的辅助。

为什么值得看相比传统代码生成工具仅提供代码片段或补全,LaraCopilot 定位为“构建真实应用”的智能体,可能意味着从需求到可运行软件的更高自动化程度,值得开发者关注其实际效果。
Product Hunt0

BearDrive:团队 AI 代理的开源共享文件夹

BearDrive 是一款开源产品,由产品发布平台 Product Hunt 于 2026 年 8 月 11 日推出,定位为团队 AI 代理的共享文件夹。它旨在为团队中的 AI 代理提供一个集中、开放的文件共享空间,解决 AI 代理之间文件协作与数据共享的需求,使多个 AI 代理能够协同访问和管理共享文件。

为什么值得看此前团队多使用私有或商业化的文件共享服务,而 BearDrive 专门针对 AI 代理设计,且开源,降低了团队构建 AI 协作流程时的工具门槛,使 AI 代理的文件交互更加透明、可控。
Product Hunt0

Cohesor:面向企业AI代理的中立控制平面

Cohesor 是一款面向企业 AI 代理的中立控制平面产品,于2026年8月12日在 Product Hunt 发布。它旨在为企业的 AI 代理提供统一的中立管理界面,解决企业在多代理环境中缺乏中立协调层的问题。目前已知信息有限,仅确认其定位和发布时间,具体功能细节尚未披露。

为什么值得看此前企业 AI 代理往往由单个供应商或模型控制,缺乏中立协调层。Cohesor 提出“中立控制平面”,可能意味着企业能在不绑定特定模型或供应商的前提下统一管理多个 AI 代理,这可能是企业采用更灵活、可组合的 AI 工作流的重要基础设施变化。
03

INDUSTRY

行业动态

5 条
Google DeepMind Blog1

投资多智能体AI安全研究

Google DeepMind 与其合作伙伴于2026年6月10日宣布,将投入1000万美元资助多智能体人工智能安全研究,以推动该领域的进展。

为什么值得看这是对多智能体安全研究的大规模资金注入,表明主要科技公司开始重视多智能体系统的潜在风险,可能加速安全标准和最佳实践的建立。
The Decoder AI News1

微软 MAI Code 1.1 Flash 在价格和性能上均被 Deepseek 碾压

微软发布了用于 GitHub Copilot 的代码模型 MAI Code 1.1 Flash,宣称比前代节省 25% 的 token 且成本降低四分之三。但在基准测试中,该模型在价格和性能上均不及更便宜的 Deepseek V4 Flash。这一行为被解读为微软一边宣扬开放 AI,一边在应用中内置较差的专有模型以保护利润。

为什么值得看微软新发布的 MAI Code 1.1 Flash 在基准测试中不如价格更低的 Deepseek V4 Flash,这可能削弱 GitHub Copilot 的竞争力,并影响开发者对模型的选择,进而引发对微软专有模型策略的质疑。
TechCrunch AI1

OpenAI支持的Thrive Holdings融资20亿美元,进军企业AI领域

OpenAI支持的Thrive Holdings完成了20亿美元的新一轮融资,估值达到120亿美元。投资方包括软银、D1 Capital Partners和Altimeter Capital。此轮融资将用于推动企业级AI的落地。

为什么值得看此前Thrive Holdings的融资和估值未有公开报道,此次20亿美元的大规模融资显示了资本对企业AI市场的强烈信心,也反映了OpenAI在生态投资上的扩张,可能加剧企业AI领域的竞争。
OpenAI News1

从助手到执行:企业如何应用 AI

OpenAI 发布企业采用代理 AI 的研究,显示企业正使用 ChatGPT 和 Codex 等工具,前沿企业已在 AI 采用方面领先。

为什么值得看研究揭示企业从辅助性 AI 工具转向代理型 AI,前沿企业已领先,这可能改变企业 AI 部署的竞争格局。
Google DeepMind Blog1

Co-Scientist:基于 Gemini 的多智能体 AI 科研协作伙伴

Google DeepMind 于 2026 年 5 月 12 日发布博客,宣布推出基于 Gemini 的多智能体 AI 工具 Co-Scientist,旨在通过协作方式加速科研人员的科学突破。该工具被定位为研究伙伴,尚处于介绍阶段,具体功能细节尚未披露。

为什么值得看这是 Google DeepMind 首次公开其多智能体 AI 在科研协作领域的具体产品形态,表明大模型应用正从通用对话向垂直科研场景深化,可能改变科研人员的工作流程,并为 AI 辅助发现提供新范式。
04

RESEARCH

论文研究

4 条
Hugging Face Daily Papers1

Combodied Agents:以人为中心的智能体AI新范式

论文提出“Combodied Agents”这一以人为中心的智能体范式,将数字智能体与具身智能体结合,把感知、建模、预测和辅助个人状态轨迹作为核心,整合多种能力形成闭环,并使用有界且可纠正的表示而非完整数字孪生。

为什么值得看现有智能体要么只改变软件状态,要么只改变物理状态,均未将个人状态与主体性作为核心。Combodied Agents首次提出统一框架,将个人状态作为建模、干预和评估对象,可能推动AI从任务执行向人本辅助转变。
Hugging Face Daily Papers1

InSight-doc:用于长文档理解的智能体视觉感知

InSight-doc 是一个面向长文档理解的智能体视觉感知框架,将视觉分辨率视为自适应推理资源,从低分辨率开始选择性放大到高分辨率区域,无需外部检索器。研究构建了含 17.9K SFT 示例和 19.2K 强化学习示例的语料,通过 SFT+RL 训练后,InSight-doc-8B 在文档 VQA 基准上提升 4.3-16.4 个准确率点,长文档幻觉减少超 40%,推理延迟降低 41%-68%,同时保持准确率优势。代码、数据集和模型已开源。

为什么值得看此前长文档视觉理解通常固定使用高分辨率,推理成本高且易受上下文损坏影响。InSight-doc 将分辨率作为动态推理资源,按需放大,无需外部检索器,既提升准确率又显著降低延迟和幻觉,为长文档多页推理提出了一种更高效、可靠的新范式。
Hugging Face Daily Papers1

JigShape:通过拼图游戏评估视觉语言模型的视觉-几何推理

Hugging Face 每日论文发布 JigShape 基准,用拼图游戏的插片互锁设计评估视觉语言模型的视觉-几何推理能力。基准包含 95K 实例,覆盖 4x4 到 16x16 四种网格密度。研究发现,零样本模型大多缺乏几何推理能力,仅 GPT-5.5 在 4x4 上超过随机基线。微调模型在小网格上表现良好,但网格增大时性能急剧下降,出现“缩放悬崖”现象。

为什么值得看现有基准多使用矩形切割,在纹理重复区域存在歧义,而 JigShape 通过插片设计提供强几何约束,使得评估更准确。研究发现主流模型在几何推理上普遍薄弱,且规模增大时性能崩溃,这一发现挑战了当前 VLM 的能力边界,为未来模型设计指明改进方向。
Hugging Face Daily Papers0

解码层禁忌:针对大语言模型鲁棒性的诊断压力测试

Hugging Face Daily Papers 发布论文《Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness》,提出一种名为 Taboo 的零提示诊断压力测试,在运行时的 logit 空间动态屏蔽候选词,迫使模型偏离常规生成路径。评估多个开源模型系列后发现,模型规模和训练后指令对齐程度与离路径鲁棒性正相关。该测试可用于生成合成数据、测试安全护栏和部署前可靠性审计。

为什么值得看传统评估只关注模型在最优条件下的表现,忽略了真实部署中复杂提示和约束导致的能力下降。Taboo 提供了一种在运行时直接干预模型生成的方法,能更真实地暴露模型在非理想路径下的弱点,推动评估方法和性能优化思路的变革。
前一期返回情报流后一期