AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
返回主题地图

TOPIC · CURATED VIEW

大模型与推理

追踪基础模型、推理能力、上下文与训练方法的关键变化,不收录只有参数宣传的更新。

全部 Story
725
近 7 天
27
当前结果
725
全部新闻论文产品模型

主题情报

#Story为什么值得看类别评分
01

文章使用 NVIDIA NeMo Switchyard 跨模型路由 AI 智能体工作负载

筛选线索开源模型与生态Agent 智能体AI 主题大语言模型1 个独立信源

此前 AI 智能体通常依赖单一模型,难以平衡成本与能力。NeMo Switchyard 提供了开源、统一的动态路由方案,使智能体能够根据任务变化选择合适的模型,将常规任务留在高效模型上,在复杂任务时切换到更强模型,从而提升整体效率与灵活性。

YouTube · NVIDIA Developer/8月11日 13:00
74
02

产品Soup CLI:在 4GB 显存笔记本上微调 8B 大模型

筛选线索大模型与推理大语言模型发布动态1 个独立信源

Soup CLI 是一个命令行工具,由其在 Product Hunt 上发布,宣称用户可以在配备 4GB 显卡的笔记本电脑上对 8B 参数规模的大语言模型进行微调。该产品面向资源受限的开发者,降低了本地微调大模型的硬件门槛。

Product Hunt/8月8日 07:59
58
03

模型Inkling-Small:开放权重多模态模型上线

筛选线索多模态开源模型与生态AI 主题AI 公司1 个独立信源

此模型热度与下载量显示开发者对多模态开放权重模型的兴趣,其稀疏 MoE 架构可能提升推理效率,对应用开发有潜在影响。

Hugging Face Model Radar/7月27日 22:33
82
04

论文AiFlow:面向流式 LLM 应用的 Token 原生反应式编排与有界背压

筛选线索Agent 智能体大模型与推理AI 公司模型家族1 个独立信源

此前流式 LLM 工作流常将生成视为粗粒度的请求-响应步骤,队列、并发和背压依赖临时回调代码。AiFlow 首次将 Token 级增量标准化为类型化事件,并用 Node Guardian 声明式管理有界队列,使背压、顺序和重试成为可静态验证的系统属性,减小了应用端延迟。

arXiv AI/8月1日 09:33
83
05

文章AI 代理执行授权的 LLM 红队审计

筛选线索Agent 智能体大模型与推理AI 主题大语言模型1 个独立信源

传统 LLM 红队审计通常由人工或半自动工具执行,Sentinel Scan 提出由 AI 代理全程运行授权审计,可能代表安全评估流程的自动化方向,能降低人力成本并提高评估频率。

Hacker News AI/8月15日 22:23
70
06

产品Meta 开源 Muse Glimmer 登陆 OpenRouter

筛选线索多模态开源模型与生态AI 主题发布动态1 个独立信源

Meta AI 超级智能实验室发布了首个开放权重模型 Muse Glimmer,并已上线 OpenRouter。这是一款 30B 参数的密集文本+图像模型,采用 Apache 2.0 许可证,定位为可靠的本地智能体,MCP Atlas 得分 75.5,SWE-Bench Pro 得分 51.2。

AIHOT · X / 公众号精选/8月12日 12:00
57
07

模型Qwen3.8-27B:新一代视觉语言模型发布

筛选线索多模态开源模型与生态AI 公司模型家族1 个独立信源

Qwen3.8 是开源 Qwen 系列最新一代,相比 Qwen3.5 和 3.6 在核心能力上有实质性提升,且 27B 为紧凑型稠密模型,易于部署,并原生支持图像视频,扩展了多模态应用场景,对开源社区和开发者有重要意义。

Hugging Face Model Radar/8月5日 08:22
79
08

论文多智能体评估对角色扮演语言智能体的对抗压力测试

筛选线索开源模型与生态Agent 智能体AI 主题模型家族1 个独立信源

现有评估多依赖静态基准或单轮问题,难以捕捉长对话中的累积行为失败。本研究提出多智能体、多策略对抗框架,能暴露更隐蔽的失败模式,且自动评判与人类评分高度相关,为高安全要求场景下的RPLA提供系统化评估新工具。

arXiv AI/8月4日 05:54
83
09

文章本地运行开放模型:DGX Station 上的 Nemotron 3 Ultra

筛选线索Agent 智能体大模型与推理AI 主题AI 公司1 个独立信源

此前,前沿级开放模型通常依赖云端 API,存在数据外泄风险和持续 token 费用。现在,NVIDIA 将推理堆栈整合到桌面设备中,支持本地部署 550B 参数模型,使开发者、企业和研究机构可以在本地获得近似前沿模型的性能,同时保证数据隐私,改变了大模型的交付和消费模式。

YouTube · NVIDIA Developer/8月12日 06:58
67
10

产品Kimi K3:全球首个开放型3T参数模型发布

筛选线索开源模型与生态大模型与推理模型家族发布动态1 个独立信源

Kimi(月之暗面)在Product Hunt发布了Kimi K3模型,宣称这是全球首个开放型3T参数级别的模型。该产品面向AI开发者和研究者,提供大规模参数的开源模型,旨在突破以往模型参数规模的限制,但具体能力和应用场景尚未披露。

Product Hunt/7月17日 02:39
45
11

模型Inkling:Hugging Face上新的通用多模态开放权重模型

筛选线索多模态开源模型与生态AI 主题AI 公司1 个独立信源

Inkling是开放权重的多模态模型,同时支持文本、图像和音频输入,可降低开发者构建多模态AI应用的门槛。此前多模态模型多由大公司闭源提供,Inkling为社区提供了可自由定制和部署的选择。

Hugging Face Model Radar/7月14日 13:23
78
12

论文LLM服务的实证研究:框架、方法与系统设计

筛选线索多模态开源模型与生态AI 主题AI 公司1 个独立信源

此前关于LLM服务的研究多聚焦于技术提案,缺乏对其实际采用情况的了解。该研究揭示了真实项目中框架和方法的使用模式,有助于产品经理和技术决策者理解市场现状,指导技术选型和架构设计。

arXiv AI/8月4日 02:33
83
13

新闻Gemini 3.7 Flash 发布:编程能力提升,价格较三周前的前代产品降低 50%

筛选线索大模型与推理AI 主题模型家族1 个独立信源

Google 以极短迭代周期和明显降价推出新模型,表明其在大模型竞争中采取快速跟进和价格战策略。此举直接降低了开发者使用高级编程 AI 的门槛,并可能迫使竞争对手调整价格,影响非技术产品经理在 AI 工具上的成本预算和选择范围。

The Decoder AI News/8月13日 18:41
61
14

产品Unabyss:为Claude提供跨应用与LLM的共享内存

筛选线索大模型与推理模型家族发布动态1 个独立信源

Unabyss 为 Claude 推出了一项共享内存功能,使 Claude 能够在所有应用程序和大语言模型之间保留和访问上下文信息,从而减少重复输入并提升多工具协作的连贯性。当前证据仅表明该功能存在于 Claude 环境中,未提供具体实现细节或发布方信息。

Product Hunt/7月10日 19:19
43
15

模型Muse-Glimmer-30B:面向消费硬件的代理模型

筛选线索多模态Agent 智能体AI 公司推理能力1 个独立信源

这是首个在消费级硬件上无需云端即可运行的、整合了完整代理能力(推理、工具调用、故障恢复)的 300 亿参数模型,可能改变了代理类应用的部署模式,降低了对云端的依赖。

Hugging Face Model Radar/8月9日 17:51
76
16

论文现行AI基准未测项:模态、搜索与引用及其安全评估启示

筛选线索大模型与推理安全与对齐AI 主题AI 公司1 个独立信源

此前AI安全评估常依赖单一API和单次运行,默认准确率指标可代表模型行为。该研究揭示,同一模型家族内,访问方式和搜索设置会显著改变准确率与响应一致性,甚至逆转模态性能趋势,表明仅报告简单准确率会掩盖安全相关的重要行为差异,对评估标准构成挑战。

arXiv AI/8月6日 15:58
82
17

文章LLM 模型切换技巧可能暴露 AI 推理痕迹

筛选线索大模型与推理AI 主题大语言模型1 个独立信源

如果该技巧真实存在,它可能揭示大型语言模型内部推理过程,从而影响 AI 安全性和隐私保护,尤其对依赖隐藏推理逻辑的模型服务提供者构成新威胁,但证据有限。

Hacker News AI/8月11日 22:57
59
18

产品小红书开源 BigMac:多模态模型训练的新流水线范式

筛选线索多模态开源模型与生态大语言模型发布动态1 个独立信源

小红书技术团队开源 BigMac,一种针对多模态大模型训练的依赖安全嵌套流水线新范式。它利用 LLM 流水线作为主干,在不打乱执行顺序的前提下嵌入编码器和生成器计算,相比基线实现 1.08x-1.9x 加速,同时保持激活显存有界。BigMac 已作为 dots 多模态模型训练的核心组件投入生产。

AIHOT · X / 公众号精选/7月22日 10:04
39
19

模型Ling-3.0-flash 模型发布

筛选线索Agent 智能体大模型与推理AI 公司模型家族1 个独立信源

Ling-3.0-flash 以远小于前代旗舰模型的参数规模(活跃参数仅为前者的 8.1%)宣称达到同等或更优性能,且主打长上下文效率和生产环境部署能力,可能改变高效推理模型的竞争格局。

Hugging Face Model Radar/8月2日 16:14
74
20

论文用于自主量子传感实验科学推理的智能体AI

筛选线索Agent 智能体大模型与推理AI 主题模型家族1 个独立信源

以往量子传感实验依赖人工操作,而该工作流让LLM代理自主完成从选择NV中心到复杂测量的完整流程,并能主动检查弱特征,显著减少人工干预。同时引入离线基准,为评估自主实验中的AI推理能力提供了可复现的方法,这是量子传感自动化领域的实质性进展。

arXiv AI/7月27日 23:43
82
21

新闻Deepseek V4 Pro API 上线,腾讯将发布 HY4,iPhone18 或涨价

筛选线索具身智能大模型与推理AI 主题AI 公司1 个独立信源

Deepseek V4 Pro 的定价极低,可能重塑大模型 API 价格体系;腾讯发布 HY4 将加剧国内大模型竞争;iPhone18 涨价消息影响消费电子市场预期。

公众号 · 极客公园/8月13日 00:19
59
22

模型Solar-Open2-250B模型:250B参数激活15B的百万token上下文开源大模型

筛选线索开源模型与生态Agent 智能体AI 公司大语言模型1 个独立信源

此前主流开源大模型在长上下文场景下推理成本极高或上下文窗口有限。Solar-Open2-250B通过混合注意力和稀疏激活,以接近小模型的推理成本提供大模型能力,同时支持百万token,为代理型应用(如文档分析、代码生成)提供了更实用的开源选择。

Hugging Face Model Radar/7月22日 02:40
73
23

论文PatientAgentBench:面向患者的健康AI代理评估基准框架

筛选线索Agent 智能体大模型与推理AI 主题大语言模型1 个独立信源

此前基准仅评估医学知识问答或面向临床医生的任务,而PatientAgentBench首次系统评估面向患者的代理系统在真实临床场景中的分诊、安全和工作流准确性,揭示了当前代理普遍存在的临床差距,为开发更安全的患者交互AI提供了可量化的评价维度。

arXiv AI/7月28日 09:24
81
24

文章NVIDIA 探讨机器人学习的 WAM 与 VLA 模型

筛选线索多模态开源模型与生态AI 主题多模态1 个独立信源

机器人基础模型此前多依赖单一方法,而 WAM 和 VLA 各有优劣。Cosmos 3 将动作作为原生模态,并开源模型、数据集和配方,可能改变机器人策略的训练与部署方式,值得关注。

YouTube · NVIDIA Developer/8月5日 04:32
56
25

模型ThinkingCap-Qwen3.6-27B:基于Qwen3.6微调减少50%思考token

筛选线索多模态大模型与推理AI 公司模型家族1 个独立信源

以往推理模型为提高准确性往往需要大量思考token,ThinkingCap通过微调在不牺牲质量的前提下大幅压缩token,使模型在保持性能的同时显著提升推理速度并降低成本。

Hugging Face Model Radar/7月6日 13:16
71
26

论文ECHO:本地部署的智能健康助手,具备时序记忆、安全护栏与语音评估

筛选线索多模态Agent 智能体模型家族大语言模型1 个独立信源

相比依赖云端的健康助手,ECHO 可在消费硬件本地运行,数据不外传,符合 GDPR 和 KVKK,可能降低隐私合规成本。其安全层超越零样本 LLM,如 Llama 3.3 70B,表明小型模型结合专用模块可达到实用水平,对资源受限场景有意义。

arXiv AI/8月6日 14:44
81
27

文章NVIDIA发布Alpamayo 2 Super自动驾驶模型

筛选线索多模态开源模型与生态推理能力多模态1 个独立信源

此前自动驾驶模型多为前视单摄像头,缺乏全景上下文;人工标注长尾驾驶场景成本高、周期长。Alpamayo 2 Super通过开源与自动标注技术,显著降低开发成本和时间,并扩展至任意驾驶领域和地理区域,可能推动自动驾驶研发范式转变。

YouTube · NVIDIA Developer/8月4日 14:52
56
28

模型Nanbeige4.2-3B

筛选线索开源模型与生态Agent 智能体AI 公司推理能力1 个独立信源

该模型以不到其他模型三分之一参数实现超越,证明循环架构能有效提升小模型代理能力。此前小模型在复杂代理任务上表现较弱,Nanbeige4.2-3B填补了这一空白,为资源受限场景提供可行方案。

Hugging Face Model Radar/7月21日 08:39
71
29

论文Argus:面向长时程推理的通用智能体运行时

筛选线索Agent 智能体大模型与推理模型家族推理能力1 个独立信源

此前智能体通常依赖模型微调或上下文窗口处理长期任务,而 Argus 展示了通过持久化运行时状态和控制策略实现自我进化,无需更新模型权重。其通过验证门控的自我进化机制,显著提升任务准确率并降低后续任务的消耗,为智能体在真实复杂任务中的应用提供了新范式。

arXiv AI/8月5日 17:58
80
30

文章理解 AI 的内在思维:Google DeepMind 谈可解释性研究

筛选线索大模型与推理安全与对齐AI 主题AI 公司1 个独立信源

AI 系统日益复杂,其决策过程常不透明。可解释性研究致力于揭示网络内部结构,如稀疏自编码器,有助于提升 AI 的安全性、可靠性和可审计性。这是保障未来 AGI 安全的关键研究方向,对构建可信 AI 具有重要意义。

YouTube · Google DeepMind/7月10日 15:50
52
当前展示各类别评分靠前的 30 条,共 725 条