AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
返回主题地图

TOPIC · CURATED VIEW

大模型与推理

追踪基础模型、推理能力、上下文与训练方法的关键变化,不收录只有参数宣传的更新。

全部 Story
725
近 7 天
27
当前结果
662
全部新闻论文产品模型

主题情报

#Story为什么值得看类别评分
01

论文AiFlow:面向流式 LLM 应用的 Token 原生反应式编排与有界背压

筛选线索Agent 智能体大模型与推理AI 公司模型家族1 个独立信源

此前流式 LLM 工作流常将生成视为粗粒度的请求-响应步骤,队列、并发和背压依赖临时回调代码。AiFlow 首次将 Token 级增量标准化为类型化事件,并用 Node Guardian 声明式管理有界队列,使背压、顺序和重试成为可静态验证的系统属性,减小了应用端延迟。

arXiv AI/8月1日 09:33
83
02

论文多智能体评估对角色扮演语言智能体的对抗压力测试

筛选线索开源模型与生态Agent 智能体AI 主题模型家族1 个独立信源

现有评估多依赖静态基准或单轮问题,难以捕捉长对话中的累积行为失败。本研究提出多智能体、多策略对抗框架,能暴露更隐蔽的失败模式,且自动评判与人类评分高度相关,为高安全要求场景下的RPLA提供系统化评估新工具。

arXiv AI/8月4日 05:54
83
03

论文LLM服务的实证研究:框架、方法与系统设计

筛选线索多模态开源模型与生态AI 主题AI 公司1 个独立信源

此前关于LLM服务的研究多聚焦于技术提案,缺乏对其实际采用情况的了解。该研究揭示了真实项目中框架和方法的使用模式,有助于产品经理和技术决策者理解市场现状,指导技术选型和架构设计。

arXiv AI/8月4日 02:33
83
04

论文现行AI基准未测项:模态、搜索与引用及其安全评估启示

筛选线索大模型与推理安全与对齐AI 主题AI 公司1 个独立信源

此前AI安全评估常依赖单一API和单次运行,默认准确率指标可代表模型行为。该研究揭示,同一模型家族内,访问方式和搜索设置会显著改变准确率与响应一致性,甚至逆转模态性能趋势,表明仅报告简单准确率会掩盖安全相关的重要行为差异,对评估标准构成挑战。

arXiv AI/8月6日 15:58
82
05

论文用于自主量子传感实验科学推理的智能体AI

筛选线索Agent 智能体大模型与推理AI 主题模型家族1 个独立信源

以往量子传感实验依赖人工操作,而该工作流让LLM代理自主完成从选择NV中心到复杂测量的完整流程,并能主动检查弱特征,显著减少人工干预。同时引入离线基准,为评估自主实验中的AI推理能力提供了可复现的方法,这是量子传感自动化领域的实质性进展。

arXiv AI/7月27日 23:43
82
06

论文PatientAgentBench:面向患者的健康AI代理评估基准框架

筛选线索Agent 智能体大模型与推理AI 主题大语言模型1 个独立信源

此前基准仅评估医学知识问答或面向临床医生的任务,而PatientAgentBench首次系统评估面向患者的代理系统在真实临床场景中的分诊、安全和工作流准确性,揭示了当前代理普遍存在的临床差距,为开发更安全的患者交互AI提供了可量化的评价维度。

arXiv AI/7月28日 09:24
81
07

论文ECHO:本地部署的智能健康助手,具备时序记忆、安全护栏与语音评估

筛选线索多模态Agent 智能体模型家族大语言模型1 个独立信源

相比依赖云端的健康助手,ECHO 可在消费硬件本地运行,数据不外传,符合 GDPR 和 KVKK,可能降低隐私合规成本。其安全层超越零样本 LLM,如 Llama 3.3 70B,表明小型模型结合专用模块可达到实用水平,对资源受限场景有意义。

arXiv AI/8月6日 14:44
81
08

论文Argus:面向长时程推理的通用智能体运行时

筛选线索Agent 智能体大模型与推理模型家族推理能力1 个独立信源

此前智能体通常依赖模型微调或上下文窗口处理长期任务,而 Argus 展示了通过持久化运行时状态和控制策略实现自我进化,无需更新模型权重。其通过验证门控的自我进化机制,显著提升任务准确率并降低后续任务的消耗,为智能体在真实复杂任务中的应用提供了新范式。

arXiv AI/8月5日 17:58
80
09

论文Albilich:结合CAS的LLM数学研究可操控证明状态编排

筛选线索开源模型与生态Agent 智能体AI 主题大语言模型1 个独立信源

此前 LLM 在数学研究中的长程证明尝试难以协调、评估和复现;Albilich 通过开源 harness 集成 CAS 和可操控性,在标准化基准和未解决问题上取得高成功率,为 AI 辅助数学研究提供了可复现的框架。

arXiv AI/7月30日 05:41
80
10

论文统一智能体:跨设备管理交互

筛选线索多模态Agent 智能体AI 主题大语言模型1 个独立信源

现有智能体系统在跨设备场景中缺乏有效状态管理,多智能体系统也未维护跨设备、跨时间的紧凑携带状态。该论文提出以状态设计为核心的原则,并通过基准测试证明其优势在多种 MLLM 设置下稳健,为跨设备智能体的设计提供了新方向。

arXiv AI/8月6日 08:14
80
11

论文企业自动化中LLM权衡评估:生产平台工作流生成的经验

筛选线索大模型与推理AI 主题模型家族1 个独立信源

该研究证实,通过分片分解,小型模型可在成本和成功率上达到生产可用,降低对昂贵前沿模型的依赖,为企业自动化提供了更经济的选择,可能改变LLM选型决策。

arXiv AI/8月4日 08:18
80
12

论文AI代理能否判断任务简单性?面向复杂度感知的推理与执行

筛选线索开源模型与生态Agent 智能体AI 主题模型家族1 个独立信源

此前LLM代理无法识别任务实际所需的努力,往往无差别地读入所有上下文,造成大量浪费。E3首次引入了任务感知的执行范围估计,用最小资源完成正确操作,在成功率不变的前提下大幅降低了计算成本,为AI代理的实用化提供了重要的效率优化方向。

arXiv AI/7月14日 17:59
79
13

论文先锁定证据再作决定:冻结界面降低了LLM评判效果

筛选线索大模型与推理模型家族大语言模型1 个独立信源

此前LLM评判常假定先提取标准与证据有助于后续裁决,但本研究证明,将证据持久化并作为后续判定唯一输入会损害与人类偏好的一致性。这提示依赖中间证据的评判流程可能需重新设计。

arXiv AI/8月5日 19:23
79
14

论文一种经济高效的多模态LLM推理框架用于不规则临床时间序列问答

筛选线索多模态大模型与推理大语言模型推理能力1 个独立信源

此前多模态时间序列LLM难以处理临床数据的稀疏性、异步性和不规则采样模式。ClinPRISM通过专用架构解决了这一关键局限,并以极低的计算成本(仅16个令牌)实现了快速推理(0.15秒),使临床问答更实用。

arXiv AI/7月28日 16:33
79
15

论文EMBL AI Librarian:面向AI代理的生命科学知识层

筛选线索Agent 智能体大模型与推理AI 主题模型家族1 个独立信源

此前,Europe PMC等资源仅支持关键词和复杂语法,返回整篇论文,AI代理需自行学习语法、多次搜索并阅读全文。EMBL AI Librarian让代理用自然语言提问即可获得证据,显著降低使用门槛,提升检索效率和准确性,在多个基准上表现优于强基线。

arXiv AI/7月30日 14:00
79
16

论文Σ-Mem:面向LLM多智能体系统的在线可靠性记忆

筛选线索Agent 智能体大模型与推理模型家族大语言模型2 个独立信源

传统记忆系统仅保存交互内容,不建模信任。Σ-Mem首次引入在线可靠性记忆,使系统能基于历史反馈动态评估代理可信度,实现无需重训练的稳定适应,为多代理协调提供新机制。

多源确认
arXiv AI/7月31日 00:00
79
17

论文代理式 AI 工作负载的架构影响研究

筛选线索开源模型与生态Agent 智能体AI 主题大语言模型1 个独立信源

此前对 AI 基础设施的优化多聚焦于大模型推理本身,而代理式工作流在数据中心中的独特资源需求未被系统研究。该研究首次通过生产环境数据揭示了 CPU 关键路径和碎片化执行等特征,为数据中心设计和服务器优化提供了新视角,可能推动基础设施投资方向的调整。

arXiv AI/8月5日 05:31
79
18

论文Euclid-MCP:通过 Prolog 实现确定性逻辑推理的模型上下文协议服务器

筛选线索开源模型与生态Agent 智能体大语言模型推理能力1 个独立信源

此前 LLM 在多步逻辑推理中常产生幻觉,缺乏可靠规则执行能力。Euclid-MCP 提供标准化接口,将确定性符号推理与 LLM 的自然语言能力结合,填补了安全关键领域缺乏可靠推理基座的空白。

arXiv AI/7月23日 15:15
79
19

论文用于让冻结LLM代理学习领域的控制系统、数据集与配方

筛选线索开源模型与生态Agent 智能体AI 主题AI 公司1 个独立信源

此前Meta-Harness和HyperAgents优化harness的方式要么依赖昂贵代码搜索循环,要么产生不可审计的自我修改代码;本文提供一种更受约束、可审计且样本高效的方法,可在不访问模型内部的情况下通过黑盒API优化代理行为。

arXiv AI/7月28日 08:10
79
20

论文AI Agent能否完成RTL到GDS?交互式EDA工作流基准测试

筛选线索开源模型与生态Agent 智能体AI 主题模型家族1 个独立信源

此前评估仅关注单个模型在孤立EDA任务上的表现,缺乏对完整流程和agent系统的对比。该研究首次在统一环境下系统评估端到端EDA流程,揭示了agent架构和成本效率的巨大差异,对AI辅助芯片设计工具的选择和优化具有直接指导意义。

arXiv AI/7月20日 04:08
79
21

论文突发工作负载下的 LLM 推理:WAIT 算法改进

筛选线索大模型与推理AI 公司模型家族1 个独立信源

此前调度算法多假设请求到达率恒定,与实际流量不符。该研究提出在线适应到达率变化的新方法,可能提升真实场景下的推理吞吐量,对产品性能和成本有潜在影响。

arXiv AI/8月6日 15:07
79
22

论文蒸馏基准上的安全门控智能体监督控制:状态图、可审计门控与协同设计发现

筛选线索开源模型与生态Agent 智能体模型家族大语言模型1 个独立信源

此前 LLM Agent 在工业控制中的可靠性存疑,缺乏安全硬约束。本研究证明,即使 LLM 能高频写设定值,仍需规则门控兜底,否则在扰动抑制等场景会出现严重退化,为工业场景引入 LLM 提供了可审计的安全屏障方案。

arXiv AI/7月30日 08:26
79
23

论文LACE:基于大语言模型的多智能体框架,用于敏捷 RISC-V 指令扩展

筛选线索开源模型与生态Agent 智能体大语言模型智能体1 个独立信源

此前 RISC-V 指令集扩展(ISAX)的实现和验证在不同内核间进展缓慢且碎片化,需要针对每个内核进行接口适配,差分测试在微架构或 ISAX 变化时经常失效。LACE 通过多智能体工作流和两级 IR,显著提高了生成准确率(从近零到 72.8%),减少了集成返工,为指令扩展的自动化提供了新路径。

arXiv AI/8月3日 22:07
79
24

论文Traccia:基于OpenTelemetry的AI系统治理平台

筛选线索Agent 智能体大模型与推理AI 主题大语言模型1 个独立信源

此前AI治理工具碎片化,无法应对代理架构特有的对齐漂移、影子AI等威胁。Traccia首次将OpenTelemetry遥测、语义护栏和执行血统整合为统一哈希追溯层,自动输出符合EU AI Act的合规证据包,为自主AI系统的企业级管理提供了可审计的机器可读基础。

arXiv AI/7月15日 19:14
79
25

论文AI代理签名流程的硬件密钥库:零信任MCP强制架构

筛选线索Agent 智能体大模型与推理AI 主题模型家族1 个独立信源

此前AI代理的私钥常以明文或环境变量形式存储,存在被窃取风险。该方案通过硬件隔离密钥,使任何软件进程都无法直接获取密钥,将攻击成功率从19.3%降至0%,为高价值自动化操作提供了新的安全基线。

arXiv AI/8月6日 15:04
79
26

论文先知识后推理:EC-Reason-Bench——无需训练的LLM酶分类诊断基准

筛选线索大模型与推理大语言模型推理能力1 个独立信源

此前LLM被广泛认为具备推理能力,但在酶分类这种层次化知识密集型任务上性能极差,甚至接近零分。本研究揭示了外部知识先于推理的必要性,并提供了一种无需额外训练即可诊断模型弱点的方法,帮助开发者识别模型在何处因缺乏知识而失败。

arXiv AI/7月29日 02:16
79
27

论文LLM能否设计高质量实验?一项关于自主实验设计的综合基准研究

筛选线索Agent 智能体大模型与推理AI 主题大语言模型1 个独立信源

此前AI for Research研究多聚焦代码实现,忽视实验设计阶段,且缺乏系统评估基准。SCOPE填补这一空白,首次量化LLM在实验设计上的能力边界,揭示现有模型局限,推动AI自动化科学研究向完整工作流发展,为相关产品提供评估标准和改进方向。

arXiv AI/8月4日 11:43
78
28

论文训练后适配技术的六维分类法及其在AI治理中的应用

筛选线索多模态大模型与推理AI 主题多模态1 个独立信源

此前训练后适配技术文献分散,不同技术族、模型类别与部署场景之间难以比较,也缺乏统一术语,导致无法清晰描述模型如何被修改。该论文首次引入系统化六维分类法,统一了术语并为模型变更追踪和治理提供了分析框架,填补了这一空白。

arXiv AI/8月6日 16:32
78
29

论文开放域问答中推理的无参考评估

筛选线索开源模型与生态大模型与推理AI 主题大语言模型1 个独立信源

此前评估开放域问答通常依赖参考答案或LLM直接评判,后者易被流畅但推理薄弱的回答欺骗。本方法不依赖参考答案,通过细粒度分解推理轨迹实现更可靠的自动审计,尤其适用于医疗等高风险领域,为LLM输出的可信度验证提供了新路径。

arXiv AI/7月22日 02:27
78
30

论文无云端的编码代理:评估开源权重大语言模型在纵向数据准备任务中的表现

筛选线索开源模型与生态Agent 智能体AI 主题大语言模型1 个独立信源

此前敏感数据的数据准备通常需要发送到第三方云端模型,受限于治理要求无法广泛采用。该研究表明,开源权重模型在消费者级硬件上即可达到接近饱和的任务完成率,为治理受限的研究机构提供了不传输数据的AI辅助路径。

arXiv AI/7月23日 16:23
78
当前展示各类别评分靠前的 30 条,共 662 条