AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
返回主题地图

TOPIC · CURATED VIEW

开源模型与生态

追踪开放权重模型、框架与社区生态,关注部署门槛、许可证和真实可用性。

全部 Story
221
近 7 天
22
当前结果
132
全部新闻论文产品模型

主题情报

#Story为什么值得看类别评分
01

论文多智能体评估对角色扮演语言智能体的对抗压力测试

筛选线索开源模型与生态Agent 智能体AI 主题模型家族1 个独立信源

现有评估多依赖静态基准或单轮问题,难以捕捉长对话中的累积行为失败。本研究提出多智能体、多策略对抗框架,能暴露更隐蔽的失败模式,且自动评判与人类评分高度相关,为高安全要求场景下的RPLA提供系统化评估新工具。

arXiv AI/8月4日 05:54
83
02

论文LLM服务的实证研究:框架、方法与系统设计

筛选线索多模态开源模型与生态AI 主题AI 公司1 个独立信源

此前关于LLM服务的研究多聚焦于技术提案,缺乏对其实际采用情况的了解。该研究揭示了真实项目中框架和方法的使用模式,有助于产品经理和技术决策者理解市场现状,指导技术选型和架构设计。

arXiv AI/8月4日 02:33
83
03

论文Albilich:结合CAS的LLM数学研究可操控证明状态编排

筛选线索开源模型与生态Agent 智能体AI 主题大语言模型1 个独立信源

此前 LLM 在数学研究中的长程证明尝试难以协调、评估和复现;Albilich 通过开源 harness 集成 CAS 和可操控性,在标准化基准和未解决问题上取得高成功率,为 AI 辅助数学研究提供了可复现的框架。

arXiv AI/7月30日 05:41
80
04

论文AI代理能否判断任务简单性?面向复杂度感知的推理与执行

筛选线索开源模型与生态Agent 智能体AI 主题模型家族1 个独立信源

此前LLM代理无法识别任务实际所需的努力,往往无差别地读入所有上下文,造成大量浪费。E3首次引入了任务感知的执行范围估计,用最小资源完成正确操作,在成功率不变的前提下大幅降低了计算成本,为AI代理的实用化提供了重要的效率优化方向。

arXiv AI/7月14日 17:59
79
05

论文代理式 AI 工作负载的架构影响研究

筛选线索开源模型与生态Agent 智能体AI 主题大语言模型1 个独立信源

此前对 AI 基础设施的优化多聚焦于大模型推理本身,而代理式工作流在数据中心中的独特资源需求未被系统研究。该研究首次通过生产环境数据揭示了 CPU 关键路径和碎片化执行等特征,为数据中心设计和服务器优化提供了新视角,可能推动基础设施投资方向的调整。

arXiv AI/8月5日 05:31
79
06

论文Euclid-MCP:通过 Prolog 实现确定性逻辑推理的模型上下文协议服务器

筛选线索开源模型与生态Agent 智能体大语言模型推理能力1 个独立信源

此前 LLM 在多步逻辑推理中常产生幻觉,缺乏可靠规则执行能力。Euclid-MCP 提供标准化接口,将确定性符号推理与 LLM 的自然语言能力结合,填补了安全关键领域缺乏可靠推理基座的空白。

arXiv AI/7月23日 15:15
79
07

论文用于让冻结LLM代理学习领域的控制系统、数据集与配方

筛选线索开源模型与生态Agent 智能体AI 主题AI 公司1 个独立信源

此前Meta-Harness和HyperAgents优化harness的方式要么依赖昂贵代码搜索循环,要么产生不可审计的自我修改代码;本文提供一种更受约束、可审计且样本高效的方法,可在不访问模型内部的情况下通过黑盒API优化代理行为。

arXiv AI/7月28日 08:10
79
08

论文AI Agent能否完成RTL到GDS?交互式EDA工作流基准测试

筛选线索开源模型与生态Agent 智能体AI 主题模型家族1 个独立信源

此前评估仅关注单个模型在孤立EDA任务上的表现,缺乏对完整流程和agent系统的对比。该研究首次在统一环境下系统评估端到端EDA流程,揭示了agent架构和成本效率的巨大差异,对AI辅助芯片设计工具的选择和优化具有直接指导意义。

arXiv AI/7月20日 04:08
79
09

论文蒸馏基准上的安全门控智能体监督控制:状态图、可审计门控与协同设计发现

筛选线索开源模型与生态Agent 智能体模型家族大语言模型1 个独立信源

此前 LLM Agent 在工业控制中的可靠性存疑,缺乏安全硬约束。本研究证明,即使 LLM 能高频写设定值,仍需规则门控兜底,否则在扰动抑制等场景会出现严重退化,为工业场景引入 LLM 提供了可审计的安全屏障方案。

arXiv AI/7月30日 08:26
79
10

论文LACE:基于大语言模型的多智能体框架,用于敏捷 RISC-V 指令扩展

筛选线索开源模型与生态Agent 智能体大语言模型智能体1 个独立信源

此前 RISC-V 指令集扩展(ISAX)的实现和验证在不同内核间进展缓慢且碎片化,需要针对每个内核进行接口适配,差分测试在微架构或 ISAX 变化时经常失效。LACE 通过多智能体工作流和两级 IR,显著提高了生成准确率(从近零到 72.8%),减少了集成返工,为指令扩展的自动化提供了新路径。

arXiv AI/8月3日 22:07
79
11

论文开放域问答中推理的无参考评估

筛选线索开源模型与生态大模型与推理AI 主题大语言模型1 个独立信源

此前评估开放域问答通常依赖参考答案或LLM直接评判,后者易被流畅但推理薄弱的回答欺骗。本方法不依赖参考答案,通过细粒度分解推理轨迹实现更可靠的自动审计,尤其适用于医疗等高风险领域,为LLM输出的可信度验证提供了新路径。

arXiv AI/7月22日 02:27
78
12

论文无云端的编码代理:评估开源权重大语言模型在纵向数据准备任务中的表现

筛选线索开源模型与生态Agent 智能体AI 主题大语言模型1 个独立信源

此前敏感数据的数据准备通常需要发送到第三方云端模型,受限于治理要求无法广泛采用。该研究表明,开源权重模型在消费者级硬件上即可达到接近饱和的任务完成率,为治理受限的研究机构提供了不传输数据的AI辅助路径。

arXiv AI/7月23日 16:23
78
13

论文用金丝雀工具诊断LLM代理的工具选择推理

筛选线索开源模型与生态Agent 智能体模型家族大语言模型1 个独立信源

此前代理评估只能判断模型选错工具,却无法解释原因。该研究提供了多维诊断框架,将单一错误转化为能力画像,为模型能力分层与安全评估提供新方法论,并揭示能力层级与安全性脱节的现象。

arXiv AI/8月5日 11:38
78
14

论文K-EXAONE 2.0 技术报告

筛选线索开源模型与生态Agent 智能体AI 主题基础模型1 个独立信源

相较于前代 K-EXAONE,K-EXAONE 2.0 通过架构升级将模型容量扩大三倍以上,支持更长上下文和更多语言,并在智能体编码、长上下文理解等实用场景中获得最大提升,且以 Apache 2.0 开源,为开源模型生态提供了新的基础模型选择,标志着 LG 向全球前沿模型迈进。

arXiv AI/8月5日 06:41
78
15

论文Boogu-Image-0.1:提升开源统一多模态理解与生成能力

筛选线索图像生成多模态模型家族智能体1 个独立信源

此前开源统一多模态模型在生成质量和速度上普遍落后于闭源系统,Boogu-Image-0.1证明在有限算力下通过优化数据质量、训练管道和推理时缩放即可达到接近闭源产品的水平,且完全开源,降低了高端图像生成与编辑模型的使用和定制门槛。

arXiv AI/7月14日 17:52
78
16

论文CodeGrep:面向 LLM 编码智能体的强化学习训练检索智能体

筛选线索开源模型与生态Agent 智能体模型家族大语言模型1 个独立信源

该研究量化了 LLM 编码智能体在仓库探索阶段的低效问题(例如 30B OpenHands 代理平均每解决一个问题消耗 631K 代币),并通过引入专用检索智能体,在不牺牲解题率的情况下显著降低了轮次和代币消耗,为提升编码智能体效率提供了可复现的解决方案。

arXiv AI/8月6日 11:07
78
17

论文DocTrace:基于层级证据图推理实现可追踪的长文档视觉问答

筛选线索多模态开源模型与生态推理能力多模态1 个独立信源

现有长文档视觉问答方法缺乏显式机制来表示和验证证据组合过程,导致准确性和可追踪性受限。DocTrace 将问题重构为证据图推理,显式构建带节点级溯源的证据图,不仅提升性能,还提供可追溯的推理路径,有助于提升复杂文档理解的可信度。

arXiv AI/8月4日 08:04
78
18

论文ANCHOR-RE:用于有依据生物医学关系抽取的智能神经符号框架

筛选线索开源模型与生态Agent 智能体大语言模型推理能力1 个独立信源

此前生物医学关系抽取中,符号系统如SemRep精度高但召回率低,LLM上下文推理强但误报多。ANCHOR-RE结合两者,在不更新参数的情况下接近微调系统性能,并保持时间外数据的精度,表明神经符号方法可提升LLM在专业领域的可靠性,对减少虚构输出有意义。

arXiv AI/8月4日 05:36
77
19

论文小型、免费且高效:编排开源小语言模型在恶意软件分析中优于单一大型语言模型

筛选线索开源模型与生态Agent 智能体模型家族大语言模型1 个独立信源

此前恶意软件分析依赖大型语言模型,但封闭模型API成本高、开源大模型计算资源需求大。该研究表明通过合理编排多个小模型,可达到或超过单一大型模型性能,且成本显著降低,为资源受限场景提供可行替代方案。

arXiv AI/7月22日 14:36
77
20

论文跨研究社区的AI辅助同行评审:从审稿AI政策到LLM评审质量

筛选线索开源模型与生态大模型与推理AI 主题大语言模型1 个独立信源

此前缺乏对期刊AI审稿政策的系统性梳理,也缺少对AI审稿质量的细粒度评估。该研究首次对比两大社区政策差异,并揭示了AI评审在乐观偏差、批评泛化等方面的不足,提醒评审方不能仅依赖综合分数,需多维度衡量,对科研出版流程有直接参考价值。

arXiv AI/8月4日 12:34
76
21

论文位置偏倚隐藏在天花板效应之下:LLM基准测试的排列诊断方法

筛选线索开源模型与生态大模型与推理AI 主题模型家族1 个独立信源

此前业界普遍认为位置偏倚是LLM评测的固定混杂因素,但测量手段常因单次选项排列和采样噪声而不可靠。该研究首次给出可检测的准确率区间,并指出在高性能模型上无法测出偏倚不等于真正无偏,改变了评测结果的解读方式。

arXiv AI/7月23日 02:45
76
22

论文训练无关的注意力引导切换:在多模态大语言模型中平衡显式与潜在思考

筛选线索多模态开源模型与生态大语言模型推理能力1 个独立信源

此前多模态推理要么依赖高成本的显式思维链(CoT),要么需要昂贵训练的潜在推理,且直接移植文本推理方法效能不稳。AGS首次提出无需训练、基于注意力比率的切换机制,在降低推理时延的同时提升准确率,为高效多模态推理提供了新路径。

arXiv AI/8月4日 10:46
76
23

论文面向基于LLM的推荐的分层隐式推理框架

筛选线索开源模型与生态大模型与推理大语言模型推理能力1 个独立信源

此前隐式推理方法多集中于生成或验证中间状态,未充分刻画各层在偏好建模中的作用。HiLaR 首次将分层偏好表征与层感知奖励结合,减少显式推理开销,并提升推荐准确性,为 LLM 推荐提供新思路。

arXiv AI/7月30日 06:58
76
24

论文探究LLM自动作文评分中的母语偏见:基于TOEFL作文的跨提示评估

筛选线索开源模型与生态大模型与推理AI 主题大语言模型1 个独立信源

此前自动评分研究多关注整体准确性,而该研究首次在大规模数据上揭示微调开源LLM在评分中存在母语相关系统性偏差,可能影响教育评估的公平性,需引起产品设计者注意。

arXiv AI/7月16日 06:10
76
25

论文从社交编码到智能体编码:开源社区的生产力与关系重构

筛选线索开源模型与生态Agent 智能体大语言模型智能体1 个独立信源

此前编码工具主要辅助个人,而本研究揭示编码代理显著提升任务完成量和速度,但改变了开源社区协作结构,人际交互减少,知识公共性下降。这提示AI引入可能以牺牲社区知识积累和长期协作质量为代价,对依赖开源生态的企业和研究机构有重要警示。

arXiv AI/8月4日 12:41
76
26

论文多模态大语言模型科学可视化素养基准测试研究

筛选线索多模态开源模型与生态AI 主题模型家族1 个独立信源

此前对多模态大语言模型可视化能力的评估多局限于简单图表(如柱状图),缺乏对科学可视化(如流场、体积渲染)的理解测试。本研究首次使用标准化科学可视化素养测试对比人类,揭示了模型在真实科学场景下的能力短板,为AI在科研辅助工具中的应用提供关键参考。

arXiv AI/7月16日 16:29
76
27

论文Antares:面向智能体漏洞定位的基础模型

筛选线索开源模型与生态Agent 智能体模型家族推理能力1 个独立信源

此前,高精度漏洞定位通常依赖大型模型或专有 API,成本高且部署受限。Antares 用紧凑模型达到接近 GPT-5.5 的效果,突破了传统上模型大小与性能的权衡,使得在本地低算力环境下快速、经济地进行漏洞扫描成为可能,可能改变安全工具链的部署方式。

arXiv AI/8月3日 15:49
76
28

论文OpenForgeRL: 在任何环境中训练Harness原生智能体

筛选线索多模态开源模型与生态AI 主题模型家族2 个独立信源

此前基于复杂推理harness的智能体难以用开源SFT/RL栈端到端训练,因为后者无法原生表达有状态多进程推理。OpenForgeRL解耦训练与推理,使研究者能在实际部署环境中直接训练和改进智能体,大幅降低了Harness-based Agent的训练门槛。

多源确认
arXiv AI/7月24日 00:00
76
29

论文EmpaAva:开源代理式3D化身共情实时聊天机器人

筛选线索多模态开源模型与生态大语言模型智能体1 个独立信源

此前共情聊天机器人和3D化身多为独立研究方向,缺乏开源且整合共情回复、情感感知和统一表情语音渲染的代理式系统。EmpaAva将共情能力带入实时视频交互,并用单一LLM协调感知与表达,为构建有情感、可检查的虚拟交互产品提供了可复用的开源方案,有助于降低相关产品研发门槛。

arXiv AI/8月5日 11:23
76
30

论文用教学适应性指数评估和改进基于 LLM 的 AI 导师的教学适配度

筛选线索开源模型与生态大模型与推理AI 主题模型家族1 个独立信源

此前对 LLM 导师的评估主要聚焦答案正确性,忽略教学适配这一关键维度。PSI 提供一个可计算的复合指标,并证明它能有效识别并改进教学不当的响应,这意味着 LLM 在课堂场景的应用质量评价有了更贴近实际需求的新工具,可能推动 AI 辅导产品从“答得对”转向“教得好”。

arXiv AI/8月5日 21:07
75
当前展示各类别评分靠前的 30 条,共 132 条