AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
返回主题地图

TOPIC · CURATED VIEW

安全与对齐

聚焦模型对齐、越狱防御、安全评测与治理机制,区分真实风险和泛化口号。

全部 Story
143
近 7 天
5
当前结果
119
全部新闻论文产品模型

主题情报

#Story为什么值得看类别评分
01

论文多智能体评估对角色扮演语言智能体的对抗压力测试

筛选线索开源模型与生态Agent 智能体AI 主题模型家族1 个独立信源

现有评估多依赖静态基准或单轮问题,难以捕捉长对话中的累积行为失败。本研究提出多智能体、多策略对抗框架,能暴露更隐蔽的失败模式,且自动评判与人类评分高度相关,为高安全要求场景下的RPLA提供系统化评估新工具。

arXiv AI/8月4日 05:54
83
02

论文现行AI基准未测项:模态、搜索与引用及其安全评估启示

筛选线索大模型与推理安全与对齐AI 主题AI 公司1 个独立信源

此前AI安全评估常依赖单一API和单次运行,默认准确率指标可代表模型行为。该研究揭示,同一模型家族内,访问方式和搜索设置会显著改变准确率与响应一致性,甚至逆转模态性能趋势,表明仅报告简单准确率会掩盖安全相关的重要行为差异,对评估标准构成挑战。

arXiv AI/8月6日 15:58
82
03

论文PatientAgentBench:面向患者的健康AI代理评估基准框架

筛选线索Agent 智能体大模型与推理AI 主题大语言模型1 个独立信源

此前基准仅评估医学知识问答或面向临床医生的任务,而PatientAgentBench首次系统评估面向患者的代理系统在真实临床场景中的分诊、安全和工作流准确性,揭示了当前代理普遍存在的临床差距,为开发更安全的患者交互AI提供了可量化的评价维度。

arXiv AI/7月28日 09:24
81
04

论文ECHO:本地部署的智能健康助手,具备时序记忆、安全护栏与语音评估

筛选线索多模态Agent 智能体模型家族大语言模型1 个独立信源

相比依赖云端的健康助手,ECHO 可在消费硬件本地运行,数据不外传,符合 GDPR 和 KVKK,可能降低隐私合规成本。其安全层超越零样本 LLM,如 Llama 3.3 70B,表明小型模型结合专用模块可达到实用水平,对资源受限场景有意义。

arXiv AI/8月6日 14:44
81
05

论文一种经济高效的多模态LLM推理框架用于不规则临床时间序列问答

筛选线索多模态大模型与推理大语言模型推理能力1 个独立信源

此前多模态时间序列LLM难以处理临床数据的稀疏性、异步性和不规则采样模式。ClinPRISM通过专用架构解决了这一关键局限,并以极低的计算成本(仅16个令牌)实现了快速推理(0.15秒),使临床问答更实用。

arXiv AI/7月28日 16:33
79
06

论文Traccia:基于OpenTelemetry的AI系统治理平台

筛选线索Agent 智能体大模型与推理AI 主题大语言模型1 个独立信源

此前AI治理工具碎片化,无法应对代理架构特有的对齐漂移、影子AI等威胁。Traccia首次将OpenTelemetry遥测、语义护栏和执行血统整合为统一哈希追溯层,自动输出符合EU AI Act的合规证据包,为自主AI系统的企业级管理提供了可审计的机器可读基础。

arXiv AI/7月15日 19:14
79
07

论文训练后适配技术的六维分类法及其在AI治理中的应用

筛选线索多模态大模型与推理AI 主题多模态1 个独立信源

此前训练后适配技术文献分散,不同技术族、模型类别与部署场景之间难以比较,也缺乏统一术语,导致无法清晰描述模型如何被修改。该论文首次引入系统化六维分类法,统一了术语并为模型变更追踪和治理提供了分析框架,填补了这一空白。

arXiv AI/8月6日 16:32
78
08

论文从经济代理到代理经济体:经济世界模型的系统蓝图

筛选线索Agent 智能体大模型与推理AI 主题大语言模型1 个独立信源

该论文为经济模拟提供了系统化路线图,将分散的研究整合为六级能力框架,明确高能力系统(自进化代理、内生制度)的稀缺性,可能引导该领域研究方向,并为AI agent的训练和评估提供更真实的沙盒环境。

arXiv AI/8月6日 13:26
78
09

论文面向大型语言模型系统的安全生命周期模型

筛选线索大模型与推理安全与对齐AI 主题大语言模型1 个独立信源

当前 LLM 生命周期框架多从运营效率出发,导致数据溯源、工件签名、代理权限控制等安全活动常被隐式处理。此模型以安全边界为核心,弥补了现有框架在安全分析上的不足,并使治理要求与生命周期阶段明确对应,尤其揭示了开发阶段监管可见性弱的盲点。

arXiv AI/8月4日 13:13
78
10

论文RESPClinBench:呼吸专科多模态临床决策与纵向疾病管理基准

筛选线索多模态大模型与推理大语言模型多模态1 个独立信源

此前医疗基准多以考试为导向,未能充分反映呼吸专科对多模态解读、纵向风险评估及全程管理的要求。RESPClinBench基于真实临床数据构建,聚焦临床决策任务,并系统评估了模型在影像、药物安全等方面的风险,为医疗AI在专科场景的可靠性提供新标尺。

arXiv AI/8月5日 06:49
77
11

论文RF-Agent:为射频集成电路设计构建语言智能体的实用框架

筛选线索Agent 智能体大模型与推理大语言模型推理能力1 个独立信源

此前LLM在射频电路设计中的应用受限于缺乏领域数据集和标准化基准,RF-Agent首次提供了大规模RF推理数据集和可重复使用的基准,为LLM辅助RF电路设计奠定了基础。

arXiv AI/7月21日 06:53
76
12

论文使用贝叶斯网络的LLM多智能体系统运行时不确定性监控

筛选线索Agent 智能体大模型与推理大语言模型智能体1 个独立信源

此前LLM多智能体系统缺乏系统性的不确定性监测手段,常依赖未校准的log概率。本文通过贝叶斯网络将校准置信度融入多步骤协作,使高风险管理场景(如精算定价)能实时识别不可靠输出,降低错误风险评估和合规风险。

arXiv AI/7月28日 15:39
76
13

论文跨研究社区的AI辅助同行评审:从审稿AI政策到LLM评审质量

筛选线索开源模型与生态大模型与推理AI 主题大语言模型1 个独立信源

此前缺乏对期刊AI审稿政策的系统性梳理,也缺少对AI审稿质量的细粒度评估。该研究首次对比两大社区政策差异,并揭示了AI评审在乐观偏差、批评泛化等方面的不足,提醒评审方不能仅依赖综合分数,需多维度衡量,对科研出版流程有直接参考价值。

arXiv AI/8月4日 12:34
76
14

论文面向基于LLM的推荐的分层隐式推理框架

筛选线索开源模型与生态大模型与推理大语言模型推理能力1 个独立信源

此前隐式推理方法多集中于生成或验证中间状态,未充分刻画各层在偏好建模中的作用。HiLaR 首次将分层偏好表征与层感知奖励结合,减少显式推理开销,并提升推荐准确性,为 LLM 推荐提供新思路。

arXiv AI/7月30日 06:58
76
15

论文推理式护栏何时低效?ResponseGuard:用于实时审核的快速视觉语言护栏

筛选线索多模态大模型与推理AI 主题推理能力1 个独立信源

此前视觉语言护栏普遍采用链式推理,导致延迟高、吞吐低,难以跟上实时流式输出。ResponseGuard证明无需推理即可高效检测响应有害内容,速度提升150倍,使实时多模态安全审核成为可能。

arXiv AI/7月23日 15:02
76
16

论文MAGE:通过智能体多模态推理实现类人宏单元布局

筛选线索多模态Agent 智能体推理能力智能体1 个独立信源

宏观布局在工业设计中仍需大量人工精调,MAGE首次通过多智能体框架自动完成布局优化,且在时序指标上超越人类专家,改变了此前AI布局只能接近或略低于人类的局面,可能显著降低芯片后端人力成本并提升性能。

arXiv AI/7月20日 22:02
76
17

论文用教学适应性指数评估和改进基于 LLM 的 AI 导师的教学适配度

筛选线索开源模型与生态大模型与推理AI 主题模型家族1 个独立信源

此前对 LLM 导师的评估主要聚焦答案正确性,忽略教学适配这一关键维度。PSI 提供一个可计算的复合指标,并证明它能有效识别并改进教学不当的响应,这意味着 LLM 在课堂场景的应用质量评价有了更贴近实际需求的新工具,可能推动 AI 辅导产品从“答得对”转向“教得好”。

arXiv AI/8月5日 21:07
75
18

论文用于AI安全评估的对抗性提示框架

筛选线索安全与对齐AI 主题人工智能1 个独立信源

该框架提供了系统化、自动化的AI安全评估方法,相比以往零散的测试,它能生成多级对抗提示并给出量化指标,尤其是突出编码攻击的高风险,促使开发者在产品中重视此类威胁。

arXiv AI/7月15日 05:26
75
19

论文TPACK引导下将AI整合进软件工程教育中的需求质量学习

筛选线索Agent 智能体AI 编码AI 主题人工智能1 个独立信源

此前缺乏在教学法指导下将生成式AI整合进需求工程教育的系统性实证。该研究首次提供基于TPACK框架的整合设计证据,表明结构化脚手架能引导AI使用指向学习目标,而非简单自动化,为教育者和工具设计者提供了可借鉴的负责任整合路径。

arXiv AI/7月30日 13:15
75
20

论文智能代理软件开发中第三方API路由器的代价何在?

筛选线索Agent 智能体AI 编码大语言模型智能体1 个独立信源

此前普遍认为第三方API路由器仅简化接口调用,但该研究证实其作为可信中间层可任意修改请求/响应,且现有客户端防护(白名单、LLM审查)完全无法检测此类注入,意味着依赖第三方路由器的代码代理面临严重安全漏洞。

arXiv AI/7月26日 12:15
75
21

论文AI Agent 并非独自失败:上下文首先失效

筛选线索开源模型与生态Agent 智能体AI 主题大语言模型1 个独立信源

此前上下文工程缺乏量化测量,可靠性改进依赖事后调试;该研究使开发者能在部署前利用七项上下文质量指标预判 agent 行为风险,将上下文变为可度量、可优化的可控变量。

arXiv AI/7月15日 18:33
74
22

论文基于盘古多模态基础模型的视觉语言导航系统PGN的设计与实现

筛选线索多模态大模型与推理大语言模型基础模型1 个独立信源

该方案展示了将多模态大模型(OpenPangu-7B)应用于视觉语言导航的可行路径,通过两阶段训练实现了视觉-语言对齐与动作空间接地,为离线导航动作预测提供了可复现的基线,并验证了在Ascend 910B NPU上的训练效率。

arXiv AI/7月20日 10:48
74
23

论文ASTELD:用于自主 AI 智能体的六轴分类框架——设计、评估及 OpenClaw 案例研究

筛选线索Agent 智能体安全与对齐AI 主题智能体1 个独立信源

自主 AI 智能体平台缺乏统一分类方案,导致架构、安全等设计选择难以比较。ASTELD 提供可复现的分类方法,能识别未占用的设计区域、解释生态碎片化,并指导框架选择,为产品决策和风险评估提供结构化依据。

arXiv AI/8月5日 05:05
74
24

论文AI 安全评估中的项目反应理论应用

筛选线索大模型与推理安全与对齐AI 主题大语言模型1 个独立信源

传统聚合基准分数因冗余、强相关及模型欺骗而难以信赖。该研究利用 IRT 提供统计工具,用较少题目降低成本,并实现模型内审与沙袋检测,使安全评估更高效、透明、可信,为行业标准提供新选择。

arXiv AI/8月5日 17:25
74
25

论文AI 认知的多维评估框架(MAAC):面向文本型 AI 系统的过程导向评估理论框架

筛选线索安全与对齐AI 主题人工智能1 个独立信源

传统评估只关注输出准确率,无法揭示 AI 的推理过程。MAAC 首次将评估转向过程,为理解模型如何思考、整合记忆和处理复杂度提供了系统维度,可能推动行业从结果导向转向更深层评测标准。

arXiv AI/8月1日 14:01
74
26

论文感知与描述解耦:多元时间序列与语言的计算接地表示对齐

筛选线索多模态开源模型与生态模型家族大语言模型1 个独立信源

此前时间序列-语言对齐依赖LLM自行感知并描述序列,数据质量受限于模型感知能力,且多为单变量。CGTime通过计算处理感知、LLM负责表达,在多元任务上显著优于更大的通用模型,为时间序列多模态学习提供了新范式。

arXiv AI/8月5日 13:57
74
27

论文一种用于LLM安全防护的双重假设推理框架

筛选线索大模型与推理安全与对齐大语言模型推理能力1 个独立信源

此前推理型安全护栏依赖更大或闭源模型生成推理轨迹并进行全参数微调,成本高昂。ARBITER通过自生成轨迹和LoRA微调实现更低成本且性能更优,同时提供可解释的证据,为LLM安全部署提供了更实用、透明的选择。

arXiv AI/7月20日 05:42
74
28

论文MMLDSum-LLM:基于视觉对齐与关键词感知的多模态长文档摘要方法

筛选线索多模态开源模型与生态大语言模型多模态1 个独立信源

多模态长文档摘要面临关键信息遗漏和跨模态幻觉问题,此前缺乏专门基准和针对性方法。该研究提供了新基准和可复现的训练框架,为提升多模态LLM在长文档场景下的摘要质量提供了可行方案。

arXiv AI/7月30日 10:54
74
29

论文政策碎片化还是制度对齐?大学与商学院的AI治理研究

筛选线索安全与对齐AI 主题人工智能1 个独立信源

该研究首次通过自然语言处理系统分析美国高校不同层级AI政策,揭示校级与院级政策目标分歧,以及商学院政策缺失问题,为高校制定与学科目标一致的AI治理政策提供依据,也为教育科技产品市场带来信息。

arXiv AI/8月4日 12:39
74
30

论文Agentic Real2Sim:基于视觉语言代理的物理世界建模

筛选线索多模态开源模型与生态智能体多模态1 个独立信源

此前真实世界到模拟的转换依赖手动调优视觉基础模型、网格清理、坐标对齐及工具间的脆弱集成,成本高且难以扩展。Agentic Real2Sim通过代理自动化整个流程,并借助开源VLM大幅降低计算成本,使机器人仿真数据的生成更加高效可及。

arXiv AI/7月21日 15:23
73
当前展示各类别评分靠前的 30 条,共 119 条