arXiv AI1
一项针对广泛使用的LLM的审计研究发现,其评估结果受访问方式、是否启用网络搜索和重复运行次数影响。该研究比较了ChatGPT聊天界面和OpenAI API,使用来自BBQ和SafetyBench的401个提示共采集4812条响应。结果显示,启用网络搜索可使准确率下降最多8个百分点,且聊天界面在禁用搜索时准确率低于API。同一提示重复运行在最多21%的情况下产生不一致响应,且不同方式的引用依据和回避行为也不同。
为什么值得看此前AI安全评估常依赖单一API和单次运行,默认准确率指标可代表模型行为。该研究揭示,同一模型家族内,访问方式和搜索设置会显著改变准确率与响应一致性,甚至逆转模态性能趋势,表明仅报告简单准确率会掩盖安全相关的重要行为差异,对评估标准构成挑战。
arXiv AI1
论文提出面向医院的合规优先Agentic AI多层架构,包含Agent编排层、合规策略层(支持HIPAA、GDPR、EU AI Act等)和隐私保护数据层。基于合成医院数据及原型,演示了分诊预测、流程优化和合规日志编排,模拟显示任务周转时间和文档工作量显著降低。
为什么值得看医院AI部署多为部门级孤岛,70-80%试点难以规模化。该研究提出将合规与策略集中化的多层架构,为医院AI从单点工具走向平台化、合规化提供了可落地的蓝图,可能改变医院AI的采购和实施模式。
arXiv AI1
arXiv 发布论文介绍 ECHO,一个可本地部署的对话式健康助手,用于长期慢性病管理。ECHO 基于 LangGraph 的 ReAct 循环,集成 17 个临床工具和时序知识图谱,实现 94.9% 的工具执行通过率;安全层结合规则与图神经网络,对 2537 条土耳其健康数据集达到 88.8% 准确率;语音评估模块平均宏观 F1 为 0.652。系统可在消费级硬件运行,无需外部传输数据。
为什么值得看相比依赖云端的健康助手,ECHO 可在消费硬件本地运行,数据不外传,符合 GDPR 和 KVKK,可能降低隐私合规成本。其安全层超越零样本 LLM,如 Llama 3.3 70B,表明小型模型结合专用模块可达到实用水平,对资源受限场景有意义。
arXiv AI1
Argus 是一个面向长时程推理的通用智能体运行时,通过持续自我进化的运行时状态和控制策略,在固定模型权重下完成长期任务。在 SWE-Bench Pro 上达到约 78% 的准确率,相比 Direct Copilot 的 59%,使用 1.41 倍的总 token 数。经验证门控的自我进化后,成熟任务比启动阶段减少 21% 的解决输入 token 和 15% 的活跃工作时间,并记录了 34 次验证器恢复和 22 次严格审查循环挽救。
为什么值得看此前智能体通常依赖模型微调或上下文窗口处理长期任务,而 Argus 展示了通过持久化运行时状态和控制策略实现自我进化,无需更新模型权重。其通过验证门控的自我进化机制,显著提升任务准确率并降低后续任务的消耗,为智能体在真实复杂任务中的应用提供了新范式。
arXiv AI1
arXiv 论文提出 Unified Agent,一个跨设备、跨时间管理用户交互的有状态智能体。它通过设计紧凑的动作就绪状态,组织参与证据、已陈述事实和持续请求,以决定在当前观察下的行动。在默认设置下,它显著优于四种已发表设计的改编版本,并在多种多模态大语言模型设置下保持优势。
为什么值得看现有智能体系统在跨设备场景中缺乏有效状态管理,多智能体系统也未维护跨设备、跨时间的紧凑携带状态。该论文提出以状态设计为核心的原则,并通过基准测试证明其优势在多种 MLLM 设置下稳健,为跨设备智能体的设计提供了新方向。