AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
返回主题地图

TOPIC · CURATED VIEW

具身智能

AI 进入物理世界:人形机器人、具身基础模型,以及感知与操作能力的进展。

全部 Story
65
近 7 天
6
当前结果
46
全部新闻论文产品模型

主题情报

#Story为什么值得看类别评分
01

论文从被动镜像到主动智能体:网络上的全息数字孪生用于物理 AI

筛选线索Agent 智能体具身智能AI 主题人工智能1 个独立信源

现有 AI 和无线网络架构分别受限于物理世界建模和实时协调能力,而 HDT-Nets 提出将网络基础设施与数字孪生结合,使智能体能主动推理并共享时空上下文,为物理 AI 在机器人、车辆等场景下的实时协调提供了新框架。

arXiv AI/8月6日 16:17
78
02

论文DelusionEval:测量 AI 聊天机器人中与妄想相关的行为

筛选线索具身智能大模型与推理AI 主题模型家族1 个独立信源

此前 LLM 安全性评估多关注事实性或有害内容,缺乏针对长期对话中妄想螺旋的量化测试。DelusionEval 首次基于真实心理伤害事件构建评估集,并揭示上下文长度是影响安全行为的关键变量,挑战了“更大模型更安全”的假设,推动评估范式向真实世界场景转变。

arXiv AI/8月5日 16:11
78
03

论文检测AI Agent需要什么?浏览器自动化下行为检测的最小特征集

筛选线索Agent 智能体AI 编码AI 主题推理能力1 个独立信源

此前bot检测器仅区分人与机器人,无法识别AI agent,导致大量agent流量被误判为人类,造成安全漏洞。该论文首次给出了可部署的三分类方案,仅需两个特征即可零遗漏检测,且对多种逃避手段鲁棒。

arXiv AI/7月29日 14:05
78
04

论文EmpaAva:开源代理式3D化身共情实时聊天机器人

筛选线索多模态开源模型与生态大语言模型智能体1 个独立信源

此前共情聊天机器人和3D化身多为独立研究方向,缺乏开源且整合共情回复、情感感知和统一表情语音渲染的代理式系统。EmpaAva将共情能力带入实时视频交互,并用单一LLM协调感知与表达,为构建有情感、可检查的虚拟交互产品提供了可复用的开源方案,有助于降低相关产品研发门槛。

arXiv AI/8月5日 11:23
76
05

论文为关键系统构建可信任的智能体AI工程

筛选线索Agent 智能体具身智能AI 主题人工智能1 个独立信源

此前智能体AI评价多聚焦任务能力,本文首次将可信赖性作为系统化工程属性,提出了跨领域复用保证框架的路径,类似于成熟工程领域的分级认证体制,为关键系统的实际部署提供了可操作的方法论。

arXiv AI/7月20日 22:28
75
06

论文Deltoris:通过比特级稀疏与推测推理实现具身智能中的实时 VLA 推理

筛选线索多模态具身智能AI 主题多模态1 个独立信源

扩散式 VLA 模型计算量大且需高频控制,边缘设备难以满足实时性。Deltoris 通过协同设计大幅提升推理速度,为具身智能产品在边缘端落地提供了可行路径,可能推动更小、功耗更低硬件上的实时控制应用。

arXiv AI/8月5日 04:17
75
07

论文在Agentic LLM系统中利用轨迹图实现执行前错误诊断

筛选线索Agent 智能体具身智能大语言模型智能体1 个独立信源

此前LLM智能体在长程交互任务中常因单个次优动作导致整体失败,且修复通常依赖昂贵的微调。该框架无需微调即可在执行前预判错误,显著提升任务完成率,为智能体调试提供了一种新范式,降低了长程任务落地的训练成本。

arXiv AI/7月29日 20:14
75
08

论文自知老化的机器:硬件感知的自主智能框架

筛选线索具身智能人工智能推理能力1 个独立信源

已有自主系统假定硬件恒定,老化的硬件与软件预期不匹配可能导致整机故障。AAAI 首次将硬件健康统一纳入自主决策闭环,应用预测模型主动适应能力衰减,为长期或安全关键任务中的系统韧性提供新路径。

arXiv AI/7月30日 16:17
74
09

论文智能体元宇宙服务:一种新的即服务范式

筛选线索多模态Agent 智能体AI 主题人工智能1 个独立信源

智能体从对话式聊天机器人转向自主行动的 Agentic AI,使服务封装了感知、决策、执行、协作和内容生成能力。将这种能力用于元宇宙业务处理,形成了 Meta-AaaS 新范式,是服务计算的新方向,可能改变虚拟环境中的服务交付方式。

arXiv AI/7月30日 14:06
74
10

论文Agentic Real2Sim:基于视觉语言代理的物理世界建模

筛选线索多模态开源模型与生态智能体多模态1 个独立信源

此前真实世界到模拟的转换依赖手动调优视觉基础模型、网格清理、坐标对齐及工具间的脆弱集成,成本高且难以扩展。Agentic Real2Sim通过代理自动化整个流程,并借助开源VLM大幅降低计算成本,使机器人仿真数据的生成更加高效可及。

arXiv AI/7月21日 15:23
73
11

论文PhyAI:边缘实时物理 AI,云端可扩展部署

筛选线索多模态具身智能AI 主题多模态1 个独立信源

此前 Physical AI 在不同阶段(评估、云强化学习、边缘 GPU 推理、机载部署)使用分离的推理程序,维护成本高。PhyAI 用单一运行时统一了这些场景,并通过适配器接口在模型发布当天即集成 MiniCPM-Robot,表明该方案能显著降低多模型支持成本,并提升端到端部署效率。

arXiv AI/8月4日 13:53
73
12

论文iARCS:面向可控 3D 场景生成的迭代智能体强化学习

筛选线索Agent 智能体具身智能AI 主题大语言模型1 个独立信源

既有 3D 生成器常优化感知真实感,却难以保证任务关键的功能约束(如可访问性、可穿越性),限制了合成数据在下游训练中的价值。iARCS 直接针对此类约束进行优化,且生成数据可反哺基础生成器,提升了合成数据作为训练资源的实用性。

arXiv AI/8月6日 15:30
73
13

论文云边协同视觉-语言-动作模型:通过涌现表示特化容忍延迟

筛选线索多模态具身智能推理能力多模态1 个独立信源

此前分层或异步策略的慢路径表示可能过期或需显式调度,而CloudEdgeVLA将时间错位作为表示学习问题,无需阻塞同步,使云端大模型可增长而边缘保持轻量,为机器人部署提供可扩展路径。

arXiv AI/8月1日 10:11
73
14

论文推理作为双刃剑:视觉-语言-动作模型中的架构与跨阶段鲁棒性

筛选线索多模态具身智能推理能力多模态1 个独立信源

此前业界普遍认为加入推理步骤能提升模型鲁棒性,但该研究表明这一假设并不普遍成立:隐式迭代推理架构反而极度脆弱,且推理输出监控在自适应攻击下无效,这对依赖推理增强安全性的产品设计构成重大挑战。

arXiv AI/7月20日 10:20
73
15

论文多模态情感语言模型真的需要超过1B参数吗?

筛选线索多模态具身智能推理能力多模态1 个独立信源

此前多模态情感识别模型参数规模至少7B,计算成本高、推理效率低,难以在机器人、移动设备等资源受限平台实时运行。这篇论文证明,通过优化的知识蒸馏,子十亿参数模型也能达到甚至超越大模型的性能,改变了对模型规模与性能关系的固有认知。

arXiv AI/7月14日 14:01
72
16

论文简短思考与智能延迟:面向边缘LLM代理的校准推理框架

筛选线索Agent 智能体AI 编码AI 主题大语言模型1 个独立信源

此前边缘 LLM 代理要么全本地推理导致计算超支,要么全云端依赖网络延迟,TSDS 首次在保证可靠性和云端调用上限的前提下,显著降低本地推理计算量,使复杂多步任务在低功耗边缘设备上可行。

arXiv AI/7月29日 12:47
71
17

论文结构感知鲁棒微调:防御物理注意力劫持攻击的视觉-语言-动作机器人

筛选线索多模态具身智能多模态模型训练1 个独立信源

此前 VLA 策略在物理世界攻击面前的脆弱性缺乏针对性防御方案。该研究首次提出并验证机制级防御方法 SARF,在真实机械臂上显著提升攻击下的成功率,同时保持干净性能,为 VLA 机器人的安全性提供了一条可实践路径。

arXiv AI/8月4日 07:03
71
18

论文RxBrain:具备联合语言-视觉推理与想象力的具身认知基础模型

筛选线索多模态Agent 智能体基础模型推理能力1 个独立信源

此前具身认知模型多分离语言理解与视觉预测,RxBrain在单一规划序列中融合两者,语言提供抽象规划逻辑,视觉想象力落地物理状态,使模型能同时进行任务分解和状态预测,更贴近具身智能体的真实需求。

arXiv AI/7月15日 15:45
71
19

论文Combodied Agents:以人为中心的智能体AI新范式

筛选线索多模态Agent 智能体AI 主题智能体1 个独立信源

现有智能体要么只改变软件状态,要么只改变物理状态,均未将个人状态与主体性作为核心。Combodied Agents首次提出统一框架,将个人状态作为建模、干预和评估对象,可能推动AI从任务执行向人本辅助转变。

Hugging Face Daily Papers/8月12日 00:00
71
20

论文MARS-RA:基于多模态比较的排序聚合实现具身多智能体合作中的信用分配

筛选线索多模态Agent 智能体AI 主题智能体1 个独立信源

在多智能体强化学习中,传统信用分配依赖绝对奖励估计,易受噪声和延迟反馈影响。MARS-RA 将评估方式改为比较排序,利用大型多模态模型生成对比,提高了鲁棒性,并支持动态智能体数量变化,这为具身 AI 协作提供了更可靠的方法。

arXiv AI/7月30日 10:14
71
21

论文RRM:面向长时程多模态推理的经验驱动反思检索记忆

筛选线索多模态具身智能推理能力多模态1 个独立信源

此前多模态长期记忆代理侧重存储而非检索,检索失败缺乏自适应机制;RRM 首次将反思性经验记忆引入检索流程,实现跨任务策略复用,并在多个长视频基准上显著提升性能,是多模态代理记忆机制的重要进展。

arXiv AI/7月30日 12:58
70
22

论文统一具身合成与世界基础模型:小米机器人U0

筛选线索图像生成多模态模型家族基础模型1 个独立信源

过去具身生成方法常牺牲预训练的视觉知识,而该模型首次在多种机器人实体上实现高质量多视角场景生成,并引入结构化可控具身转移。它将世界基础模型的泛化能力保留并适应于具身场景,显著提升真实环境操作成功率。

arXiv AI/7月13日 14:57
70
23

论文用一张纸劫持机器人:VLM控制机器人物理提示注入的系统研究

筛选线索多模态具身智能模型家族推理能力1 个独立信源

此前提示注入多针对纯文本或在线聊天机器人,而本研究表明物理世界的视觉文本也能劫持VLM控制的机器人,攻击面从数字扩展至物理环境,且对GPT-4o等前沿模型有效,说明VLM规划器的鲁棒性存在系统性弱点,对机器人安全有重要警示。

arXiv AI/8月6日 07:52
70
24

论文VLAGuard:针对无线传感器网络中视觉-语言-动作机器人物理注意力劫持的评估与缓解框架

筛选线索多模态具身智能多模态模型推理1 个独立信源

工业界此前缺少对VLA机器人物理攻击的系统性评估框架,而VLAGuard填补了这一空白。其表明打印贴片可造成高达100%的失败率,并展示了一种零推理开销的防御手段,将攻击下的成功率提升至67.4%,显著提高了VLA驱动的边缘节点在实际部署中的可靠性。

arXiv AI/8月2日 06:06
70
25

论文破碎之门:LLM代理时代重新评估Web机器人防御

筛选线索Agent 智能体具身智能AI 主题大语言模型1 个独立信源

LLM代理能自主导航和理解页面内容,使得传统挑战式验证码近乎失效,非交互式防御也暴露了非根本性弱点,威胁现有bot管理系统,安全厂商需重新评估防御架构。

arXiv AI/7月21日 03:02
70
26

论文提示控制机器人:多智能体机器人系统中的提示注入攻击

筛选线索Agent 智能体具身智能大语言模型智能体1 个独立信源

此前提示注入研究多集中于单智能体或纯软件环境,该研究首次在多智能体实体机器人系统中验证攻击传播,提示安全隐患更严重。

arXiv AI/8月1日 16:31
69
27

论文SpatialCLI:先用空间工具推理,再脱离工具

筛选线索多模态Agent 智能体模型家族智能体1 个独立信源

此前通用VLM与专用视觉模型存在能力鸿沟:通用模型能推理任务但细节不足,专用模型细节准确但缺乏任务决策。SpatialCLI通过工具增强和内部化,显著提升了VLM的空间感知能力,且内化后仍保持较高准确率,为具身智能和空间推理提供了新路径。

arXiv AI/7月30日 05:39
69
28

论文FoMoVLA:融合视觉预见与运动引导的视觉-语言-动作模型

筛选线索多模态具身智能推理能力多模态1 个独立信源

此前VLA模型仅根据当前观测输出动作,缺乏对世界动态的显式预测。FoMoVLA将未来特征预测与稀疏点跟踪互补结合,使模型能预见目标状态并规划连续运动路径,从反应式策略转为主动规划。

arXiv AI/7月16日 09:04
69
29

论文AI聊天机器人意识归因的认识论分析

筛选线索具身智能AI 主题模型家族1 个独立信源

该论文澄清了用户对AI聊天机器人意识信念的不同层次,揭示了表面相同的归因可能反映不同的认识论承诺。这有助于理解人机交互中的信任、责任和用户心理,对AI伦理和用户体验设计具有参考意义。

arXiv AI/7月22日 10:36
69
30

论文用于机器人的智能云边多模态交互系统

筛选线索多模态具身智能大语言模型多模态1 个独立信源

此前机器人交互通常依赖强板载计算或稳定云端连接。该方案通过云-边协同,在有限板载资源下实现高精度手势识别和多模态任务规划,实验成功率较高,为资源受限机器人部署复杂人机交互提供了可行路径。

arXiv AI/7月16日 07:39
69
当前展示各类别评分靠前的 30 条,共 46 条