- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月16日 07:39
- 状态
- 单一信源
发生了什么
该研究提出一种云-边多模态交互框架,集成改进YOLO手势检测器(YOLO-DC)与大型语言模型(LLM)和视觉-语言模型(VLM)代理。云端负责手势检测、场景理解、多模态融合和动作规划,TonyPi机器人本地处理数据采集、通信、动作执行和反馈。在公开手势数据集和自定义数据集上,YOLO-DC精度分别达98.9%和95.0%,mAP@0.5达90.7%和92.7%。系统级评估中,单动作、复合动作和视觉依赖任务成功率分别为95%、88%和82%。30名参与者评估总体平均满意度3.69/5,证明了该方法在资源受限机器人交互中的可行性。
为什么重要
此前机器人交互通常依赖强板载计算或稳定云端连接。该方案通过云-边协同,在有限板载资源下实现高精度手势识别和多模态任务规划,实验成功率较高,为资源受限机器人部署复杂人机交互提供了可行路径。
底层逻辑
云端部署增强型YOLO(加入CBAM注意力模块和DIoU损失)提升对小尺度、部分遮挡手势的检测精度;同时结合LLM和VLM代理完成语义理解与动作规划。边缘机器人仅负责数据采集、通信和动作执行,降低本地计算负载。云边分工使计算密集型任务集中在云端,边缘保持实时响应能力。
产品与商业机会
仍待确认
- 系统在真实复杂环境下的端到端延迟具体是多少?是否满足实时交互需求?
- 该架构是否适用于其他类型的机器人平台或更广泛的任务场景?
- 用户满意度3.69/5(满分5)反映哪些具体不足?如何改进?
- 云-边通信中断或高延迟时的降级策略尚未在证据中提及。