- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月14日 01:17
- 状态
- 单一信源
发生了什么
一篇论文提出了一种基于端到端认证KV缓存的边缘-云端协作LLM推理框架,本地处理预处理、嵌入计算、特征优化、KV缓存认证、推测解码等,云端进行认证解码器推理、KV缓存管理、令牌验证和高维投影。传输数据经量化和AES-GCM加密。该框架在基线拆分推理基础上将每令牌延迟降低最多46.1%,下行负载减少最多67.4%,同时保持与全云推理相当的性能。
为什么重要
此前边缘设备推理面临延迟、资源和隐私的三难困境,全云推理暴露用户数据,本地推理不可行。该框架通过加密协作和本地保留核心模块,在不牺牲性能的前提下同时优化了延迟和隐私,使消费级和嵌入式设备也能安全使用LLM。
底层逻辑
框架将LLM推理拆分为本地和云端两部分:本地负责敏感或计算量小的步骤(如嵌入、推测解码),云端负责计算密集的步骤(如解码器推理、高维投影)。通过认证KV缓存和加密传输,云端无法看到原始提示,本地也无需承担全部计算,从而实现隐私与效率的平衡。
产品与商业机会
产品可部署在CPU、GPU或嵌入式设备上,通过量化ONNX部署实现异构支持。能减少用户等待时间(每令牌延迟降低近一半),降低网络传输成本(下行负载减少三分之二),同时保护用户对话隐私,适合需要本地-云端混合的智能助手、实时翻译等产品。
- 在智能音箱或可穿戴设备中集成该框架,实现低延迟语音对话且避免上传原始音频到云端。
- 开发面向企业客户的私有化LLM解决方案,数据预处理在本地完成,云端仅处理脱敏中间结果。
- 将该框架作为API提供给应用开发者,允许其快速构建隐私合规的AI功能,无需自建异构硬件适配。
仍待确认
- 该框架在真实多用户并发场景下的吞吐量表现如何?
- 与其他隐私保护方法(如联邦学习、差分隐私)相比,计算和隐私权衡如何?
- 论文中的性能评估是基于哪些具体模型和硬件配置?