arXiv AI1
arXiv AI 发布论文《AiFlow: Token-Native Reactive Orchestration with Bounded Backpressure for Streaming LLM Applications》,提出一种面向流式 LLM 应用的反应式编排模型。AiFlow 将 provider 增量标准化为 Context 事件,并通过有界背压机制管理队列和并发。实验显示,相比聚合方式,应用端首包时间(TTFPT)降低 70.9%-94.7%,队列深度下降 93.7%-96.5%。
为什么值得看此前流式 LLM 工作流常将生成视为粗粒度的请求-响应步骤,队列、并发和背压依赖临时回调代码。AiFlow 首次将 Token 级增量标准化为类型化事件,并用 Node Guardian 声明式管理有界队列,使背压、顺序和重试成为可静态验证的系统属性,减小了应用端延迟。
arXiv AI1
论文介绍 Gaokerena,一个面向波斯语医疗领域的小型语言模型家族。Gaokerena-V 基于 9000 万 token 的波斯语医疗语料和 2 万条专家问答训练,在翻译版医疗 MMLU 基准上从 46.28% 提升至 49.31%。Gaokerena-R 通过思维链和两种 RLAIF 框架,以更少数据获得 52.98% 的分数。两个模型均配备基于内部隐藏状态预测置信度的不确定性头,但当前性能尚不足以直接用于临床。
为什么值得看此前非英语医疗问答研究稀缺,波斯语等低资源语言严重缺乏相关模型。Gaokerena 是首个专注于波斯语医疗的紧凑型模型,能在消费级硬件上部署,并通过自定义不确定性头提供安全评估,为医疗 AI 在低资源语言地区的落地提供基础。
arXiv AI1
Tevatron 3.0 将 Megatron-Core 训练后端集成到原有框架中,保留数据流水线、评估流程和 Hugging Face 兼容检查点。在数据并行设置下,其重排序质量和训练效率与 FSDP 相当,推荐单节点配置下速度提升最高 22%,支持 LoRA 和全参数微调。专家并行使训练 30B 参数的 Qwen3-30B-A3B MoE 重排序器成为可能,而 PyTorch FSDP1 无法实现。在 BEIR-15 上与三种第一阶段检索器进行受控比较,发现 MoE 重排序器以不到一半的激活参数达到稠密 8B 模型的质量,推理吞吐量更高。框架和检查点将发布。
为什么值得看过去学术团队受限于训练基础设施,难以训练大规模 MoE 重排序器。Tevatron 3.0 通过集成 Megatron-Core 和专家并行,使得在学术算力下训练 30B 参数 MoE 重排序器成为可能,同时保持与现有工具链兼容,降低了大规模模型训练的门槛。
arXiv AI1
论文指出多智能体LLM流水线因缺乏边界验证而存在结构性安全漏洞,包括内容注入、身份伪装、计划偏离和记忆投毒。在GAIA和SWE-Bench基准的生产轨迹及受控实验中,漏洞在良性部署中也出现,且攻击成功率与流水线结构相关,而非模型能力。研究在GPT-5-mini、Claude Sonnet 4.5和Kimi K2.5上测试。
为什么值得看此前关注单智能体安全,此研究揭示多智能体流水线引入新的攻击面,且攻击成功取决于架构而非模型,意味着换用更强模型无法修复漏洞,需在流水线层面防御。这改变了安全评估与设计思路,对依赖多智能体协作的产品构成新风险。
arXiv AI1
本论文提出教育型LLM辅导工具中的教学泄露问题,指模型在授权前披露答案或推理。作者引入授权感知的完整中介边界,并实现可审计的发布控制。在599个Gemini 3.5提案上,严格中介将盲测泄露标记从181降至0,但降低了有用性;在外部时间戳复现中,高保证发布将主要标记从42降至8,仍有7处失败。
为什么值得看此前LLM辅导工具的安全研究多关注错误或有害内容,而本文首次系统定义并量化了“教学泄露”——模型正确且有帮助但过早泄露答案。通过可审计的控制机制,泄露标记大幅减少,为辅导工具的安全发布提供了新思路。