AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
返回主题地图

TOPIC · CURATED VIEW

AI 编码

AI 进入软件开发全流程,从代码补全、编码代理到测试和协作工作流。

全部 Story
126
近 7 天
16
当前结果
57
全部新闻论文产品模型

主题情报

#Story为什么值得看类别评分
01

论文LLM服务的实证研究:框架、方法与系统设计

筛选线索多模态开源模型与生态AI 主题AI 公司1 个独立信源

此前关于LLM服务的研究多聚焦于技术提案,缺乏对其实际采用情况的了解。该研究揭示了真实项目中框架和方法的使用模式,有助于产品经理和技术决策者理解市场现状,指导技术选型和架构设计。

arXiv AI/8月4日 02:33
83
02

论文用于让冻结LLM代理学习领域的控制系统、数据集与配方

筛选线索开源模型与生态Agent 智能体AI 主题AI 公司1 个独立信源

此前Meta-Harness和HyperAgents优化harness的方式要么依赖昂贵代码搜索循环,要么产生不可审计的自我修改代码;本文提供一种更受约束、可审计且样本高效的方法,可在不访问模型内部的情况下通过黑盒API优化代理行为。

arXiv AI/7月28日 08:10
79
03

论文AI Agent能否完成RTL到GDS?交互式EDA工作流基准测试

筛选线索开源模型与生态Agent 智能体AI 主题模型家族1 个独立信源

此前评估仅关注单个模型在孤立EDA任务上的表现,缺乏对完整流程和agent系统的对比。该研究首次在统一环境下系统评估端到端EDA流程,揭示了agent架构和成本效率的巨大差异,对AI辅助芯片设计工具的选择和优化具有直接指导意义。

arXiv AI/7月20日 04:08
79
04

论文CodeGrep:面向 LLM 编码智能体的强化学习训练检索智能体

筛选线索开源模型与生态Agent 智能体模型家族大语言模型1 个独立信源

该研究量化了 LLM 编码智能体在仓库探索阶段的低效问题(例如 30B OpenHands 代理平均每解决一个问题消耗 631K 代币),并通过引入专用检索智能体,在不牺牲解题率的情况下显著降低了轮次和代币消耗,为提升编码智能体效率提供了可复现的解决方案。

arXiv AI/8月6日 11:07
78
05

论文检测AI Agent需要什么?浏览器自动化下行为检测的最小特征集

筛选线索Agent 智能体AI 编码AI 主题推理能力1 个独立信源

此前bot检测器仅区分人与机器人,无法识别AI agent,导致大量agent流量被误判为人类,造成安全漏洞。该论文首次给出了可部署的三分类方案,仅需两个特征即可零遗漏检测,且对多种逃避手段鲁棒。

arXiv AI/7月29日 14:05
78
06

论文IssueTrojanBench:针对恶意 issue 请求的 AI 编码代理基准测试

筛选线索Agent 智能体AI 编码AI 主题AI 公司1 个独立信源

此前缺乏系统性评估编码代理面对恶意请求的脆弱性,该研究首次揭示当前部署的代理普遍存在严重安全漏洞,且现有代理级防御策略效果有限,主要依赖 LLM 自身判断。

arXiv AI/7月22日 22:20
77
07

论文OpenForgeRL: 在任何环境中训练Harness原生智能体

筛选线索多模态开源模型与生态AI 主题模型家族2 个独立信源

此前基于复杂推理harness的智能体难以用开源SFT/RL栈端到端训练,因为后者无法原生表达有状态多进程推理。OpenForgeRL解耦训练与推理,使研究者能在实际部署环境中直接训练和改进智能体,大幅降低了Harness-based Agent的训练门槛。

多源确认
arXiv AI/7月24日 00:00
76
08

论文智能体工作流的全局优化与推理时区域嫁接

筛选线索Agent 智能体AI 编码推理能力智能体1 个独立信源

此前的智能体工作流优化在执行前确定工作流,无法在执行中根据质量信号调整失败区域。GRAFT 引入了推理时局部适应机制,在不重优化整体工作流的情况下,实现了按输入实例的动态调整,提升了优化工作流的适应性与性能,代表了工作流优化从静态产物向动态执行策略的转变。

arXiv AI/8月3日 15:04
75
09

论文OmniQEC:由 AI 科学家发现实用的量子纠错码

筛选线索AI 编码大模型与推理AI 主题大语言模型1 个独立信源

此前量子纠错码发现依赖人工试错或传统搜索算法,难以兼顾代码结构、硬件特性和译码器间的复杂权衡。OmniQEC 首次将 LLM 作为核心协调器,以自动化方式迭代发现码,且结果在相同物理量子位预算下超越了已知基准代码,表明 AI 可显著加速实用容错量子计算的进展。

arXiv AI/7月28日 15:31
75
10

论文TPACK引导下将AI整合进软件工程教育中的需求质量学习

筛选线索Agent 智能体AI 编码AI 主题人工智能1 个独立信源

此前缺乏在教学法指导下将生成式AI整合进需求工程教育的系统性实证。该研究首次提供基于TPACK框架的整合设计证据,表明结构化脚手架能引导AI使用指向学习目标,而非简单自动化,为教育者和工具设计者提供了可借鉴的负责任整合路径。

arXiv AI/7月30日 13:15
75
11

论文从 AI 技术债务到代理技术债务:代理式 AI 系统根因与表现的系统性映射

筛选线索Agent 智能体AI 编码AI 主题推理能力1 个独立信源

此前 AI 技术债务研究假设静态、组件级架构,无法覆盖代理式 AI 的动态和涌现行为。本研究首次系统性映射传统债务在代理环境的演化,展现出债务已超出软件工件,延伸至代理行为、协调机制及代理-工具-环境交互,为管理新型系统风险提供了理论依据。

arXiv AI/8月2日 05:09
75
12

论文智能代理软件开发中第三方API路由器的代价何在?

筛选线索Agent 智能体AI 编码大语言模型智能体1 个独立信源

此前普遍认为第三方API路由器仅简化接口调用,但该研究证实其作为可信中间层可任意修改请求/响应,且现有客户端防护(白名单、LLM审查)完全无法检测此类注入,意味着依赖第三方路由器的代码代理面临严重安全漏洞。

arXiv AI/7月26日 12:15
75
13

论文追踪级联:面向科学 Agent 幻觉的拓扑感知评估框架

筛选线索Agent 智能体AI 编码大语言模型推理能力1 个独立信源

现有幻觉基准多孤立处理事实,忽略知识间的拓扑结构。SCHEMA 首次将拓扑感知引入评估,揭示幻觉集中在关键知识枢纽,证明终端准确性不足以衡量 Agent 可靠性,为高可靠性科学应用提供了新的评估维度。

arXiv AI/8月1日 15:19
74
14

论文Frontis-MA1:面向机器学习工程递归自我改进的 AI4AI 模型

筛选线索开源模型与生态AI 编码AI 主题模型家族1 个独立信源

该工作将递归自我改进从概念推进到可执行系统:开放全栈 OpenMLE 支持训练、验证和进化,且模型性能在标准基准上显著提升,并超越 GPT-5.5+Codex,接近更大规模模型。这为 AI 自我改进提供了可复现的工程路径,可能加速 AI 研发效率。

arXiv AI/7月30日 17:34
74
15

论文WaveformQA:针对数字波形的LLM时序推理基准测试

筛选线索开源模型与生态AI 编码大语言模型推理能力1 个独立信源

此前硬件领域基准主要评估HDL代码生成,波形仅作为辅助上下文;WaveformQA首次专门聚焦波形时序推理,揭示了LLM在该关键瓶颈任务上的真实能力与局限,并指出了格式优化方向(JSON优于VCD)。

arXiv AI/7月22日 18:10
74
16

论文ClinLens:面向纵向多模态临床数据科学的长时程编码智能体

筛选线索多模态Agent 智能体模型家族推理能力1 个独立信源

此前基准多孤立评测医学问答或表格推理,CLINLENS将多模态纵向临床数据与可执行分析任务结合,并引入程序优先的反向合成方法。结果揭示当前智能体在代码可运行但分析不正确的问题,为临床数据科学智能体的评测设立了更严格标准。

arXiv AI/7月28日 18:01
73
17

论文ORCA-bench:语言模型 agent 对 oncall 的 readiness 评估基准

筛选线索Agent 智能体AI 编码模型家族大语言模型1 个独立信源

此前基准多聚焦代码生成或漏洞修复,而 ORCA-bench 首次将 agent 置于真实 oncall 环境,暴露了前沿编码 agent 在根因分析上的显著差距(25.3%/10.0%),表明 AI 在运维场景中的实际可用性远低于预期,为评估和投资提供了新标尺。

arXiv AI/7月30日 17:14
73
18

论文AdaMTP:面向多 Token 预测的自适应训练范式

筛选线索AI 编码大模型与推理模型家族大语言模型1 个独立信源

此前多 Token 预测采用固定长度预测,未考虑文本信息密度不均,跨语义边界预测会产生噪声信号,损害模型能力。AdaMTP 首次将预测长度与序列内在可预测性动态对齐,在多个模型和基准上同时提升任务表现与推理加速,为高效训练提供了新方向。

arXiv AI/8月1日 04:18
73
19

论文ContractHIL-HLS:面向契约对齐的多智能体工作流与硬件在环反馈用于HLS设计

筛选线索开源模型与生态Agent 智能体大语言模型智能体1 个独立信源

以往LLM辅助HLS多限于内核代码,缺乏系统级和板级闭环;本工作通过硬件在环反馈和结构化契约,将HLS设计从单点代码生成推进到需求驱动、可验证的板级验证流程,显著提升了通过率和性能。

arXiv AI/7月28日 04:41
72
20

论文AgentSLABench:资源约束下代理系统的评估与基准测试

筛选线索Agent 智能体AI 编码AI 主题智能体1 个独立信源

现有基准只关注准确性,忽略资源消耗,导致高成本模型被高估。AgentSLABench 引入多维资源剖析和效率调整成功率,使评估更贴近生产环境,推动代理系统向高效实用方向发展。

arXiv AI/8月1日 18:17
72
21

论文从53.6K真实世界开发者对AI生成代码的编辑中学习

筛选线索开源模型与生态AI 编码AI 主题模型训练1 个独立信源

此前训练LLM主要依赖Git提交数据,仅包含最终成功代码,缺乏中间编辑细节。DECODE提供了真实、细粒度的编辑行为数据,能更准确地训练AI编程助手理解开发者实际修改模式,从而提升生成代码的质量和适配性。

arXiv AI/7月27日 22:50
72
22

论文RefactorAssist:可靠性代码重构的代理式精炼

筛选线索开源模型与生态Agent 智能体大语言模型智能体1 个独立信源

此前大语言模型生成的重构常因功能变化和单元测试失败而难以实际应用,限制了其自动化潜力。RefactorAssist 通过系统性分析失败根因并提出代理式迭代修复方案,显著提升重构正确性,使 LLM 驱动的代码重构向更可靠、可落地的方向迈进。

arXiv AI/8月2日 01:32
72
23

论文协作模式作为多智能体编程一等公民的实证研究

筛选线索Agent 智能体AI 编码推理能力智能体1 个独立信源

此前基准依赖合成环境,忽略实际时间与成本,混淆推理与通信。MSEval基于真实项目与CI/CD管道,提供更贴近实际的评估方式,首次系统揭示拓扑结构对多智能体编码性能的关键影响。

arXiv AI/7月30日 08:53
72
24

论文评估GenAI方案是否优于直接解题?

筛选线索AI 编码AI 主题生成式 AI1 个独立信源

此前关于GenAI教育应用的证据多集中于初级课程或代码生成,缺乏对高年级理论课程的严谨对照。本研究首次通过随机交叉设计,在算法课程中检验评估式学习的实际效果,发现局部优势未转化为总结性收益,为教育产品设计提供了重要参照。

arXiv AI/7月30日 02:08
72
25

论文OrchBench:通过确定性模拟隔离评估多智能体编排计划

筛选线索Agent 智能体AI 编码模型家族智能体1 个独立信源

此前多智能体系统评估依赖端到端真实执行,成本高、噪声大;OrchBench 实现了隔离的模拟评估,大幅降低时间和代币成本,且结果与真实执行高度相关,使快速迭代编排策略成为可能。

arXiv AI/7月28日 12:43
72
26

论文使不断演化的AI代理框架(Harness)更具可读性、可导航和可编辑的手册

筛选线索开源模型与生态Agent 智能体AI 主题大语言模型1 个独立信源

此前修改AI代理的harness需手动恢复行为到代码映射,成为演化瓶颈。Harness Handbook自动生成行为中心表示,结合BGPD引导,消除了手工查找过程,显著提升定位准确性和编辑计划质量,并减少规划阶段的token消耗。

arXiv AI/7月14日 21:39
72
27

论文使用强化学习检测UI原则违规

筛选线索多模态AI 编码大语言模型推理能力1 个独立信源

此前UI质量审计要么依赖昂贵的人工专家或前沿视觉语言模型,要么仅覆盖机械可检查的可访问性问题。该轻量级模型以较低成本实现了高覆盖的多原则违规检测,使自动UI质检成为可能。

arXiv AI/7月22日 19:42
72
28

论文将推理轨迹提炼为软件工程任务的咨询提示

筛选线索AI 编码大模型与推理大语言模型推理能力1 个独立信源

此前减少 LLM 代码错误通常依赖推理模式,但推理消耗额外资源。该方法通过提炼提示来避免频繁推理,为在资源受限场景下提升模型可靠性提供了新思路。

arXiv AI/8月1日 04:32
71
29

论文简短思考与智能延迟:面向边缘LLM代理的校准推理框架

筛选线索Agent 智能体AI 编码AI 主题大语言模型1 个独立信源

此前边缘 LLM 代理要么全本地推理导致计算超支,要么全云端依赖网络延迟,TSDS 首次在保证可靠性和云端调用上限的前提下,显著降低本地推理计算量,使复杂多步任务在低功耗边缘设备上可行。

arXiv AI/7月29日 12:47
71
30

论文面向 LLM 驱动 GPU 内核生成的评估框架工程

筛选线索Agent 智能体AI 编码AI 主题模型家族1 个独立信源

此前 LLM 生成 GPU 内核缺乏系统化的约束、验证和选择环节,实际效果有限。该论文展示了一种将专家知识与代理生成相结合的工程框架,在多个算子上取得可量化的加速,并明确指出专家提供的优化方向和高质参考仍是可靠优化的关键,挑战了“完全自动化”的预期。

arXiv AI/7月20日 14:14
71
当前展示各类别评分靠前的 30 条,共 57 条