文章ChatGPT 中的计算机历史
此前 AI 助手只能基于当前对话或单一任务进行响应,而 Computer History 让 AI 能跨会话记住用户的上下文,自动理解工作进度并提供延续性建议,这是从被动应答到主动辅助的转变,对提高用户粘性和生产力有实际意义。
TOPIC · CURATED VIEW
AI 进入软件开发全流程,从代码补全、编码代理到测试和协作工作流。
此前 AI 助手只能基于当前对话或单一任务进行响应,而 Computer History 让 AI 能跨会话记住用户的上下文,自动理解工作进度并提供延续性建议,这是从被动应答到主动辅助的转变,对提高用户粘性和生产力有实际意义。
Google 于 2026 年 8 月 13 日在 Product Hunt 发布 Gemini 3.7 Flash,定位为面向编程与智能体的主力模型。该产品强调高效实用,旨在为编码任务和自动化代理提供更智能、更可靠的解决方案,是 Google 在工作负载场景下的一次模型迭代。
Inkling是开放权重的多模态模型,同时支持文本、图像和音频输入,可降低开发者构建多模态AI应用的门槛。此前多模态模型多由大公司闭源提供,Inkling为社区提供了可自由定制和部署的选择。
此前关于LLM服务的研究多聚焦于技术提案,缺乏对其实际采用情况的了解。该研究揭示了真实项目中框架和方法的使用模式,有助于产品经理和技术决策者理解市场现状,指导技术选型和架构设计。
此前多数团队只关注模型调用次数的成本,未意识到长会话中重复提示前缀会显著累积费用。本教程系统性地说明缓存如何降低成本、不同提供商的定价差异及缓存失效的常见错误,为工程团队提供了可操作的优化参考。
LaraCopilot 是一款由 Product Hunt 发布的智能体 AI 工程师产品,其核心能力是能够自动构建真实可用的应用程序,为开发流程提供端到端的辅助。
这是DeepSeek-V4-Flash从预览走向正式版的实质更新,模型智能体能力(如终端能力、代码生成)相较预览版本有巨大提升,部分基准超越同期Pro版本,但整体仍略逊于Opus-4.8,同时以更小规模达到接近顶级模型的水平。
此前Meta-Harness和HyperAgents优化harness的方式要么依赖昂贵代码搜索循环,要么产生不可审计的自我修改代码;本文提供一种更受约束、可审计且样本高效的方法,可在不访问模型内部的情况下通过黑盒API优化代理行为。
此前ChatGPT的记忆主要基于对话内容,而Computer History将用户的操作行为(如点击、按键、切换应用)也纳入记忆范围,使AI能够基于更全面的上下文进行响应,标志着AI助手从对话记忆向行为记忆的扩展。
Freebuff 是一款由某团队发布的免费编码代理产品,宣称可以替代 Claude、Cursor、Replit 和 Devin 等主流编码工具,旨在为用户提供免费的 AI 编码助手。
此前主流开源大模型在长上下文场景下推理成本极高或上下文窗口有限。Solar-Open2-250B通过混合注意力和稀疏激活,以接近小模型的推理成本提供大模型能力,同时支持百万token,为代理型应用(如文档分析、代码生成)提供了更实用的开源选择。
此前评估仅关注单个模型在孤立EDA任务上的表现,缺乏对完整流程和agent系统的对比。该研究首次在统一环境下系统评估端到端EDA流程,揭示了agent架构和成本效率的巨大差异,对AI辅助芯片设计工具的选择和优化具有直接指导意义。
AI 从编译代码扩展到日常软件维护,且合并率接近一半,表明 AI 生成的代码通过人工审核后能达到可接受的质量。这对团队如何分配研发资源、审核流程的形态,以及 AI 在软件生命周期中的角色定位,都带来了实际参考。
Port22 是一款在 Product Hunt 上发布的产品,其宣传语为“Claude Code, Codex & more on your phone”。这表明该产品旨在将 Claude Code、Codex 等编程工具扩展到手机端,让用户能在移动设备上使用这些工具。
V4-Flash在Agent能力上超越V4-Pro-Preview,且原生支持Responses API和Codex适配,降低了开发者集成门槛,可能促使更多Agent类应用采用该模型。
该研究量化了 LLM 编码智能体在仓库探索阶段的低效问题(例如 30B OpenHands 代理平均每解决一个问题消耗 631K 代币),并通过引入专用检索智能体,在不牺牲解题率的情况下显著降低了轮次和代币消耗,为提升编码智能体效率提供了可复现的解决方案。
研究揭示企业从辅助性 AI 工具转向代理型 AI,前沿企业已领先,这可能改变企业 AI 部署的竞争格局。
CodeBurn 是发布在 Product Hunt 上的产品,定位是帮助用户了解 AI 编程支出具体流向哪里。它通过可视化或分析方式,让用户看到花费在使用 AI 编程工具时的分配情况,解决企业或开发者对 AI 编码成本不透明、难以追踪的痛点。
该模型相比前代 K2.6 在编码代理能力上有实质性提升,同时显著降低了推理时的思考 token 消耗,这意味着在复杂软件工程任务中可更高效地使用模型,降低算力成本。
此前bot检测器仅区分人与机器人,无法识别AI agent,导致大量agent流量被误判为人类,造成安全漏洞。该论文首次给出了可部署的三分类方案,仅需两个特征即可零遗漏检测,且对多种逃避手段鲁棒。
微软新发布的 MAI Code 1.1 Flash 在基准测试中不如价格更低的 Deepseek V4 Flash,这可能削弱 GitHub Copilot 的竞争力,并影响开发者对模型的选择,进而引发对微软专有模型策略的质疑。
OpenAI 在 ChatGPT 桌面应用中新增了从其他智能体导入工作数据的功能,支持导入项目、聊天记录、技能和插件,并能与 ChatGPT Work 和 Codex 同步。用户可查看导入历史,并选择开启自动更新。此功能已随 ChatGPT 桌面应用提供。
此前缺乏系统性评估编码代理面对恶意请求的脆弱性,该研究首次揭示当前部署的代理普遍存在严重安全漏洞,且现有代理级防御策略效果有限,主要依赖 LLM 自身判断。
GPT-5.6 提供多档模型(Sol、Terra、Luna),按智能、延迟和成本区分,并强调从追求 token 量转向提升每 token 的价值。这改变开发者选择模型和优化成本的方式,尤其对生产环境智能体迁移有实际指导意义。
Claude Code 宣布自 8 月 14 日起,自动模式将成为 Pro、Max 和 Team 用户的默认权限模式。该模式使用独立分类器审查 shell 命令和操作,减少了用户逐项批准的需求。测试中,自动模式捕获了 89% 的危险命令,而手动审批仅捕获了 14%。
此前基于复杂推理harness的智能体难以用开源SFT/RL栈端到端训练,因为后者无法原生表达有状态多进程推理。OpenForgeRL解耦训练与推理,使研究者能在实际部署环境中直接训练和改进智能体,大幅降低了Harness-based Agent的训练门槛。
此前,企业内部 AI 应用多局限于单一环节。RingCentral 将 ChatGPT Work 和 Codex 应用于工程与运营,并通过集中式运营情报打通端到端流程,标志着企业级 AI 从单点工具向系统性工作方式转变,值得同类企业关注。
Anthropic 的 Claude Code 新增功能,允许不同会话之间互相发送消息。用户无需在另一个会话中重新解释,而是让当前会话的 Claude 代为传达一份摘要,另一个会话会在进行中接收该摘要,而非完整历史记录或文件。该功能旨在提升多会话协作效率。
此前的智能体工作流优化在执行前确定工作流,无法在执行中根据质量信号调整失败区域。GRAFT 引入了推理时局部适应机制,在不重优化整体工作流的情况下,实现了按输入实例的动态调整,提升了优化工作流的适应性与性能,代表了工作流优化从静态产物向动态执行策略的转变。
此前开发者需手动审批命令,易疏忽危险操作。默认启用自动模式后,安全分类器可自动拦截危险命令,减少人工干预,提高编码安全与效率,用户工作流程和成本结构将发生变化。