新论文:将记忆放入LLM循环内部,提升智能体工作记忆
新论文:将记忆放入LLM循环内部,提升智能体工作记忆
一篇 arXiv 新论文提出“内存循环”(Memory in the Loop)架构,将知识检索从每轮一次的外部查询,改为每步都读写的内存循环。传统智能体每轮只能外部查询一次记忆,新方法将记忆移入推理循环内部,每步均可读写。实验证明,该架构显著提升智能体在长序列任务中的表现,尤其需要持续引用上下文的场景。
Lilian Weng总结35篇论文:面向RSI的驾驭工程
OpenAI 成员 Lilian Weng 发布了一份关于“面向递归自我改进(RSI)的驾驭工程”(Harness Engineering for RSI)的论文摘要集,涵盖35篇相关研究。内容涉及如何通过工程设计让AI系统实现递归自我改进,包括提示工程、奖励设计、自我修正机制等方向。这是本周少有的深度阅读材料。
ChatGPT语音模式升级GPT-5.5,可分流复杂任务
OpenAI 为 ChatGPT 语音模式升级了全新模型 GPT-5.5(非官方命名)。用户可在 iPhone 应用中使用预览。新模型在语音交互的流畅度和理解准确度上大幅提升。更重要的是,它能在需要网络搜索、深度推理或复杂计算时,自动将任务分流给更强的 GPT-5.5 后端处理,而语音交互本身保持低延迟。
Vercel Agent上线:可介入生产环境的AI代理
Vercel 宣布扩展其 AI Agent 能力。Vercel Agent 此前主要用于告警分类和代码审查,现在它已入驻用户仪表盘,能够直接调查生产环境问题、回答项目相关问题,并在用户批准后执行操作。由于 Vercel Agent 深度集成于平台,它能在安全边界内工作,降低误操作风险。开发者可直接在项目管理后台调用该代理,无需切换工具。
Bun重写为Rust语言完成,性能与稳定性提升
Bun 创始人 Jarred Sumner 兑现承诺,发布了将 JavaScript 运行时 Bun 从 Zig 重写为 Rust 的详细博客。重写过程耗时数月,目标是提升性能、降低内存占用并改善跨平台兼容性。文章详细描述了这一极其复杂的工程决策和实现细节,包括内存管理和线程模型的重构。
MemAttention:低开销长上下文推理,解决历史累积问题
Akashic 提出 MemAttention 机制,为长上下文 LLM 推理服务降低开销。该方案针对多轮对话、工具调用和跨会话工作流中上下文不断累积导致的预填充成本高企问题,通过优化注意力计算减少冗余,使模型在处理持续增长的上下文时更高效。这对构建长期运行的 AI Agent 系统有直接帮助,可降低推理延迟和计算资源消耗。
ResonatorLM:用谐振场混合替代自注意力,实现高效长上下文建模
ResonatorLM 提出因果谐振场混合机制,作为 Transformer 自注意力的替代方案,专为高效长上下文语言建模设计。该方法通过物理启发的谐振场相互作用实现信息混合,在保持并行训练效率的同时,降低长序列下的内存和计算开销。初步结果表明,它能在更长上下文中保持较好的建模能力,同时减少推理延迟。
NapMem:让LLM主动导航记忆而非被动检索,提升个性化对话
NapMem 提出一种新框架,将长期用户记忆从被动检索接口转变为 LLM 可主动导航的结构化操作空间。传统记忆系统让模型只能消费预选知识,NapMem 则允许模型在多个记忆片段中自主选择、组合和操作信息,从而在个性化对话中更精准地调用用户历史。实验证明该方法在长程个性化任务上表现更优。
KV-Cache压缩技术对比基准:任务质量与系统性能的权衡
该研究系统性地对比了多种 KV-Cache 压缩技术在不同模型、任务、预算和推理配置下的表现。研究发现,现有压缩方法在任务质量(如长上下文理解准确率)和系统性能(如吞吐量和延迟)之间存在明显权衡,且之前的研究因评估设置不同而难以直接比较。该工作为开发者选择适合自身场景的 KV-Cache 优化策略提供了统一基准。
离线强化学习学会控制LLM Agent的执行框架
该研究提出将 LLM Agent 的执行框架(harness)视为可学习的控制层,而非固定基础设施。传统方法通过修改提示词或模型来改进 Agent,而新方法使用离线强化学习优化 Agent 如何调用工具、管理状态和执行步骤。实验表明,学习控制执行流程能比仅优化 LLM 本身带来更显著的 Agent 性能提升。
GitHub Agentic Workflows:自动化跨仓库文档更新
GitHub 博客介绍了 Aspire 团队如何利用 Agentic Workflows 自动化跨仓库文档维护。当产品代码合并后,系统自动生成对应的文档变更,并创建由领域专家审核的 Pull Request。这缩短了从代码发布到文档更新之间的时间差,保持文档与代码同步。
GitHub Copilot 实现 GitHub Pages 零 DNS 配置,14分钟上线
GitHub Copilot 推出新功能,帮助用户从空仓库开始,无需手动编辑 DNS 记录,在约 14 分钟内为 GitHub Pages 配置自定义域名并启用 HTTPS。该流程通过 Copilot 自动化完成域名解析和证书部署,大幅降低了站点上线的技术门槛,尤其适合非专业运维的开发者。
Modal CTO:AI基础设施需为“代理体验”进化
Latent Space 再次对话 Modal 联合创始人兼 CTO Akshat Bubna,探讨为什么“代理体验”(Agent Experience)如今能行得通,以及 Modal 在构建新一代代理云过程中学到的经验。Bubna 指出,现有AI基础设施主要面向请求-响应模式,而代理需要更灵活的编排和状态管理。
OpenAI分析发现编程基准SWE-Bench Pro存在可靠性问题
OpenAI 发布分析报告,指出流行的 AI 编码能力基准测试 SWE-Bench Pro 存在信号噪声问题。报告显示,该基准可能无法准确反映模型在真实编程任务中的表现,部分评估指标存在偏差和可重复性差的问题。这一发现引发对当前 AI 编程评估方法可靠性的讨论。
OpenAI公布政府与国家安全合作原则
OpenAI 发布博客,阐述其与政府和国家安全机构合作的方式。内容围绕负责任 AI 使用、民主问责制和公共安全三项原则展开,旨在明确其在敏感领域的合作边界和伦理准则。后续将有更多具体案例和操作细则公布。
OpenAI联合基金会为K-12教师提供AI实操培训
OpenAI Academy 与 Walton Family Foundation 合作推出 AI Skills Jams,为 K-12 教师提供动手实操的 AI 技能培训。项目旨在帮助教育工作者掌握将 AI 工具有效融入课堂教学的实用方法,而非单纯的理论讲解。培训将覆盖基础 AI 概念、课堂应用场景及伦理问题。
Kenton Varda 禁止团队使用 AI 写代码变更说明
Kenton Varda 宣布在其团队中禁止使用 AI 撰写代码变更描述(如 PR 和提交信息)。他认为 AI 生成了大量描述代码细节的文本,但对审阅者毫无帮助,甚至比不写更糟糕。这一决定反映了对 AI 辅助开发工具在文档质量方面的反思。
GitHub 6月可用性报告:发生6起降级事件
GitHub 发布 2026 年 6 月可用性报告。当月共发生 6 起导致服务性能降级的事件。报告详细列出了每次事件的影响范围、持续时间以及后续改进措施。具体细节可在 GitHub Blog 上查看完整报告。