GRPO、Dr. GRPO和DAPO本质是同一个数字:组标准差恒等式
GRPO、Dr. GRPO和DAPO本质是同一个数字:组标准差恒等式
最新arXiv研究揭示,GRPO、Dr. GRPO和DAPO这三种流行的大模型推理训练方法,表面上看似不同,实则都围绕同一个核心机制:组标准差(standard deviation),即模型对同一提示生成的不同回答之间的分歧程度。论文提出了统一的数学恒等式。
RareDxR1:用于罕见病诊断的自主医疗推理系统,超越人工标注
新论文提出RareDxR1,一种针对罕见病鉴别诊断的自主推理系统。该系统能从非结构化的患者症状中识别精确表型,并在广阔的搜索空间内执行复杂推理,效果超越现有AI和人工标注水平。
物理约束生成模型新方法SNAP-FM:生成结果自带守恒定律
arXiv 新论文提出 SNAP-FM,一种能在生成模型中强制遵守物理守恒定律、边界条件和非线性不变量的加速投影方法。该工作通过稀疏非线性加速投影技术,在保留生成模型可扩展性的同时,确保输出结果自动满足底层物理约束。相比传统物理信息神经网络(PINNs),SNAP-FM在多个物理模拟基准上显著提升收敛速度与精度。该技术对科学计算、工程仿真等需要物理可解释性的领域有直接应用价值。
字节跳动发布Seed2.0模型系列:专攻复杂真实世界任务
字节跳动发布Seed2.0模型系列,旨在解决复杂、真实世界任务。论文从识别用户真实需求出发,通过选择和抽象构建可靠、有前瞻性的评估体系。Seed系列是字节跳动的基础大模型家族,Seed2.0在任务复杂度、场景多样性上做了针对性优化。目前论文已公布,但未提供模型权重或API开放时间表。该工作对需要在非结构化、多步骤场景中部署AI的开发者有参考意义。
Mnemosyne:用智能体事务处理验证和修复AI生成的工作流
arXiv 新论文提出Mnemosyne,一种基于智能体的事务处理框架,用于验证和修复AI生成的工作流。LLM、求解器和智能体团队越来越多地生成工作流动作、修复和计划,但生成的动作可能语法正确却已过期、不可行、冲突或破坏触发修复的证据。Mnemosyne引入结构化验证机制,在事务层面上检测并修复这些问题。该工作对依赖AI自动生成业务流程、代码修复或实验步骤的团队有直接应用价值。
Making Failure Safe:一个可约束、可验证的智能体框架用于网页数据采集
arXiv 新论文提出一种可约束、可验证的智能体框架,用于从自然语言需求生成可靠的数据采集器。现有LLM生成网页爬虫时,常因依赖错误、选择器失效、模式不匹配和页面结构异构而不可靠。该框架通过引入约束和验证机制,在生成阶段预防常见错误,确保采集器在开放网页环境下的鲁棒性。对需要自动化数据采集的分析师和开发者有实际帮助。
Vercel首席软件官:Agent是新型软件,需要技能、沙箱和可读网站
Vercel首席软件官Andrew Qu在访谈中解释了其Agent框架eve的构建逻辑,并指出Agent需要三项新能力:技能(Skills)、沙箱(Sandboxes)和Agent可读的网站。他认为Agent将改变软件的构建和交互方式。
GitHub用秘密扫描9个月清空2万+告警:从噪音到收件箱归零
GitHub分享了如何通过秘密扫描功能,在9个月内处理了横跨1.5万个仓库的2万+条告警,达到收件箱归零。具体做法包括:区分信号与噪音、构建修复工作流、优化告警处理流程。
技能工程时代:反对“一次性”AI设计,Agent仍需人类引导
Paul Bakaus在访谈中探讨了“技能工程”概念,认为在“循环最大化”(loopmaxxing)时代,人类判断力至关重要。他反对一次性AI设计,强调Agent仍然需要人类引导和持续干预。
Geoffrey Litt:与编码Agent协作的关键是“理解才能参与”
Geoffrey Litt在AIE会议上提出“理解才能参与”(Understand to participate)的理念。他认为,面对编码Agent构建越来越大的变更,开发者需要避免被动承担工单的挑战,而是主动理解Agent的工作逻辑才能实现有效协作。
Simon Willison发布llm-coding-agent 0.1a0:基于LLM库的简单编码Agent
Simon Willison发布了llm-coding-agent 0.1a0版本。该项目是Fable 5实验的一部分,基于其LLM库(已演化为Agent框架)构建了一个简单的编码Agent。库已开源在GitHub上,使用python-lib-template-repository模板。
Adobe实验“自主网站”:页面根据每个访客意图自动生成
Adobe正在测试“自主网站”(agentic sites)概念,即网站页面不再由开发者预设,而是根据每位用户的意图动态生成。Carlos Sanchez在AIEWF大会上讨论了这一Web未来形态。
用DSPy评估并优化Datasette Agent的SQL系统提示词
Simon Willison尝试用DSPy框架来评估和优化Datasette Agent的SQL系统提示词。受AIE主题演讲启发,他发起了异步研究任务,探索DSPy是否帮助改善了Agent的SQL生成效果。