arrow_back返回日报
2026.09.25DAILY REPORT

Klaviyo在Vercel上两周内上线356个内部应用,512名开发者参与

18 条·2026.09.25
01 / 资讯2026.09.24 12:00

Klaviyo在Vercel上两周内上线356个内部应用,512名开发者参与

Klaviyo基于Vercel搭建了一套内部应用开发平台,512名开发者参与,两周内上线356个应用。每个应用默认需要SSO认证且为私有,开发者从想法到应用上线只需3分钟。Klaviyo是一家服务超过20万品牌的B2C CRM公司,业务覆盖营销、客服、AI代理和数据处理。该平台大幅压缩了内部工具的交付周期,让非专业开发人员也能快速构建和发布应用。

02 / 研究2026.09.24 12:00

Agent重复任务表现不一致:同一任务跑三次,38%到74%的结果对不上

一项研究对42个任务各运行三次,发现根据模型不同,38%到74%的回答不一致。研究指出,一致性是买家、审计方和监管机构的基本要求,而当前Agent并不具备。论文提出技能应形成习惯,以提升重复任务中的稳定性。这一问题直接影响Agent在需要可重复、可审计结果的场景中的可用性,比如合规审查和自动化运维。

032026.09.24 12:00

思维链是装饰还是承重?任务难度决定CoT对答案的因果约束力

一项研究提出基于续写的因果测试方法,通过消融补丁干预来扰动单个推理步骤、截断推理链并强制输出,以检验思维链监控是否真正有效。研究发现,思维链只有在其书面推理对答案产生因果约束时,监控才有意义,而这种约束力受任务难度影响。该结果提示,CoT监控在简单任务上可能只是装饰,在困难任务上才真正承重。

042026.09.24 12:00

Terminal-Bench任务为何难?研究区分真实难度与伪难度

前沿基准需要当前模型无法解决的任务,但无人能解的任务不一定真的难。研究指出,同样的零通过率可能来自真实能力缺口,也可能来自缺失上下文或损坏的参考实现。作者构建了一个经过裁决的Agent语料库,用以区分真实难度与伪难度。这一工作有助于基准设计者剔除无效难题,让评测结果更准确反映模型的实际能力。

052026.09.24 12:00

让推理模型少说废话:冗余感知学习压缩推理链长度

大型推理模型常生成正确但过长的推理链。现有方法通过轨迹级目标或局部的token和步骤级信号提升效率,但很少建模步骤之间的语义依赖。该研究提出冗余感知学习方法,针对步骤间的语义冗余进行优化。效果是推理链更短,同时保持答案正确性。对实际部署而言,这意味着更低的推理成本和更快的响应速度。

062026.09.24 12:00

COMED:多LLM推理中路由与协作之间的空白地带

arXiv发表论文COMED,针对多LLM推理系统提出新方案。现有系统要么在多个模型间进行路由选择,要么将多个模型的输出进行密集协作组合。但路由在选定初始模型后就停止,而密集协作则计算成本过高。COMED试图填补两者之间的空白,提供一种介于路由和协作之间的中间方案。对构建多模型推理系统的开发者而言,该方法可能在成本和效果之间提供更优的平衡点。

072026.09.24 12:00

大规模推理的上下文表示:从海量异构来源中抽取关键信息

科学、医学、法律和金融等领域的复杂任务,常需要整合分散在远超模型上下文限制的海量异构来源中的相互依赖信息。现有方法试图应对这一挑战,但该研究提出有原则的上下文表示方法。核心思路是识别并保留真正重要的信息,而不是简单堆叠上下文。对需要跨文档推理的专业场景,这一方法有望提升准确率并降低无效上下文带来的干扰。

08 / 工具2026.09.25 02:26

GitHub Security Lab推出AI驱动的模糊测试Taskflow Agent

GitHub Security Lab发布了一篇博客,介绍如何使用基于其Taskflow Agent AI框架的新模糊测试任务流。该框架将AI能力引入安全测试流程,帮助开发者自动化发现代码漏洞。博客详细说明了配置和使用方法,面向希望将AI集成到安全测试工作流中的开发者。实际影响是安全团队可以借助该Agent降低模糊测试的门槛,更快地在代码库中定位潜在漏洞。

09 / 资讯2026.09.24 15:00

Vercel漏洞赏金计划正式公开,HackerOne数千名研究员参与加固安全

Vercel宣布其漏洞赏金计划从私有模式转为公开。该计划于2022年通过HackerOne平台以私有形式启动,运行数年间与HackerOne的VIP项目合作,持续优化流程、目标和范围,引入了数千名顶尖安全研究员,帮助Vercel加固了整个平台的安全。此前积累的经验现已转化为公开项目,任何安全研究员都可以参与提交漏洞。对开发者而言,这意味着Vercel平台的安全性将获得更广泛的社区审查和监督。

102026.09.24 16:12

Meta Connect 2026:Muse眼镜、语音、视频与Charm亮相

Meta在Connect 2026大会上发布了多款新品,包括Muse智能眼镜,以及围绕语音、视频和名为Charm的新功能。Latent Space评价扎克伯格团队此次表现极为亮眼。目前公开信息以产品发布为主,具体技术参数和售价尚未在摘要中披露。此次发布延续了Meta在AI硬件与多模态交互上的布局,智能眼镜和语音视频能力的组合可能影响消费级AI设备的竞争格局。

11 / 发布2026.09.25 00:20

Google发布Gemini 3.8 Live,新增实时虚拟形象功能

Google DeepMind发布Gemini 3.8 Live版本,新增Live Avatar功能。用户现在可以在实时交互中使用虚拟形象进行对话。目前官方博客未提供更多技术细节或性能数据。对开发者和用户而言,这意味着Gemini的实时交互能力从纯文本/语音扩展到了视觉化的虚拟形象呈现。

122026.09.25 02:38

Claude Code v2.1.282发布:新增maxProseWidth设置和遥测配置提示

Claude Code发布v2.1.282版本。新增maxProseWidth设置,在宽终端中限制Claude正文的显示宽度,同时表格和代码块保持全宽显示。此外新增启动通知,并在/status和claude doctor中列出项目设置文件里被忽略或触发的遥测变量。对在宽屏终端中使用Claude Code的开发者而言,maxProseWidth可以改善长文本的可读性,遥测提示则帮助排查配置问题。

132026.09.25 03:15

Datasette 1.0a41发布:新增OpenTelemetry支持,模态对话框重构为Web Component

Datasette发布1.0a41版本。Alec Garcia为该版本添加了OpenTelemetry支持。Simon Willison将所有模态对话框重构为单一Web Component,并已编写文档供其他插件使用。该版本涉及JavaScript、Web Components等标签。对插件开发者而言,新的对话框组件可以直接复用,降低了自定义UI的开发成本;OpenTelemetry支持则让生产环境的可观测性更容易接入。

142026.09.25 04:06

commit-rewriter 0.2发布:支持非默认分支重写

Simon Willison发布commit-rewriter 0.2版本。此次更新的核心变化是支持对非默认分支进行操作,用户可以通过uvx commit-rewriter –branch other命令指定其他分支运行。此前该工具仅支持默认分支,新版本解决了多分支开发场景下的使用限制。对使用git进行多分支协作的开发者来说,现在可以用该工具重写任意分支的commit记录。

152026.09.24 21:00

openclaw 2026.9.6重新构建macOS版本,修复启动崩溃问题

openclaw发布2026.9.6版本更新。原2026.9.6 macOS构建版本在启动时崩溃(#156861),已于09:52 UTC替换为重新构建并经过公证的版本,修复了该问题(#156881)。用户可下载新DMG或从2026.9.5版本在应用内更新。如果安装了此前有问题的2026.9.6构建版本,需要重新下载修复后的版本。

16 / 观点2026.09.25 04:00

GitHub:当聊天框不够用时,Canvas是开发者需要的界面

GitHub博客发表文章探讨开发者工具中的界面设计问题。文章指出,当开发者需要比聊天框更具体、更可操作的交互方式时,Canvas类界面是更好的选择。文章讨论了聊天界面在开发场景中的局限性,以及Canvas如何提供更直观的操作体验。对开发者工具设计者而言,这篇文章提供了关于何时应该放弃聊天UI、转向更结构化界面的思考框架。

172026.09.24 23:03

科学研究的成本困局:思考变便宜了,动手却没有

Latent Space发表客座文章指出,在科学研究中,思考的成本已经大幅下降,但执行实验的成本并未同步降低。这种不对称正在悄然重塑研究公司的运作方式。文章将研究组织分为两类:类似’铸造厂’的执行型团队和类似’导航者’的探索型团队,探讨在这一成本结构变化下,不同类型研究公司如何调整自身定位和运营模式。对AI驱动的研究工具开发者而言,理解这一分化有助于找到更精准的产品切入点。

18 / 发布2026.09.25 07:53

OpenAI Codex发布rust-v0.158.0-alpha.12

OpenAI Codex发布rust-v0.158.0-alpha.12版本,此前陆续发布了0.158.0-alpha.11、0.157.0-alpha.11.1、0.158.0-alpha.10至0.158.0-alpha.7等多个alpha版本。目前发布的摘要未提供具体功能变更说明。

chat_bubble对今日内容有什么想法?