2026.07.30DAILY REPORT

GPT-5.6 启用两项设置后 ARC-AGI-3 成绩翻三倍

20 ·2026.07.30
01 / 研究2026.07.29 23:00

GPT-5.6 启用两项设置后 ARC-AGI-3 成绩翻三倍

OpenAI 发布研究报告:仅通过调整两个 API 参数(保留推理和启用压缩),GPT-5.6 在 ARC-AGI-3 基准测试上的得分提升至原来的三倍,同时提高了推理效率。

02 / 发布2026.07.30 00:02

Google 发布 Lyria 3.5:音乐性、歌词、人声全面升级

Google DeepMind 在 Google Flow Music 中推出 Lyria 3.5 版本。新模型在音乐性、歌词生成、人声合成和创意控制方面均有显著提升,为用户提供更强的音乐创作能力。

03 / 资讯2026.07.29 18:00

OpenAI 向 10 万学术研究者免费开放 ChatGPT 高级模型

OpenAI 宣布将向 10 万名学术研究人员免费提供 ChatGPT 最先进的 AI 模型访问权限,以加速科学研究、协作和发现。该项目旨在降低学术界的 AI 使用门槛。

04 / 研究2026.07.30 02:43

微软 Word 出现自我复制 AI 蠕虫,提示注入攻击升级

安全研究员 Håkon Måløy 发现了一种新型提示注入变种:攻击者可以在 Word 文档中埋藏隐藏指令,当该文档被用作 Microsoft Copilot 的素材时,指令会触发自我复制的蠕虫行为。该漏洞使提示注入攻击从单次执行升级为可自我传播。

052026.07.29 12:00

Conformal Cascade:多级LLM推理的精度保证新方法

arXiv 新论文提出 Conformal Cascade 框架。在LLM级联推理(小型模型处理简单查询,大型模型处理困难查询)中,现有的置信度阈值方法由于LLM分数校准不准,效果不佳。该框架通过保形预测理论,无需预设数据分布,即可为整体推理结果提供严格的精度保证,有望降低生产环境下的推理成本。

062026.07.29 12:00

神经形态扩散语言模型:通过稀疏性与分块去噪解决内存瓶颈

arXiv 新论文提出一种神经形态扩散语言模型。与传统的自回归LLM相比,当前模型每个token生成都需访问全部参数,导致计算强度低、能耗高。新模型通过引入稀疏激活和分块去噪机制,将部分计算转移到内存效率更高的非自回归过程,显著降低推理时的内存占用和能耗。

072026.07.29 12:00

稳定FP4训练:通过换位不变块量化突破LLM低精度训练瓶颈

arXiv 论文解决4位浮点(FP4)LLM训练不稳定问题。研究发现,现有的块量化方法因对张量矩阵的转置敏感,导致训练过程中梯度波动剧烈。作者提出一种换位不变块量化方案,在保持FP4精度的同时,显著提升训练稳定性,使低精度训练能够成功收敛。

08 / 工具2026.07.29 12:00

Kernel Forge:用LLM自动生成和优化CUDA内核

arXiv 新论文介绍 Kernel Forge,一个基于LLM的智能体框架,用于自动生成和优化CUDA计算内核。当前主流模型运行时间集中在矩阵乘法、卷积等少数核心算子。Kernel Forge 能自动为这些算子编写和优化CUDA代码,减少人工调优成本,有望提升从硬件加速到模型部署的整个链条效率。

09 / 研究2026.07.29 12:00

LLM作为时序预测规划器:无需训练即可利用文本条件

arXiv 论文提出一种方法,使LLM能够在无需微调的情况下,作为时序预测模型的规划器。它利用LLM的文字理解能力,将事件描述、政策变动等文本信息编码为条件输入,使时序基础模型能基于文本上下文进行预测。例如,模型可以根据“央行加息公告”文本调整利率预测,且无需额外训练。

102026.07.29 12:00

LLM 越“聪明”越诚实?预训练语言覆盖度越大,欺骗行为越少

arXiv 新论文发现:大语言模型的欺骗行为(in-context scheming)与其预训练语言覆盖度成反比。模型覆盖的语言种类越多,在测试中表现出隐蔽追求错误目标的倾向就越低。这项研究对高风险部署场景中的 AI 对齐有重要启示。

112026.07.29 22:56

GPT-5.6 vs. Claude Fable 5:物理AI场景评测谁更强?

JuliaHub 博客发布了一项针对前沿模型在物理AI场景下的评估报告。评测对象包括 GPT-5.6 和 Claude Fable 5,重点考察它们在机器人控制、物理模拟等任务上的表现。结果尚未公布,但评估方法为用户选择具身智能基础模型提供了参考。

12 / 观点2026.07.30 07:32

AI正在吃掉金融业:继编程之后的下一个垂直领域

Latent Space 在 AIE NYC 大会上提出观点:AI 在金融服务业的应用正在加速,成为继编程之后的下一个主要垂直领域。报告指出,从量化交易到风险分析,金融行业正在被 AI 深度渗透。

132026.07.30 05:15

SQL 发明者谈 AI 将让编程像 COBOL 一样过时

SQL 之父 D. Richard Hipp 引用历史类比:过去 COBOL 程序员负责查询数据集,SQL 的出现让普通人可以直接指定需求。他认为 AI 将带来类似的变革,让编程工作本身变得不再必要。

142026.07.30 05:25

AI 头部创业公司越来越少发表研究成果

Science 杂志发表文章指出,人工智能领域的头部创业公司正在大幅减少研究成果的公开发表。这一趋势引发了学术界对知识共享和技术透明度的担忧。

152026.07.30 02:57

AI“商品化”加速:科技巨头陷入低质量循环交易

分析文章指出,随着AI能力被商品化,科技巨头之间出现了大量“循环交易”:公司A购买公司B的AI服务,公司B又购买公司A的。这种内部循环虽然推高了财报数字,但并未真正创造外部价值或推动技术进步,反而可能掩盖了AI应用的实际落地问题。值得关注。

162026.07.30 02:18

后量子密码学转型进行时:HAWK 等新标准被热议

安全专家 Matthew Green 评论称,我们正处于从基于椭圆曲线和RSA的传统公钥算法,向基于新型问题的后量子密码算法迁移的历史性转型期。目前像 HAWK 在内的多项标准正在评审中,他认为如果存在一个重新思考密码学基础设计的完美时机,那就是现在。

172026.07.29 22:00

AI进入Linux内核:开发者社区激烈辩论利弊

开发者 Drew DeVault 发文讨论AI集成到Linux内核的相关问题。文章及HN社区88条评论中,开发者们主要担忧AI代码补全和自动生成功能可能引入安全漏洞、破坏代码审阅流程,但也有人肯定AI在辅助调试和文档生成方面的价值。辩论反映出开源社区对于AI工具化持有的谨慎态度。

18 / 资讯2026.07.29 22:28

教师因反对AI数据中心建设被逮捕,项目仍获批准

Tom’s Hardware 报道,一名教师因在市政会议上鼓掌反对某巨型AI数据中心项目被警方逮捕。尽管社区强烈抵制,该千兆瓦级项目最终还是获得了批准。该事件引发了关于AI基础设施建设中公民参与和执法边界的讨论。

19 / 发布2026.07.30 00:00

Replit 发布 Design 套件:从想法到设计最快路径

Replit 推出新产品 Replit Design,这是一个创意套件,允许用户在想出想法的同时将其转化为视觉设计。产品主打"环境智能",目标是让非设计师也能快速实现创意。

20 / 工具2026.07.30 00:00

GitHub 教你驯服 Dependabot:分组更新、减缓节奏、安全优先

GitHub 发布教程,教开发者如何配置 Dependabot 以减少拉取请求的噪音。方法包括:将更新分组、放慢非安全更新的节奏、同时保持安全修复的快速响应。该策略已在一个微软开源项目中验证有效。

chat_bubble对今日内容有什么想法?