arrow_back返回日报
2026.07.10DAILY REPORT

OpenAI发布GPT-5.6系列:Luna、Terra、Sol三款模型定价曝光

20 ·2026.07.10
01 / 发布2026.07.10 03:46

OpenAI发布GPT-5.6系列:Luna、Terra、Sol三款模型定价曝光

OpenAI今日正式发布GPT-5.6系列旗舰模型,分为三个规格:Luna(最小)、Terra(中等)和Sol(最大)。定价按每百万输入/输出tokens计算,Luna为1美元/6美元,Terra为2.50美元/15美元,Sol为5美元/30美元。相比之下,Claude Opus系列定价为5美元/25美元。

022026.07.09 18:00

ChatGPT升级为“Work”智能体:可直接操作应用和文件,持续工作数小时

OpenAI宣布ChatGPT升级为“ChatGPT Work”智能体。该智能体能够跨应用和文件执行操作,支持长达数小时的持续项目工作,直接将一个目标转化为完成的作品。用户无需手动切换工具即可完成复杂任务。

032026.07.09 14:05

SpaceXAI发布Grok 4.5,收购Cursor后首个Opus级模型

SpaceXAI发布Grok 4.5,这是该公司收购Cursor后推出的首个Opus级别模型。新模型在推理能力、代码生成和长文本处理方面均有显著提升,被视为当前前沿实验室中迭代速度最快的产品之一。

042026.07.09 18:00

OpenAI发布GPT-5.6:每token更智能,性能价格比更高

OpenAI正式发布GPT-5.6,称其为“可随用户雄心扩展的前沿智能”。新模型提供更强的每token智能、更高的性能价格比,以及按需调用的更多计算能力,适用于最艰巨的工作任务。

052026.07.10 00:24

Meta发布Muse Spark 1.1:首个提供API的Spark模型,工具调用能力大幅提升

Meta发布了Muse Spark 1.1,这是首个提供API接口的Spark系列模型。相比4月发布的初版,新版本在智能体工具调用和计算机使用能力上有了显著改进。开发者现可通过API直接调用该模型,具体性能数据详见官方评估报告。

062026.07.09 21:00

GPT-5.6成为微软365 Copilot默认模型

微软宣布GPT-5.6已正式成为Microsoft 365 Copilot的首选模型。新模型将增强Word、Excel、PowerPoint、Chat和Cowork等组件的AI能力,为用户提供更快、更高质量的办公体验。这一集成标志着OpenAI旗舰模型在企业级生产力工具中的深度落地。

07 / 观点2026.07.10 04:51

Elo:为5岁儿童构建实时AI家教

Elo公司分享了为5岁儿童构建实时AI家教的经验。核心挑战是响应时间必须在1000毫秒以内,以保持幼儿注意力。文章详细介绍了如何在低延迟条件下实现个性化教学,这对儿童教育类AI产品有重要参考价值。

08 / 研究2026.07.09 12:00

TriRoute:统一学习路由实现自适应注意力、专家和KV缓存分配

新论文提出TriRoute,一种统一的基于学习的路由方法,可同时实现自适应注意力、混合专家(MoE)和KV缓存分配。与单独的MoE(稀疏化FFN)或MoD(跳过transformer块)不同,TriRoute在同一框架内协调多个条件计算维度,有望进一步降低推理成本。

092026.07.09 12:00

AgentLens:用生产环境数据评估编程智能体的新基准

研究人员提出AgentLens,一个基于生产环境评估的交互式编程智能体基准。传统评测只记录任务是否通过,但AgentLens关注整个执行轨迹(包括中间步骤和错误),更贴近真实用户对智能体的使用体验。

102026.07.09 12:00

低成本智能体在ARC-AGI-1推理任务上取得新突破

一篇新研究提出一种成本高效的智能体框架,在ARC-AGI-1抽象推理与泛化基准上取得进展。传统方法要么消耗大量测试时算力(如穷举采样),要么依赖基准特定训练。该工作探索了一条更经济的中间路径。

112026.07.09 12:00

LLM智能体如何自我进化?从原子操作到标准操作流程的迭代工具优化

arXiv 上发布了一项新研究,提出了一种让 LLM 智能体通过迭代工具优化来自我进化的方法。该框架允许智能体从执行单个原子操作(如文件读写)逐步升级为执行标准操作流程(SOP),从而更高效地完成复杂任务。实验表明,这种自进化机制能显著提升智能体在多种任务上的表现,减少对人类预设流程的依赖。

122026.07.09 12:00

MILES:模块化指令记忆让LLM在推理中持续自我改进

arXiv 上新研究提出 MILES 框架,通过模块化指令记忆和可学习选择机制,让大语言模型在连续处理问题时积累并复用经验。与传统孤立处理每个问题的方式不同,MILES 允许模型自动选择有用的经验用于新问题推理,实现边推理边自我提升。实验显示该方法在多个推理基准上取得了显著效果。

132026.07.09 12:00

LLM会“纠正”非裔美国人英语:激活引导技术可减少方言偏见

arXiv 新研究发现,多款主流大语言模型(14B至70B参数)在理解非裔美国人英语(AAE)时,会系统性地将其“纠正”为标准英语,造成信息误读和方言歧视。研究团队提出了一种基于激活引导(Activation Steering)的干预方法,能在不影响整体性能的情况下,有效减少模型对AAE的偏见。该研究关注AI公平性,对服务多元用户群体的开发者具有参考价值。

14 / 观点2026.07.09 22:50

Mozilla AI:AI下一波浪潮拼的是基础设施,而非模型本身

Mozilla AI 发布博客文章指出,AI 的发展重心正从模型本身转向基础设施。文章认为,控制层(数据管道、监控、安全护栏等)将成为决定 AI 系统能否落地的关键,而不仅仅是追求模型参数和性能的提升。这一观点提醒开发者和企业,在追逐最新大模型的同时,需重视支撑系统稳定、可靠运行的基础设施建设。

152026.07.09 23:50

AI内容充斥社交平台,LinkedIn尤其严重

一篇分析文章指出,由AI生成的内容正在泛滥于社交媒体平台,其中LinkedIn尤为严重。文章探讨了这种现象对用户信任和平台生态的影响,在Hacker News上获得175分和154条评论。

16 / 资讯2026.07.09 22:42

DeepSeek计划自研AI芯片,剑指算力自主

据Proactive Investors报道,AI初创公司DeepSeek正计划自研AI芯片。这一举措旨在减少对外部供应商(如NVIDIA)的依赖,提升自身算力自主性。如果成功,DeepSeek将能为其大模型训练和推理定制更高效的硬件方案,同时可能对现有芯片市场格局产生影响。

172026.07.09 18:00

OpenAI启动GPT-5.5生物漏洞赏金计划

OpenAI宣布启动GPT-5.5生物漏洞赏金计划(Bio Bounty)。该计划旨在鼓励研究人员发现并报告模型在生物安全方面的潜在漏洞,具体奖励细节和参与方式已公布在OpenAI官网。

18 / 观点2026.07.10 00:29

GitHub:45天内为14000+仓库建立明确归属

GitHub清理了超过14000个仓库的所有权问题。此前不到一半的仓库有明确归属。团队在45天内为每个活跃仓库分配了验证过的所有者,并将剩余仓库归档。这一举措成为后续平台管理的基础。

19 / 发布2026.07.09 22:06

Dify发布v1.16.0-rc1:引入实验性Agent新体验

Dify发布v1.16.0-rc1版本,引入实验性Agent功能。新特性基于shell的LLM agent范式,大幅提升了agent能力。官方警告称该功能仅限用于受信任的非恶意用户。

202026.07.10 00:12

llm-meta-ai 0.1发布:让LLM工具支持Muse Spark 1.1模型

Simon Willison发布了llm-meta-ai 0.1版本,该插件允许用户通过他的LLM命令行工具调用Meta新发布的Muse Spark 1.1模型。开发者可使用熟悉的LLM接口运行针对该模型的提示词。

chat_bubble对今日内容有什么想法?