Meta发布Muse Glimmer:30B开源模型,Apache 2.0许可
Meta发布Muse Glimmer:30B开源模型,Apache 2.0许可
Meta 发布全新 30B 参数模型 Muse Glimmer,采用 Apache 2.0 开源许可,比以往 Llama 系列的许可更宽松。该模型针对端到端 Agentic 任务进行了优化,Simon Willison 评论称其正是本地模型用户所需:无需复杂的许可限制即可自由使用和修改。这标志着 Meta 在开源权重模型领域的回归。
EntropyMoE:免分词器大模型的新稀疏路由方案
EntropyMoE 论文提出一种适用于免分词器大模型的熵感知稀疏专家路由方法。现有字节级 LLM 通过动态分组的字节补丁替代了传统分词器,但在前馈计算中仍采用密集计算。EntropyMoE 根据熵(信息不确定性)动态路由,只激活必要的专家(MoE 模块),减少计算量。实验表明,该方法在保持性能的同时显著降低了推理成本,为构建更高效的免分词器大模型提供了新思路。
新方法把虚假信息检测变成几何属性:激活工程可识别谎言
arXiv 上发布的一项新研究将真假陈述视为模型内部激活的几何属性。团队通过激活工程而非依赖表层语言特征或外部知识检索来检测虚假信息,为大规模事实核查提供了新思路,可能降低对检索系统的依赖。
OpenAI发布GPT-5.6-Cyber,面向授权漏洞研究的专用模型
OpenAI 宣布推出网络安全专用模型 GPT-5.6-Cyber,可通过 Daybreak Red 平台供授权研究人员使用,用于漏洞研究、漏洞验证和安全测试。该模型是 OpenAI 扩展 Daybreak 作为网络防御窗口计划的一部分。
GitHub发布Copilot SDK for Java:用原生代码驱动AI编程
GitHub 发布了 Copilot SDK for Java,让企业 Java 开发者可以直接用惯用的 Java 代码(支持注解、虚拟线程等特性)驱动 GitHub Copilot。开发者无需切换语言或工具,即可在现有 Java 应用中集成 AI 编程助手。该 SDK 旨在降低 AI 编程功能在 Java 企业级项目中的接入门槛,提升开发效率。
Vercel:无网络边界的沙箱只是半个沙箱
Vercel 博客发文指出,安全运行不受信任的代码,不仅需要将其与主机隔离,还必须控制代码能访问的网络资源。随着 AI 智能体能够读取文件、执行命令、安装包和生成程序,这一限制愈发重要。微虚拟机可以防止代码访问主机,但若没有网络边界,恶意代码仍可能横向移动或外泄数据。文章强调,完整的沙箱方案必须同时包含计算隔离和网络隔离。
Vercel推出托管镜像,Sandbox运行环境正式退役
Vercel 今天推出 Vercel Managed Images (VMI),这是一组带版本号的开源基础镜像,可直接使用或基于其扩展。所有镜像源码均公开在 vercel/sandbox 仓库中。Managed Images 将取代现有的 Sandbox 运行环境,后者即日起弃用。从 Sandbox 镜像版本 3 开始,用户可无缝迁移至新方案。
OpenClaw创始人演示攻击健身房预订系统:API无鉴权可取消他人预约
AI 安全研究员 OpenClaw 在测试一个澳大利亚健身房预订网站时发现,其 API 没有对取消他人预订的操作做任何鉴权。他实际测试了将排队第 4 位用户提升到第 3 位,操作成功。该发现再次引发了关于 AI 代理安全性和 API 设计的讨论。
Model ML用GPT-5.6 Sol将金融分析直接生成PPT和Excel
Model ML 公司宣布,通过集成 OpenAI 的 GPT-5.6 Sol,其金融业务自动化流程已覆盖从研究和分析到生成可编辑、可追溯的 PowerPoint 演示文稿和 Excel 工作簿的完整链路。这意味着金融分析师可以直接用自然语言驱动产出最终交付物。
ADIAS:一种以任务为中心的智能体自动设计新方法
arXiv 发表的一项新研究提出 ADIAS,一种全新的智能体自动设计方法。现有方法大多以候选智能体为中心组织迭代经验,导致修复过程效率低下。ADIAS 转为以任务为中心,将跨轮经验直接对齐到具体任务目标上,从而显著提升设计效率。
平均奖励MDP稳健学习:样本复杂度达极小极大最优
一篇新论文研究了稳健平均奖励马尔可夫决策过程(MDP)的样本复杂度,提出了一种基于插件归约(plug-in reduction)的方法,在模型不确定下实现极小极大最优的学习效率。该研究为分布鲁棒MDP提供了理论保障,明确了在ε误差下需要多少样本才能学到最优稳健策略。这项成果为在医疗、金融等高风险动态决策场景中,如何更少样本地应对环境不确定性提供了理论指引。
SNI-GNN:SmartNIC辅助全图GNN训练,通信量大幅降低
全图GNN训练在多服务器集群中常因节点间嵌入通信密集而扩展性差。新系统SNI-GNN借助SmartNIC(智能网卡)在网内预测嵌入,减少节点间通信并保持精度。该方法在不牺牲模型效果的同时提升了全图训练的可扩展性。对于处理大规模图数据(如社交网络、推荐系统)的工程师来说,可以显著降低多机训练的通讯瓶颈。
分片破解LLM判断盲区:减少AI审核被对抗性利用
新研究发现,给LLM法官更多计算量并不必然让它检查更多需求;当一次调用需返回多个裁决时,部分判断会脱离证据,即使token或工具预算与专家组相同。通过分片(sharding)可缓解这些认知过载导致的失误。这个结论意味着,在AI审核、内容安全等场景中,将大任务拆成多个小任务比增加计算量更可靠,能有效降低生成内容的对抗性利用风险。
OpenAI CFO总结AI原生财务团队五大经验
OpenAI 首席财务官 Sarah Friar 撰文分享了她构建 AI 原生财务职能的五个经验,包括自动化预测、更强的内控以及衡量 AI 的投资回报率。这些内容对财务高管理解 AI 落地路径具有直接参考价值。
Stoa Markets上线二手GPU和AI服务器交易市场
YC S26 孵化公司 Stoa Markets 正式推出交易平台,买卖新旧 GPU 和 AI 服务器。三位创始人 Eren、Berat 和 Kaan 表示,GPU 是数据中心建设中的抵押品,但当前融资条款主要取决于承购方(即承诺使用算力的公司)。Stoa 希望改变这一局面,让算力资产本身成为可交易的标的。
Kinney Drugs因数百投诉撤下AI电话助手
美国连锁药店 Kinney Drugs 在接到数百起客户投诉后,撤回了其 AI 电话助手系统。具体投诉内容未披露,但公司决定暂停使用该 AI 系统。这一案例表明,不成熟的 AI 客服系统可能适得其反,损害客户体验。
Google Ads与Analytics新增AI工具,简化营销流程
Google 在 Google Ads 和 Google Analytics 中推出新的 AI 和 Agentic 功能,帮助营销人员简化工作流程。这些工具涵盖广告投放优化、受众分析、预算分配等环节,可自动完成任务并给出建议。营销人员现在可以更高效地管理广告活动,减少手动操作,专注于策略决策。
Claude更新水印机制,AI生成内容可被标记
Claude 更新了其 AI 生成内容的标记机制,以帮助用户识别文本是否由 AI 生成。新机制在生成内容中嵌入水印或元数据,使检测更加可靠。这一举措旨在提高透明度,帮助用户判断信息来源。相关讨论在 Hacker News 上引发关注,有评论质疑其检测的准确性和对合法内容的影响。
OpenAI开放前沿网络攻防模型,Daybreak合作伙伴获授权使用
OpenAI宣布,获批的Daybreak合作伙伴可使用其前沿网络攻防模型,向客户提供经过授权且受监管的网络安全服务。这意味着这些合作伙伴能在可控框架内,利用GPT等模型的攻防能力强化安全业务。对安全服务商来说,可以在不违反AI安全政策的前提下,用先进模型进行漏洞识别或防御部署。
OpenAI致信德州州长,承诺建设负责任AI基础设施
OpenAI 向德州州长 Greg Abbott 致信,承诺在德州建设可靠、透明的 AI 基础设施,并表示这将惠及德州居民。信件内容侧重于负责任的发展策略,包括数据隐私、安全性和可持续性等方面。此举反映出 AI 公司正积极与地方政府合作,以推进区域性的 AI 产业布局。