Gemini 2.5 Flash新增“计算机使用”功能
Gemini 2.5 Flash新增“计算机使用”功能
Google DeepMind在Gemini 2.5 Flash模型中发布了“计算机使用”(Computer Use)功能。该功能允许模型直接操作用户的图形界面(如点击、打字),自主完成浏览器或桌面端的复杂任务,向Agent化交互迈进一步。
OpenAI与博通联合推出Jalapeño推理芯片
OpenAI与芯片设计公司博通合作,推出了代号为“Jalapeño”的定制AI推理芯片。该芯片专为大型语言模型(LLM)推理优化,旨在提升AI系统的性能、能效和扩展规模,以降低模型运行成本。
Claude发布Slack机器人:支持多人协作与长记忆
Claude推出Slack应用更新,支持多人协作(Multiplayer)和长记忆(Persistent)功能。新版本允许Agent在群聊中主动响应(Proactive)并保持长期上下文,使其能作为团队成员处理跨时间线的复杂协作任务。
VeryTrace:通过可编译形式验证LLM推理链
新研究提出VeryTrace框架,用于解决思维链(CoT)推理中的逻辑错误传播问题。该方法将自然语言推理步骤转换为可编译的形式化逻辑,并利用结构化验证机制捕捉幻觉或逻辑谬误,显著提升了多步推理的可靠性。
SGPO:通过策略引导优化提升LLM推理能力
新论文提出策略引导策略优化(SGPO)方法,解决强模型向弱模型蒸馏时只模仿结果而不模仿过程的问题。该方法鼓励模型学习“如何推理”而非死记硬背答案轨迹,显著提升了LLM的泛化推理能力。
SRT微调:可修复并预防大模型突发性错位
研究提出自识别微调(SRT)方案,证实大模型的突发性错位是由激活错误的人格向量导致的,而非直接学习有害内容。SRT通过微调让模型学会识别并拒绝偏离其核心价值观的指令。实验表明,该方法不仅能预防模型越狱,还能逆转已发生的错位行为。
RIFT-Bench:首个针对Agent系统的动态红队测试基准
研究团队发布了 RIFT-Bench,专门用于测试基于 LLM 的自主 Agent 系统的安全性。与传统静态测试不同,该基准通过动态对抗攻击模拟复杂交互环境,揭示 Agent 在多步骤决策中的漏洞。测试结果表明,现有 Agent 系统在面临诱导性输入时极易被攻击。
Neuro-Symbolic Drive:通过规则锚定提升自动驾驶模型推理准确性
针对自动驾驶 VLA 模型推理缺乏可解释性的问题,研究提出了神经符号驱动方案。该方案利用符号规则作为逻辑锚点,强制模型的思维链遵循物理定律和交通规则。测试显示,该方法有效减少了幻觉和逻辑跳跃,提升了复杂场景下的决策可靠性。
Spec Learning:无需训练的推理阶段对齐新方案
研究提出了 Spec Learning 方案,允许在推理阶段直接对齐模型行为,无需重新训练模型权重。该方法通过从偏好对中提炼特征,动态调整模型输出,解决了传统微调成本高、易出错的问题。实验显示,该方法能显著提升模型遵循复杂指令的准确率。
Simon Willison将浏览器兼容数据库转为SQLite格式
受Mozilla新MDN MCP服务启发,开发者Simon Willison将庞大的MDN浏览器兼容性数据仓库转换为SQLite数据库。他利用Claude Code for web(Opus 4.8)生成了转换脚本,该项目已作为开源工具发布,方便开发者直接查询浏览器支持数据。
RubyLLM发布:统一主流AI提供商的Ruby开发框架
RubyLLM 发布了全新的开发框架,旨在让 Ruby 开发者能够轻松接入 OpenAI、Anthropic、Google 等主流大模型。该框架封装了不同供应商的 API 差异,提供统一的调用接口,开发者无需为每个模型单独编写适配代码。此举填补了 Ruby 在 AI 生态中的工具空白。
Databricks创始人谈前沿模型生态:必须开放
Databricks联合创始人Matei Zaharia和Reynold Xin接受采访,讨论前沿模型生态的开放性。他们认为每家公司都需要构建“Agent Clouds”(智能体云),并强调技术透明度对于防止供应商锁定和促进企业级AI创新至关重要。
大模型实验室开始聘请哲学家
OpenAI、Anthropic等前沿AI实验室正在增加对哲学家的招聘。随着模型推理能力逼近AGI,行业面临“对齐”与“价值对齐”等伦理难题。哲学家被引入团队以帮助界定模型意图边界,解决AI训练中的概念模糊性。
LinkedIn创始人霍曼德评马斯克:xAI是'完全的火车残骸',SpaceX非AI公司
LinkedIn联合创始人里德·霍曼德在采访中批评埃隆·马斯克创办的 xAI 是一场’完全的火车残骸’,并质疑其战略方向。同时,他明确区分了公司属性,认为 SpaceX 属于制造业和工程领域,并非 AI 公司。霍曼德还讨论了 Anthropic 与 OpenAI 的竞争格局。
评论:开源AI是全球大多数地区的唯一出路
Techstrong分析文章指出,受限于数据主权和合规要求,闭源商业AI模型无法覆盖全球大部分地区。开源模型允许企业在本地部署和微调,避免数据跨境传输,是除少数发达国家外全球AI应用落地的现实选择。
Jason Pargin专栏:为何大众对AI的理解几乎都是错的
作家 Jason Pargin 发布深度专栏,反驳了关于AGI时间表、AI威胁论及经济影响的主流观点。他指出媒体和公众倾向于用科幻电影的逻辑去理解技术,从而产生了不切实际的恐慌或期待。文章呼吁回归现实,关注AI当前的实际能力而非假设性未来。
开发者吐槽:招聘全靠LLM生成的假申请
开发者Simon Willison指出,近几个月收到的求职申请中,出现大量由LLM生成的作品集、GitHub项目和提交记录。这些“虚假繁荣”的履历掩盖了申请者的真实能力,增加了筛选合格候选人的难度。