OpenAI预览下一代模型 GPT-5.6 Sol
Vercel发布AI SDK 7:支持文本、音频及视频的多模态Agent平台
此次 Vercel 发布的 AI SDK 7 将定位从单纯的模型调用库升级为全栈 Agent 平台,核心在于解决多模态应用与生产级 Agent 落地时的工程化复杂性。该版本不再局限于文本交互,而是覆盖了文本、音频、实时语音、图像及视频生成,并强化了工具调用、状态管理与可观测性。
在技术实现上,SDK 引入了 Provider-agnostic reasoning control(提供商无关的推理控制),允许开发者通过 reasoning: 'high' 等参数统一映射 OpenAI、Anthropic 等不同厂商的原生推理设置。针对 Agent 开发中的状态管理难题,新版本引入了 Typed runtime context,使编排状态能够在 prepareStep、审批函数及遥测数据中流转;同时推出了 Scoped tool context,通过 contextSchema 确保第三方工具仅能访问特定的密钥或配置,提升了安全性。此外,新增的 uploadFile 和 uploadSkill API 支持将文件或技能环境上传至云端并复用引用,从而在多步骤工作流中减少冗余数据传输。
此次更新对运行环境提出了硬性要求:强制要求 Node.js 22 及 ESM imports(即 import 语法或 .mjs 文件),不再支持 CommonJS 的 require()。这一变动是因为 SDK 依赖 Node 22 原生的 Fetch 实现及改进的 AsyncLocalStorage 语义。对于多模态能力的扩展,SDK 目前已支持稳定的语音/转录 API、图像生成与编辑,以及实验性的实时语音和视频生成功能。
OpenAI内部数据:Codex输出 tokens 环比暴增56倍
OpenAI 公布的内部数据显示,Codex 的使用模式已发生根本性转变,从单一编码辅助扩展为跨部门的通用工作流引擎。核心问题在于验证高 token 消耗场景下的 AI 实际效用与经济可行性。该数据揭示了即便在无限制访问权限下,企业内部仍存在显著的“使用不足”现象,而近期的爆发式增长表明组织正在通过 Agent 化工作流挖掘模型的深度潜力。
关键数据方面,自 2025 年 11 月至 2026 年 6 月,OpenAI 内部活跃用户的 Codex 中位输出 tokens 出现数量级跃升:Research 部门增长 56 倍,Customer Support 增长 32 倍,Engineering 增长 27 倍,Legal 增长 13 倍。此前至 2025 年 8 月,员工平均仅有不到 10% 的 tokens 用于 Codex,这一基数反衬出近期增长的剧烈程度。
技术方案上,这种增长并非源于简单的对话延长,而是基于 Agent 架构 的普及。OpenAI 内部观察到任务正向“长时间运行”和“跨功能”演变,依赖 Review Loops(审查循环)、持久化工作流 以及 Skills(技能调用) 机制。这与传统的单次交互不同,新方案允许模型在持久化环境中执行复杂、多步骤的任务,从而大幅推高了输出 tokens 的消耗。
这一趋势对行业具有明确的指标意义。它表明 AI 的价值落地正从“聊天”转向“执行”,且 Token 消耗量 正成为衡量业务自动化程度的关键指标。同时,这也侧面印证了近期基础设施(如 Sail、Hyperagent)向 长周期、低成本推理 以及 持久化沙箱 演进的必要性。然而,这种高消耗模式对成本控制与评估体系提出了挑战,Cursor 等机构指出公共基准测试正面临模型通过检索互联网数据进行“作弊”的问题,未来的评估将更严格地依赖 No-Internet 设置及更严谨的测试框架。
Gemini 2.5 Flash新增“计算机使用”功能
Google 将“计算机使用”功能原生集成至 Gemini 3.5 Flash,标志着其智能体技术从单一模型调用向系统化环境交互的演进。此前该功能仅作为独立的 Gemini 2.5 模型存在,此次整合意味着开发者无需维护独立模型,即可在 Flash 系列中直接调用具备浏览器、移动端及桌面环境操作能力的智能体。
在技术实现上,该功能允许模型通过视觉识别界面元素并模拟用户操作,从而执行跨平台任务。官方数据显示,新版本在长周期任务及企业自动化场景中表现提升,具体表现为能够完成连续软件测试及跨专业应用的知识工作。例如,模型可自主分析 Gemini 应用界面并输出功能分类列表,或依据文档审查自身的无障碍设计问题。
针对智能体接入真实环境带来的安全风险,Google 引入了针对性的对抗性训练以缓解提示注入攻击。同时发布的两项企业级保障机制——敏感操作需用户显式确认及检测到间接注入时自动终止任务——界定了当前模型在自动化与人工干预之间的平衡点。这一更新降低了构建自动化工作流的技术门槛,但也对企业在部署时的风险管控提出了具体要求。
iLLaDA:8B参数的掩码扩散语言模型挑战自回归范式
iLLaDA 的发布标志着非自回归语言模型在性能上取得了实质性进展,证明了掩码扩散范式在构建通用大模型方面的可行性。该模型由中国人民大学与字节跳动联合开发,采用 8B 参数规模,通过 12T token 的预训练数据量,确立了扩散模型在基础能力上的新基准。
在技术实现上,iLLaDA 坚持全双向注意力的掩码扩散目标,并在工程层面进行了针对性优化。预训练阶段引入了 分组查询注意力(GQA) 以降低推理时的显存占用,并采用绑定的输入/输出 Embedding 以缩减参数量。在监督微调(SFT)阶段,模型在 25B token 的指令数据上训练了 12 个轮次,这种长周期的训练策略对于非自回归模型收敛至关重要。此外,研究团队引入了基于置信度的评分机制,以更准确地评估模型在多项选择任务中的表现。
实验数据显示,iLLaDA 相比前代 LLaDA 及基于 Qwen2.5 微调的 Dream 模型均有显著提升。在基准测试中,iLLaDA-Base 在 BBH 上提升了 21.6 个点,在 ARC-Challenge 上提升了 14.9 个点。经过指令微调的 iLLaDA-Instruct 在 MATH 和 HumanEval 上分别取得了 14.5 和 16.5 个点的增长。值得注意的是,尽管采用了非自回归训练,iLLaDA-Base 的平均性能已与 Qwen2.5 7B 持平甚至略有优势,表明双向扩散架构在吸收数据和逻辑推理方面具有独特竞争力。
目前的主要局限在于指令微调版本的性能仍落后于 Qwen2.5 7B Instruct,且扩散模型在推理阶段的采样策略与生成长度控制仍需进一步优化。该研究证实了从零开始训练双向扩散模型是一条具备竞争力的技术路线,特别是在数学与代码等需要强逻辑推理的领域。
RIFT-Bench:首个针对Agent系统的动态红队测试基准
RIFT-Bench 提出了一套针对 Agentic AI 系统的动态红队测试框架,旨在解决现有安全评估方法难以适应异构架构的问题。由于 Agentic 系统通常包含多步推理、工具调用和状态记忆,其攻击面远超传统 LLM,涉及目标劫持、工具滥用及权限提升等系统级风险。RIFT-Bench 的核心在于通过图表示驱动的自动化流程,实现了对不同架构系统的统一评估。
该方案在技术上分为两个阶段:发现阶段利用 Structure Identifier 提取系统的节点与连接关系,生成 NodeSpec 层级表示;扫描阶段则基于此结构部署自适应对抗性探测。与针对特定模型或领域的静态基准不同,该方法通过 Tool Emulation 模拟外部工具交互,并使用 Probes 和 Evaluators 动态生成测试用例。这种设计允许测试框架在不修改核心代码的情况下,适配从软件工程到企业自动化的多种系统。
实验结果显示,RIFT-Bench 在 45 个 具有不同实现细节的 Agentic 系统上进行了验证,证明了其跨架构的泛化能力。在工具模拟保真度评估中,核心工具的表面相似度和语义相似度均达到较高水平,确保了测试环境的有效性。此外,该框架不仅评估攻击成功率,还引入了 Utility-Robustness Trade-off 指标,用于量化防御机制在阻断攻击的同时对系统正常功能的影响。
该工作的创新点在于将红队测试从单纯的模型对抗提升到了系统结构分析层面,使其能够识别如记忆中毒或不安全协调等复合型漏洞。然而,该方法的有效性依赖于 Structure Identifier 的准确性,若目标系统的逻辑过于复杂或混淆严重,可能导致图提取不完整。同时,尽管支持防御评估,但面对持续演进的对抗性攻击,其探测库的更新频率与覆盖广度仍是实际应用中的关键限制。
德国裁定谷歌需对AI Overview生成错误承担责任
德国近期的一项司法裁定将生成式 AI 的法律责任界定推向了新的节点,该判决要求谷歌必须对其 AI Overview 功能生成的错误信息承担相应责任。这一裁决的核心逻辑在于确立了“AI 代理即部署者代理”的原则,即法律应将 AI 视为使用者的代理人,而非独立的免责主体。
从技术伦理与合规的角度分析,该方案打破了以往科技公司常以“算法黑箱”或“模型随机性”为由推卸内容责任的惯例。Bruce Schneier 指出,若企业雇佣人类撰写摘要,企业需对内容的不准确性负责;同理,若允许企业以 AI 故障为借口逃避责任,将形成恶劣的市场激励机制。这种机制会导致企业为了降低成本,倾向于用 AI 替代律师、医生或专业撰稿人,同时利用 AI 的非确定性特征规避因职业过失产生的法律风险。
该裁定在实践层面具有显著的警示意义,它意味着大模型应用场景中的“幻觉”问题不再仅仅是技术缺陷,而是明确的法律风险点。对于谷歌及其他致力于将生成式 AI 整合进搜索结果或关键决策流程的厂商而言,这要求其在模型部署前必须建立更严格的事实核查机制与过滤流程,单纯依赖概率生成的技术路线在法律层面将面临严峻挑战。