通义千问发布3.8 Max(2.4T)和27B开源模型,主打编程与协同办公
通义千问发布3.8 Max(2.4T)和27B开源模型,主打编程与协同办公
阿里巴巴通义千问发布Qwen 3.8 Max和Qwen 3.8 27B两款开源权重模型。Max版本参数规模达2.4万亿,面向编程与协同办公场景优化;27B版本则适合资源受限环境。两款模型均开放权重,开发者可自由下载、微调和部署。Qwen系列在代码生成和多轮对话方面表现突出,此次发布进一步丰富了开源大模型生态。
ChatGPT Work解密:记忆、主动性与调度如何运作
Latent Space发布了对ChatGPT Work的内部机制重构分析,详细拆解了其记忆(Memory)、主动性(Proactivity)、调度(Scheduling)、浏览器使用(Browser Use)、插件(Plugins)、技能(Skills)和工具(Tools)如何协同工作。这份分析为开发者和AI爱好者理解这一面向十亿用户的Agent产品提供了外部视角。
LLM 0.32发布:支持推理轨迹和OpenAI Responses
Simon Willison今日发布LLM 0.32,这是该项目自启动以来最重要的一次版本更新。新版本增加了对可见推理轨迹、服务端提供商工具、全新内容寻址SQLite日志以及OpenAI Responses等新功能的支持,并引入多个新模型。开发者可利用这些新特性构建更智能、可调试的AI应用。
MiniMax-H3开源:全能多模态生成15秒带声视频
MiniMax发布全能多模态模型MiniMax-H3,支持文本、图像、音频和视频输入,并可生成最长15秒带音频的视频片段。该模型现已有Python包MiniMax-H3-MLX支持,可在Apple Silicon上运行。用户输入一段文字或图片即可快速生成短视频,适合快速原型制作、创意预览等场景。模型权重已开放,开发者可自由使用。
首份生产规模Copilot追踪报告:Agent编码工作负载特征曝光
arXiv新论文首次以生产规模数据呈现AI编码Agent的工作负载特征,涵盖GitHub Copilot、Claude Code和Codex。研究发现,这些Agent将多步LLM推理与工具执行交错进行,形成与聊天机器人截然不同的工作负载模式。研究人员对采样追踪数据进行了深入特征分析,包括推理调用频率、工具使用序列等,为优化Agent性能和系统设计提供了数据基础。
不确定性感知模拟推理:让LLM在运筹学中更可靠
arXiv新论文提出一种不确定性感知的模拟推理方法,用于提升大语言模型在运筹学任务中的表现。传统自回归生成策略短视,难以保证建模过程的连贯性。新方法通过量化不确定性,引导模型生成更合理的中间步骤,从而提升最终答案的正确性。研究者认为,该方法可帮助LLM在物流调度、资源优化等复杂决策场景中提供更可靠的解决方案。
Claude Code修复安全漏洞:隔离工作树会话防破坏命令
Claude Code发布v2.1.222版本,修复了多个安全漏洞:此前工作树隔离会话及其子代理能够对主检出目录执行破坏性git命令,现在隔离已全面应用于所有会话类型的文件编辑和Bash操作;同时修复了PreToolUse自动允许钩子在后台代理任务中绕过工具限制的问题。此次更新增强了安全性,建议用户升级。
GitHub教你一招:把巨型AI生成PR拆成有序堆栈
GitHub Blog发文介绍如何应对AI生成的大型拉取请求(PR)。工程师常遇到AI一次性生成上千行难以审查的代码,GitHub建议使用堆栈式PR结构:教导编码Agent将工作分解为清晰、有序的小PR堆栈,每个PR只包含一个逻辑单元,审阅者可以逐个合并。该方法可显著降低审查心智负担,提升代码合并速度。
强化学习新问题:奖励模型重塑支持分布,导致后续目标难以学习
一篇arXiv论文指出,带可验证奖励的在线强化学习(RLVR)在优化当前目标的同时,可能会使后续目标的成功行为变得过于稀疏而难以被采样和强化。研究者将这种现象称为“验证器诱导的支持重塑”。这意味着训练AI时,为短期目标优化可能会损害其学习长期复杂任务的能力,对RL训练策略的设计有重要启示。
DLLM-TTS:新的离散扩散语言模型,实现更快更高效的语音合成
一篇新论文提出了DLLM-TTS,一种基于块离散扩散语言模型的语音合成系统。现有系统在质量与速度间面临取舍:自回归模型音质高但速度慢且依赖大规模数据;非自回归模型速度快但质量不足。DLLM-TTS试图兼顾两者,通过创新的块级离散扩散方法提升合成速度,同时保持高清晰度,为实时或低延迟语音应用提供了新可能。
Vercel推出技能包功能,一键分享整套Agent技能
Vercel在skills.sh平台推出技能包功能,用户可将多个Agent技能打包成一个可分享的集合,通过单一URL或GitHub组织分发给团队。此前分享技能需逐个操作,现在打包后可使用统一链接快速分发,团队即可在所有项目中标准化使用同一套技能。该功能降低了Agent技能的分享和管理成本,适合团队协作场景。
Vercel部署提速33%:针对ISR页面多的应用优化
Vercel宣布,对于使用增量静态再生(ISR)的应用,部署速度提升最高33%。预渲染页面数量越多,提升越明显。ISR结合了静态生成的速度和动态渲染的灵活性,网站可在不完整重建的情况下更新内容。此次优化意味着使用ISR的大型站点可以更快地推送更新,缩短发布周期。
GitHub法务团队用Copilot CLI零代码自动化工作流
GitHub博客分享了其法务团队如何使用Copilot CLI来简化日常工作流的案例。该团队无需编写一行代码,仅通过自然语言指令构建工具,实现了流程自动化。这一案例展示了非技术团队如何借助AI编程助手解决实际业务问题,提高工作效率,为其他企业的法务、运营等非工程部门提供了可行参考。
Vercel给eve Agent装上浏览器:能点击、填表、截图
Vercel为eve Agent推出了agent-browser扩展,让它具备完整的浏览器操作能力。该扩展基于@agent-browser/eve,支持导航页面、读取内容、点击、填写表单、截图以及查看控制台和网络活动。所有操作都在Agent的运行环境内完成,无需额外配置。开发者可以借此让Agent模拟真人浏览网页,执行需要交互的复杂任务。
Nova编译器:端到端MLIR方案,加速深度学习模型映射
arXiv新论文提出Nova,一款端到端MLIR编译器,用于深度学习模型的高效编译。论文指出,深度学习模型在大规模部署时,性能高度依赖高级数学运算与底层硬件之间的映射效率。Nova通过端到端的MLIR编译流程,优化了从张量框架到物理硬件的映射过程,减少了中间转换损耗。该编译器有望提升AI模型的训练和推理效率。
新基准测试:评估AI代理工作流的组合式元路由能力
一篇arXiv论文介绍了一个可执行的基准测试,用于评估代理系统(Agent)的“组合式元路由”能力,即系统在决定如何回答问题时,如何选择和执行不同的推理与操作步骤,例如直接回答、分解请求、检索证据、执行代码、委派专家或进行验证。该基准为评估复杂AI代理的工作流决策能力提供了标准化评估方法。
AI智能体了解我的一切,成本降低80%
Ben’s Bites的一篇报道指出,新推出的AI智能体能够深度了解用户信息,同时运行成本降低了80%。该智能体通过更高效的架构设计,在提供个性化服务的同时大幅削减了API调用费用。对于依赖AI个性化推荐的开发者和企业,这意味可以用更低成本实现更高性能的用户画像分析。
OpenAI回应第三方网络安全评估事件并强化测试安全
OpenAI近日对涉及自身模型的第三方网络安全评估事件进行了说明,并公布了新的安全措施以强化AI模型测试与评估流程。这些措施旨在应对评估过程中可能出现的风险,确保模型在未经充分授权的情况下不会被滥用。OpenAI表示将继续与安全社区合作,提升评估的透明度和安全性。
谷歌发布2026年7月AI新闻:多个新模型和功能上线
谷歌AI博客发布了2026年7月的最新AI动态汇总,涵盖了多个领域的更新,包括新模型发布、产品功能改进和开发者工具升级。具体细节尚未完全披露,但谷歌表示这些更新将继续推动AI技术的实用化,为开发者和企业用户提供更强大的工具。用户可访问Google AI博客查看完整公告。
llm-anthropic 0.26发布:新增三款Claude模型和WebSearch等工具
Simon Willison发布的llm-anthropic 0.26版本随LLM 0.32带来了多项新功能:新增claude-fable-5、claude-sonnet-5、claude-opus-5三款模型;同时支持WebSearch、WebFetch、CodeExecution和AnthropicMCP等服务器端工具,可通过-T接口或Python tools=参数调用。开发者现在可以在LLM框架中直接利用这些新模型和工具能力。