DeepSeek-V4-Flash发布:304B参数,智能体能力大增
DeepSeek-V4-Flash发布:304B参数,智能体能力大增
DeepSeek发布V4系列新模型V4-Flash-0731,拥有3040亿参数(Hugging Face上167GB)。该模型智能体能力显著增强,在Artificial Analysis排名中超越4280亿参数的MiniMax M3,以较小规模实现了出色性能。
语言模型能力涌现与回路形成遵循成核速率定律
一篇新论文提出“受驱成核速率定律”,揭示语言模型能力涌现的机制:能力形成的最后一步需要所有回路组件一次性精确对齐,任何部分正确都无济于事。该定律量化了涌现的门槛,同时解释训练中的塑性丧失现象,并提出预测回路形成时间窗口的公式。研究或帮助工程师预判模型何时获得新能力,并优化训练曲线。
4-bit量化LLM代理故障率被低估,错误预算掩盖风险
arXiv新论文指出,4-bit权重量化虽广泛声称近乎无损,但在多轮工具调用代理场景中并不成立。测试显示,在τ²-bench基准上,两个开源模型系列的密集和MoE变体均出现性能下降,错误预算掩盖了实际损害。
MCP 2.0规格发布:无状态化设计重燃开发者热情
本周二MCP 2.0(即2026-07-28版规范)正式发布,这是该项目自推出以来最大的一次变更。无状态化设计改善了协议的可扩展性和稳定性,重新点燃了Simon Willison等开发者的兴趣,并催生了mcp-explorer和datasette-mcp等新工具。
GPT-5.6降价80%,智能成本4个月降13倍
据Latent Space报道,OpenAI将GPT-5.6价格大幅下调20%-80%。得益于GPT-5.6的递归自优化能力,GPT-5.4级别的智能成本在4个月内下降了13倍。蒸馏技术的应用使得模型效率大幅提升。
GitHub实现代码搜索大小写折叠:单核45GiB/s
GitHub博客披露了其代码搜索性能优化技术:通过无分支循环和字节级算术,实现了在单核上以超过45GiB/s的速度对代码进行大小写折叠处理。该优化显著提升了代码搜索的响应速度和吞吐量。
OpenAI发布「构建富足智能」:全栈AI发展路线图
OpenAI发布新文章「构建富足智能」,阐述其全栈发展战略:从芯片、基础设施到模型和产品,旨在让先进AI更强大、更便宜、更普及。文章概述了提升AI能力、降低成本并扩大可及性的综合路径。
DeepSeek V4 Flash更新权重上线AI Gateway,评分提升25.8
DeepSeek V4 Flash已在AI Gateway上默认启用更新权重,智能体能力显著增强。在Terminal-Bench测试中,得分从4月预览版的56.9跃升至82.7,提升25.8分。现有的deepseek/deepseek-v4-flash请求将自动使用新权重,无需修改代码。
超越KV重建:为MLA草稿模型引入功能重建加速解码
arXiv新研究提出针对MLA(多头潜在注意力)架构草稿模型的功能重建方案,区别于传统KV缓存重建。该方法在推测解码中重建功能的潜在状态而非KV本身,大幅减少内存访问,提升长上下文推理吞吐量。实验显示,对解码内存受限的开放权重模型,该方法可提高解码速度和批处理效率,便于长文档处理。
自监督语义扩散让LLM像参数一样习得专业技能
arXiv新论文提出利用自监督语义扩散机制,让大语言模型像更新参数一样习得新技能。该方法在高难度开放式领域(如创意编剧)中显著提升模型表现,超越传统后训练微调。研究显示,技能可以以参数化方式内化,而非作为外部工具调用。该方向可能改变专业领域LLM微调的范式。
GuideSkill:将临床指南编译为可执行LLM智能体技能
arXiv新研究引入GuideSkill,用于临床诊断的智能体技能层。不同于LLM仅检索或记住临床指南文本,它把疾病特异性诊断规则编译成可执行的外部推理步骤,减少推理幻觉,提升诊断可解释性。该系统支持审计链路,在临床决策支持中比端到端黑盒输出更具可靠性。
TraceCoder:为代码生成提供可解释、可审计版本追踪
arXiv新研究发布TraceCoder,一种带位置键代码片段版本追踪的代码生成方法。它使每一行生成的代码都有可追溯的决策依据,并记录基准驱动修复的演化过程,支持事后审计。这解决LLM编程助手黑盒输出的痛点,增强代码可信度,尤适用于合规严格或关键任务场景的开发流程。
smevals:轻量评测套件,快速对比模型、提示词与框架
Simon Willison与Prime Radiant实验室合作推出smevals,一个轻量评测套件,用于评估和对比不同模型的性能、提示词策略及评测框架本身。它旨在快速回答“哪个模型/提示词在我的场景中表现更好”的问题。开发者可将其集成到工作流中,对候选模型和提示词进行低成本AB测试,替代手动逐条验证。
Simon Willison:开放权重模型Kimi K3已追平闭源前沿模型
Simon Willison在Oxide and Friends播客中表示,Kimi K3证明开放权重模型已能与闭源前沿模型正面竞争。他评价这是“疯狂的一周”,并讨论了意外网络安全问题。开放权重生态的崛起意味着开发者的选择从“只用闭源API”扩展为“可在本地/自托管部署顶级模型”,成本与数据隐私控制权进一步提升。
Univé借助ChatGPT Enterprise构建AI就绪员工队伍
荷兰保险公司Univé与OpenAI合作,通过ChatGPT Enterprise组合领导力、负责任治理与员工主导的创新来转型工作方式。该计划帮助员工在合规框架内安全使用AI工具,推动大规模效率提升。Univé的案例展示传统企业如何将生成式AI落地生产流程,而非停留在试点阶段。
AI Gateway新增团队与项目预算管控功能
Vercel的AI Gateway现已支持按团队或项目设置支出预算,而不仅限于API密钥。管理员可为特定范围设定美元限额,一旦超出,网关将自动停止处理新请求,直到预算重置或提高。该功能实现了对API用量的精细化成本控制。
OpenAI发布欧洲负责任AI实践报告
OpenAI发文阐述其在安全、安保、透明度和来源方面的实践,支持欧洲的负责任AI治理。随着欧盟《AI法案》的推进,这些工作将持续进行,为AI合规和监管提供行业参考。
OpenAI Codex发布0.147.0-alpha.4更新
OpenAI Codex发布0.147.0-alpha.4版本,包含0.147.0-alpha.3和0.147.0-alpha.1.1的累积更新。该版本为alpha测试版,建议开发者关注更新日志以了解变更详情。