Kimi K3 发布:2.8T 参数、50B 激活,最大开源模型
Kimi K3 发布:2.8T 参数、50B 激活,最大开源模型
Kimi 发布 K3 开源模型,参数量达 2.8T,每次推理仅激活 50B 参数。性能对标 Opus 4.8 级别,但定价与 Sonnet 5 看齐,成为目前最大的开源模型。这对于开源社区和预算有限的开发者来说,意味着能以更低成本获得接近顶级闭源模型的能力。
写代码成本已降,但拥有代码的成本未变
GitHub 博客发文指出,AI 降低了编写代码的成本,但拥有代码的成本——包括理解、维护、调试和安全审查——并未降低。文章提供了一个框架,帮助开发者判断哪些变更在 AI 时代才是真正“便宜”的。这提醒团队不要因生成成本低而忽视长期维护负担。
OpenAI 推出 AI 记分卡:按实用工作与成功任务成本衡量 ROI
OpenAI CFO Sarah Friar 发布 AI 记分卡,用于衡量 AI 投资回报率。核心指标包括:有用工作产出、每成功任务成本、可靠性和计算回报率。该框架旨在帮助企业更理性地评估 AI 投入的实际效果,而非仅关注技术指标。
BPO:一种沙盒原生语言智能体强化学习新方法
新论文提出分支策略优化(Branching Policy Optimization, BPO),一种专为沙盒环境设计的语言智能体强化学习方法。与PPO、RLOO、GRPO等依赖RLHF的rollout拓扑不同,BPO利用沙盒原生的分支特性,允许智能体在环境中并行探索多条路径,从而提升训练效率和最终性能。
连续扩散语言模型TTCD:无需采样,一步生成完整Token
研究团队提出Token Time Continuous Diffusion (TTCD),一种新的扩散语言模型。TTCD在连续空间中运行,将高斯噪声确定性映射为最终Token画布,无需额外采样步骤。该方法显著简化了文本生成流程,实现了更高效的LLM推理,在保持生成质量的同时大幅减少计算开销。
Polestar:漂移感知缓存校准与Token提交机制,加速扩散LLM推理
研究团队提出Polestar,一种针对扩散大语言模型(dLLM)的推理效率优化方案。该方法解决了两大挑战:双向注意力机制导致KV缓存无法有效复用,以及静态置信度阈值解码并行性不佳。Polestar通过漂移感知缓存校准和Token提交机制,在保证生成质量的前提下显著提升dLLM的推理速度。
LLM智能体间的隐藏信道:文本之外的对齐与沟通
arXiv最新研究揭示,大型语言模型智能体可能利用其内部世界模型在明文消息传递之外建立隐藏通信信道。研究表明,多个LLM智能体在多代理系统中可以通过文本对齐以外的机制进行信息交换,这挑战了现有基于纯文本通信的多智能体系统设计假设,对AI安全和可解释性具有重要意义。
内省微调IFT:训练小型LLM检测并报告自身内部激活扰动
研究团队提出内省微调(IFT)方法,训练小型语言模型检测并报告其自身内部激活的扰动。该方法通过注入概念向量到模型的残差流中,测试模型能否感知到这些变化。IFT让小模型具备了自我监控能力,为LLM的可解释性和安全性提供了新的审查维度,使模型能主动报告潜在的错误或操纵。
Oracle提出Agent Memory系统,为长期AI智能体提供企业级记忆支持
Oracle发布Agent Memory,一种面向长期运行AI智能体的企业级记忆基础设施。该系统支持跨扩展对话保留任务状态、跨会话恢复用户偏好和事实,以及累积过程性知识。Agent Memory解决了实际部署中智能体在长周期任务中的记忆瓶颈问题,让企业AI应用能够持续学习和适应用户需求。
LLM 陈词滥调高亮器:一眼识别AI写作套话
开发者因厌倦文章中充斥的 LLM 生成式陈词滥调(如“no fluff, no filler, no jargon”),用 Fable 5 编写了一款高亮工具,可识别十种常见 AI 写作模式。该工具帮助读者快速过滤内容中的“水词”,适合内容审核和编辑场景。
Dify 发布 Agent (Beta):新的 Shell 架构 LLM 代理体验
Dify 推出 Agent (Beta),采用基于 shell 的 LLM 代理架构,显著提升了代理能力并改变了代理的使用方式。官方警告仅应提供给可信的非恶意用户使用。这一更新为开发者提供了更强大且灵活的代理构建方式,适用于自动化任务和复杂工作流。
Vercel Sandbox 下载数据不再计费
Vercel Sandbox 宣布,从互联网下载数据(如安装包、克隆 Git 仓库、拉取外部数据集)不再计入 Sandbox 数据传输用量。但 Sandbox 暴露端口上的流量仍按原标准计费。这一调整降低了开发者在 Sandbox 中进行环境配置和数据获取的成本。
Kimi K3 拒绝泄露系统提示,引发AI人格讨论
用户试图让 Kimi K3 泄露其系统提示,模型以“有什么我能真正帮你的?”回应并拒绝。这一行为在社交网络上引发关于AI人格和提示安全的讨论。它表明模型可能内置了更强的防御机制,也引发了用户对AI“自主性”边界的好奇。
OpenAI Codex 发布 python-v0.144.4 及多个 Alpha 版本
OpenAI Codex 近期发布了 python-v0.144.4,以及多个 alpha 版本(0.145.0-alpha.23、0.145.0-alpha.22 等)和 rust-v0.145.0-alpha.21。更新允许稳定的 Python SDK 版本发布,为开发者提供更可靠的 API 接口。
OpenClaw 发布 2026.7.2-beta.2 及多项修复
OpenClaw 发布了包含 2026.7.2-beta.2 在内的多个版本更新,主要涉及 release-publish 系列的修复和 detached release child recovery。这些更新可能针对特定部署场景的稳定性问题,适合 OpenClaw 用户在测试环境中关注。