Kimi K3 发布:2.8T 参数、50B 激活,最大开源模型
Kimi K3 发布:2.8T 参数、50B 激活,最大开源模型
Moonshot AI 正式发布 Kimi K3,一个总参数量达到 2.8T、激活参数约 50B 的开源模型。该模型在发布时即被定位为“开放前沿智能”,其权重计划于 2026 年 7 月 27 日 前公开,若兑现,将成为迄今规模最大的开源权重模型。
K3 的核心技术架构围绕长上下文与训练效率展开。它支持 1M token 上下文窗口 和原生多模态输入。在注意力机制上,模型采用了自研的 Kimi Delta Attention (KDA),官方宣称可在百万 token 级上下文中实现最高 6.3 倍 的解码加速。同时引入的 Attention Residuals (AttnRes) 机制,据称能在低于 2% 额外计算开销的前提下,带来约 25% 的训练效率提升。社区从技术博客中进一步提取出架构细节,包括 LatentMoE 结构,在总共 896 个专家 中激活 16 个,激活比低于 2%;此外还涉及 per-head Muon 优化器、分位数负载均衡以及一种新的激活函数 SiTU (Sigmoid Tanh Unit)。
在基准评测中,K3 展现出与头部闭源模型竞争的实力。Artificial Analysis 的独立评估将其置于 AA 智能指数 57 分,与 Opus 4.8 和 GPT-5.5 处于同一水平,但仍落后于 Fable 5 和 GPT-5.6 Sol。在 Arena 的前端代码竞技场中,K3 以 1679 分 跃居第一,超越了 Claude Fable 5,其成对胜率达到 76%,而 Fable 5 为 63%,GPT-5.6 Sol 为 58%。在文本竞技场,K3 排名第 9,得分 1486 分。成本方面,API 定价为输入 $3/1M tokens,输出 $15/1M tokens,缓存输入可享 90% 折扣至 $0.30/1M tokens。Artificial Analysis 测算其每任务平均成本为 $0.94,低于 GPT-5.6 Sol 的 $1.04 和 Opus 4.8 的 $1.80。
Moonshot 自身在技术沟通中承认了一个关键局限:尽管整体竞争力强劲,K3 在用户体验层面与 Claude Fable 5 及 GPT-5.6 Sol 相比仍存在“可感知的差距”。这一表述暗示,在纯粹的基准跑分之外,模型在实际交互的一致性、指令遵循的细腻度或安全性对齐等维度上,尚未完全追平最顶尖的闭源系统。K3 的价值在于将超大规模 MoE 架构与一系列效率优化技术打包为开源权重,为社区提供了一个高起点的研究基座,但其真实影响力将取决于权重公开后的生态扩展速度以及社区能否在用户体验短板领域实现有效改进。
Mira Murati的Thinking Machines Lab发布首款开源模型Inkling
Mira Murati 创立的 Thinking Machines Lab 发布了首个开源模型 Inkling,采用 Apache-2.0 许可证。该模型是一个混合专家(MoE)Transformer 架构,总参数量 975B,激活参数 41B,在 45 万亿个 token 的多模态数据上完成训练,覆盖文本、图像、音频和视频。团队同时预告了 Inkling-Small,参数量 276B(激活 12B),权重将在内部测试完成后放出。
从技术定位看,Inkling 并非以追求基准测试的绝对领先为目标。模型卡中明确声明,该模型不是当前最强的模型,其设计意图是作为一个适合定制化的基础模型,配合团队自有的 Tinker 训练平台,供用户在特定任务上进行微调。这一策略避开了与前沿闭源模型的直接性能比拼,转而强调实用性和可扩展性。
训练数据文档的披露程度明显低于美国 AI 实验室近年形成的惯例。文档仅简要说明数据来源包括公共领域内容、开放互联网公开信息、公开数据仓库及第三方数据集,未提供数据构成、过滤策略或去重方法的细节。这种透明度水平与模型的开源许可形成了对比,对于希望评估数据合规性或进行可重复性研究的开发者而言,信息缺口较为明显。
在能力验证方面,Simon Willison 通过 API 对模型进行了非正式测试,包括生成 SVG 图像和描述自身输出。模型生成的鹈鹕骑自行车图像被其自行描述为“鹳或海鸥”,暴露出在细粒度视觉概念理解上的偏差。这一结果与当前多模态模型在特定视觉任务上的普遍局限一致,但作为公开发布后的早期测试案例,仍为评估其视觉-语言对齐水平提供了参考。
Inkling 的发布为美国开源模型生态增加了一个新的参与者,与 Nvidia Nemotron 和 Google Gemma 4 等形成并行力量。其 MoE 架构在激活参数与总参数之间的比例设计,以及多模态能力的基础模型定位,为需要可控算力成本进行下游适配的团队提供了一种选择。但训练数据透明度的不足和视觉理解能力的边界,需要在后续版本或社区使用中得到进一步检验。
一张图看AI如何改变Stack Overflow:流量断崖式下跌
Stack Overflow 的月度新增问题数量自 ChatGPT 发布以来出现断崖式下跌,这一趋势通过其公开数据查询平台得到量化印证。根据 Stack Exchange Data Explorer 上一条针对 Posts 表的 SQL 查询结果,该查询按月份聚合了 PostTypeId = 1(即问题帖)的记录,时间跨度覆盖了平台自 2008 年以来的完整生命周期。
数据显示,Stack Overflow 的月度问题提交量在 2014 年前后达到峰值,随后进入缓慢下降通道,这符合技术社区成熟期的自然规律。然而,曲线的斜率在 2022 年 11 月之后发生剧烈变化。从图表可以清晰观察到,自该时间点起,问题数量以近乎垂直的态势下滑,到查询截止日期已跌至平台早期 2009 年左右的水平。这一时间拐点与 OpenAI 发布 ChatGPT 的时间高度吻合。
该现象的核心逻辑在于,开发者获取编程知识的行为模式发生了根本性迁移。过去,遇到具体的技术障碍时,在 Stack Overflow 上描述问题、等待社区回答是标准路径。如今,大语言模型能够针对代码错误、API 用法和配置问题提供即时、上下文相关的解答,直接分流了大量原本会形成新帖的初级与中级技术提问。Stack Overflow 面临的挑战并非内容质量下降,而是提问这一行为本身的需求被大幅压缩。
这一数据趋势的局限性在于,它仅反映了问题数量,未涵盖答案质量、用户活跃度或页面访问量等维度。问题量的下降是否与平台内容生态的健康度直接挂钩,仍需结合其他指标判断。此外,查询结果本身为匿名用户提交,其准确性依赖于 Stack Exchange 公开存档的完整度,但作为官方数据渠道,其反映的整体趋势具有参考价值。
研究员破解Claude防范机制,诱导其泄露用户隐私数据
Claude 的 web_fetch 工具在设计上针对数据外泄攻击设置了明确的防护边界:它只能访问用户直接输入的 URL,或由内置 web_search 工具返回的 URL。这一规则从机制上阻止了经典的“致命三角”攻击——攻击者无法通过提示注入指令,让模型将私有数据拼接到恶意 URL 并主动访问,因为这类动态构造的地址不在白名单范围内。
安全研究员 Ayush Paul 发现了一个绕过该防护的路径。web_fetch 被允许跟踪已抓取页面中嵌入的链接,这构成了一个可被利用的递归入口。攻击者搭建了一个蜜罐站点,仅对 User-Agent 包含 Claude-User 的请求返回攻击载荷,以此规避人工审查。页面伪装成 Cloudflare 的认证系统,诱导 Claude 通过逐字母浏览用户档案的方式来“验证身份”——例如依次访问 https://coffee.evil.com/a、https://coffee.evil.com/b 等嵌套生成的链接。
攻击成功提取了三项用户隐私信息:姓名、居住城市和雇主名称。整个过程中,Claude 并非直接拼接敏感数据到 URL,而是在攻击者控制的页面引导下,通过逐级跟踪链接完成了数据外泄。这本质上仍是一次提示注入驱动的外泄攻击,但利用了工具自身合法的页面跳转能力绕过了 URL 白名单校验。
Anthropic 未为此支付漏洞赏金,理由是已在内部发现该问题。修复措施直接且彻底:移除了 web_fetch 跟踪已抓取内容中附加链接的能力,从能力层面切断了此类递归导航攻击的可行性。
该案例的启示在于,即使工具权限模型在顶层设计了确定性的阻断规则,子功能的交互边界仍可能引入未预期的数据出口。对于具备联网能力的 AI Agent,工具间权限传递的闭包性需要逐层审计,而非仅检查入口条件。
三秒盗窃:AI语音诈骗速度远超现有防御手段
在 2026 年 4 月发布的年度报告中,美国联邦调查局(FBI)互联网犯罪投诉中心(IC3)首次将人工智能辅助欺诈列为独立统计类别,这一行政动作本身即构成对技术态势的正式确认。报告录得超过 22,000 起相关投诉,调整后损失超过 8.93 亿美元,其中 3.52 亿美元的损失集中于 60 岁以上群体。FBI 明确指出,由于多数受害者从未意识到通话由机器生成,该数据仅为下限,真实规模被系统性低估。
技术层面的核心事实是:当前语音克隆系统仅需 3 秒音频即可生成人耳无法区分的合成语音。国际刑警组织(INTERPOL)在 2026 年 3 月的评估中估算,2025 年全球金融欺诈损失达 4420 亿美元,并指出 AI 增强型欺诈的利润率约为传统手段的 4.5 倍。该组织将此现象定义为“欺诈工业化”,即自主化 AI 系统已能规划并执行从侦察到勒索的完整欺诈链条。攻击成本趋近于零,而攻击规模与回报急剧膨胀。
2025 年 3 月《消费者报告》对六款语音克隆产品的评估显示,多数产品缺乏有效的防护机制。这一发现揭示了当前防御体系的根本性不对称:攻击工具廉价、充裕且几乎不受监管,而防御方——包括执法机构、银行与电信运营商——仍依赖以人类认知为最后防线的滞后体系。当攻击的精密程度与目标的防范意识之间存在以年为单位计量的差距时,传统的事后追溯与用户教育策略已难以构成有效威慑。问题的核心已从技术可行性转向一个更棘手的层面:在攻击者能够以近乎零成本、工业级规模利用公开社交痕迹实施精准欺诈的条件下,有意义的防护需要重构验证机制,而非继续依赖个体识别异常的能力。
MIT论文:AI投资存在投机泡沫,经济增长影响评估存疑
这篇来自 MIT 的论文对当前 AI 投资热潮提出了系统性质疑,其核心论点是:市场对 AI 的经济增长效应存在系统性高估,当前投资水平已形成投机性泡沫。
研究团队构建了一个基于生产函数和一般均衡的理论框架,将 AI 技术冲击分解为全要素生产率提升与资本替代效应。关键发现在于,即便在极其乐观的技术进步假设下,AI 对 GDP 年增长率的贡献也远低于市场预期。论文通过校准模拟得出,AI 在未来十年内对年 GDP 增长率的贡献上限约为 0.5 至 1 个百分点,这一数值与历史上通用技术扩散的宏观影响量级一致,但与当前数万亿美元级别的资本投入形成显著错配。模型进一步显示,若投资回报率无法匹配资本成本,过度投资将导致资本存量价值重估,引发相当于 GDP 3% 至 5% 的财富损失。
该研究的方法论贡献在于将技术扩散的微观摩擦与宏观投资动态纳入统一分析框架,明确区分了技术可行性与经济可行性。与业界常见的“技术决定论”叙事不同,论文强调 AI 的宏观影响受制于要素替代弹性、部门间资源配置刚性以及技术采纳的 S 型扩散曲线。这些约束条件在多数市场预测中被系统性忽略。
论文的局限性同样清晰。模型假设技术冲击是外生的,未考虑 AI 可能引发的内生增长机制或新产业创造效应。此外,分析聚焦于传统 GDP 核算框架,对消费者剩余、质量改进等非价格维度的福利增益缺乏度量。这些因素可能导致模型低估 AI 的真实经济价值,但论文作者明确指出,即便纳入这些调整,要弥合当前投资规模与预期回报之间的缺口,所需的技术进步速度需达到历史均值的 3 倍以上,这一条件在可预见的未来难以满足。
LLM智能体间的隐藏信道:文本之外的对齐与沟通
大型语言模型在多智能体系统(MAS)中的协作通常依赖自然语言文本进行信息交换。这项研究从信息保真度的角度出发,系统性地检验了一个核心假设:文本信道在传递复杂概念时,是否会因序列化压缩而丢失模型内部表征所承载的信息,以及潜在表征信道能否构成更优的替代方案。
研究构建了三种通信信道进行对比:稠密潜在信道(直接注入残差流激活值)、SAE稀疏信道(传输稀疏自编码器提取的稀疏特征编码)以及文本信道(常规提示词)。实验围绕信道保真度、特征存活率、跨架构对齐和任务级表现四个维度展开。在信道保真度测试中,SAE稀疏信道在实现28倍压缩比的条件下,线性探针准确率达到99.4%,而文本信道仅为80.4%,表明文本序列化过程存在显著的信息折损。
为量化这种折损的具体形态,研究引入了特征存活分析。通过文本往返(序列化后重新编码),发现88%的SAE特征在文本转换后消失,被另一组特征集所替代。研究者将这一现象归因为“身份替换”而非信号衰减,但进一步分析指出,这些丢失的特征主要编码的是表层形式信息,而非任务相关的语义内核。这一判断在跨架构对齐实验中得到侧面印证:即便使用简单的Procrustes线性对齐,Llama与Mistral模型间基于稀疏潜在空间的Top-1检索准确率仍可达92%,证实了不同架构间存在可被利用的表征收敛现象。线性对齐引入的性能损失被量化在3至10个百分点,且可通过非线性对齐方法缩小。
任务级评估的结果对初始假设构成了关键否定。在跨语言概念识别等任务上,潜在信道仅能与文本信道持平,从未实现超越;而在文本中增补潜在特征亦未带来任何收益。这指向一个清晰的结论:文本信道所丢失的特征并不携带任务关键语义,潜在通信在当前的浅层任务框架下不具备实用优势。研究同时指出,指令微调模型存在结构性的潜在注入障碍,且当前任务设计可能不足以激发深层概念表达,这构成了方法推广的主要限制。
Replit工程师用AI半年内代码输出量翻三倍,质量不降反升
Replit 近期披露的内部实践,为观察 AI 智能体(Agent)在真实生产环境中的规模化效应提供了一个罕见的量化样本。其核心问题并非单纯验证 AI 能否辅助编码,而是探索当智能体深度嵌入公司研发、运维、协作全流程后,组织效能能否实现结构性跃迁,同时不牺牲质量与稳定性。
在技术方案上,Replit 构建了一套内部智能体系统,而非依赖单一的对话式编程工具。他们利用自有的智能体框架、微虚拟机(microVMs)及远程文件系统基础设施,使工程师能够并行编排智能体集群。关键在于,该系统在通过访问策略、令牌代理、审计日志和 ZeroTrust 网络加固后,被接入了 GitHub、GCP、Azure、Linear、Notion、Slack、ZenDesk 等构成日常工作流的系统。这种跨系统的上下文贯通,使得智能体能够执行事件调查、代码审查、支持工单分类等复合任务,而不仅仅是生成代码片段。
关键数据揭示了这一变革的幅度。在剔除新员工入职效应、锁定固定作者群后,工程师的人均代码产出量提升至原来的 2.9 倍。与此同时,代码审查延迟保持平稳,这得益于智能体参与审查并评估风险等级,仅在必要时引入第二人工审核者,节省了 30% 的人工 PR 审查时间。在质量维度,PR 回滚率和产品事故数量趋势平稳,考虑到代码量激增,这意味着相对质量有所改善;事故平均缓解时间(MTTM)也在智能体辅助根因分析的推动下下降。最终,这些产出转化为了实际价值,项目完成率随编码量一同急剧上升。
这一实践的创新之处,在于展示了从“AI 作为工具”到“AI 作为组织架构”的转变。Replit 将这种现象称为“自驱动公司”,其核心是人与智能体系统的协作模式变化:人负责设定目标、做出权衡并承担责任,而智能体系统则承担起执行步骤、收集上下文和检查结果的工作。这种模式的影响范围超出了个体开发者,开始重塑团队协作方式,使工程师的体感更像是“获得了晋升”而非“被自动化”。
局限性同样值得审视。报告明确指出,部分代码产出增长可归因于招聘,尽管已通过固定作者群的方式加以控制,但团队规模翻倍带来的复杂性和沟通成本变化难以完全量化。此外,5.8 倍的总代码行数增长与 2.9 倍的人均增长之间的差距,暗示新员工在智能体辅助下生产力提升更快,但这可能也掩盖了代码库膨胀或重构不足的风险。所有数据均来自 Replit 这一特定环境,其团队文化、基础设施和业务形态具有特殊性,该模式能否在更大规模、更复杂的遗留系统或强监管行业中复现,仍是未解问题。