2026.06.21WEEKLY DEEP READS

DeepSeek-V4发布:支持百万Token上下文的高效MoE模型

8 items·2026.06.21
01 / RESEARCH2026.06.21

DeepSeek-V4发布:支持百万Token上下文的高效MoE模型

DeepSeek-V4 的发布主要解决长上下文场景下的计算与显存瓶颈,旨在将百万级 Token 上下文从理论可能性转化为常规工程实践。该系列包含 DeepSeek-V4-Pro(总参数 1.6T,激活参数 49B)和 DeepSeek-V4-Flash(总参数 284B,激活参数 13B)两个版本,两者均支持 1 million tokens 的上下文长度。

技术架构上,模型并未单纯依赖稀疏注意力,而是引入了 Compressed Sparse Attention (CSA)Heavily Compressed Attention (HCA) 的混合注意力机制。CSA 通过压缩 Key-Value 条目并利用 Lightning Indexer 进行稀疏选择,而 HCA 则进一步压缩 KV 条目并结合共享 KV MQA,以此在保留关键信息的同时大幅降低计算复杂度。此外,新引入的 Manifold-Constrained Hyper-Connections (m HC) 对传统残差连接进行了流形约束改进,配合 Muon 优化器,旨在提升训练稳定性与收敛速度。

在效率提升方面,官方数据显示 DeepSeek-V4-Pro 表现显著。在处理百万 Token 上下文时,其单 Token 推理所需的 FLOPs 仅为 DeepSeek-V3.2 的 27%KV Cache 占用仅为 10%。这种数量级的资源削减,使得在有限硬件资源下处理超长文本成为可能。预训练阶段使用了超过 32T tokens 的高质量多样化数据,并通过包含 Specialist Training 和 On-Policy Distillation 的后训练管道进一步强化了推理能力。

尽管 DeepSeek-V4 在长文本效率上取得了突破,但其混合注意力机制引入了异构 KV Cache 管理的复杂性,对推理系统的内存管理与内核协同设计提出了更高要求。此外,虽然推理成本降低,但 1.6T 的总参数量依然对部署环境构成了不小的物理门槛。

02 / INSIGHTS2026.06.21

Z.ai发布开源GLM-5.2:753B参数模型

Z.ai 发布的 GLM-5.2 在纯文本开源权重模型领域确立了新的性能标杆。该模型采用 753B 总参数规模,基于 Mixture of Experts (MoE) 架构,每次推理仅激活 40 个参数。与上一代 GLM-5.1 相比,其上下文窗口从 20 万 token 大幅提升至 100 万 token,并采用 MIT 协议完全开源,显著降低了企业级应用集成的门槛。

在 Artificial Analysis 的 Intelligence Index v4.1 基准测试中,GLM-5.2 以 51 分的评分位列开源模型首位,超越了 MiniMax-M3(44分)、DeepSeek V4 Pro(44分)和 Kimi K2.6(43分)。在侧重前端开发与 Agent 工作流的 Code Arena WebDev 排行榜上,该模型排名第二,仅次于闭源的 Claude Fable 5。这表明即便不具备视觉输入能力,该模型在处理复杂代码生成任务时仍具备极强的逻辑推理与代码结构还原能力。

然而,该模型的推理成本控制面临挑战。数据显示,GLM-5.2 在 Intelligence Index 任务中的平均输出 token 数达到 43k,高于 GLM-5.1 的 26k 以及 DeepSeek V4 Pro 的 37k。这种“token-hungry”的特性意味着在处理相同任务时,其推理延迟与算力消耗显著高于竞品。目前 OpenRouter 上的定价约为输入 $1.40 /百万 tokens、输出 $4.40 /百万 tokens,虽然远低于 GPT-5.5 和 Claude Opus 4.5-4.8,但较高的 token 消耗量可能会抵消单价优势。

03 / NEWS2026.06.21

Midjourney发布第二款产品:像踩体重秤一样扫描器官

Midjourney 正式进军医疗硬件领域,推出了代号为 Midjourney Scanner 的全身超声 CT 系统。该项目试图通过高密度的超声波阵列替代传统的 X 射线、CT 或 MRI,以实现无辐射、低成本且高频次的全身成像。其核心逻辑在于将复杂的医学影像检查简化为类似“踩体重秤”的日常行为,从而实现大规模的预防性医疗筛查。

在技术实现上,该系统采用了极具工程挑战性的硬件堆叠。原型机由 40 个 环形系统组成,直径 70 cm,总计包含约 358,000 个 超声元件。这种高密度的物理阵列带来了巨大的数据吞吐压力,系统在声波介质(水)中传输速度约为 1,481 m/s,数据捕获速率高达 17 GB/s,单次切片扫描即产生约 40 GB 的原始数据。目前的图像重建依赖于 21 台 服务器组成的集群,算力达到 2 PFLOPS。值得注意的是,David Holz 强调目前的成像主要依赖物理波束合成与算法,尚未直接引入 AI 模型进行图像生成。

从演示效果来看,Gen 1 原型机已能展示 0.5 mm 分辨率的内部组织细节,并在大腿肌肉边界等成像上与 MRI 进行了对比验证。然而,该技术目前仍面临显著的工程瓶颈。由于数据传输带宽、DSP 及基础设施的限制,单次扫描耗时约 20 分钟,远未达到其设想的“60 秒内数百次切片”的目标。此外,团队仅由 9 人 组成,目前仅完成了 十几次 人体扫描,且设备尚未获得 FDA 批准。

商业化路径上,Midjourney 采取了“硬件+服务”的捆绑模式。公司计划在旧金山 Union Square 开设占地 25,000 平方英尺 的 Midjourney Spa,配备 9-10 台 扫描仪,预计 2027 年底 开业。Holz 预计单台扫描仪的边际成本可趋近于零,并提出了部署 50,000 台 设备、每月支持 10 亿次 扫描的宏大愿景。尽管其声称无需外部融资,但实现数千个网点的扩张仍需约 200 亿美元 的资本支出,且目前关于超声波 CT 在全身诊断中的临床有效性仍存在大量未解的医学疑问。

042026.06.21

微软转向AWS应对GitHub AI算力危机

此次 GitHub 寻求 AWS 支持的事件,核心在于 AI 编码代理引发的算力需求激增已超出单一云厂商的弹性供给边界。微软作为 Azure 的拥有者,不得不向最大竞争对手亚马逊购买算力,表明在基础设施稳定性面前,云厂商的排他性战略必须让步。GitHub 的负载增长曲线已脱离常规线性预测,迫使微软在完成原定于 2027 年的全量迁移至 Azure 之前,采取多云策略以规避服务中断风险。

GitHub 官方披露的数据显示了负载的剧烈波动。根据 GitHub COO Kyle Daigle 的信息,平台代码提交量预计将在 2026 年达到 140 亿次,远高于 2025 年的 10 亿次。CTO Vlad Fedorov 指出,平台在 2025 年 10 月启动扩容计划时目标是增加 10 倍容量,但到了 2026 年 2 月便意识到必须按 30 倍规模设计。目前,GitHub 已将 40% 的单体应用流量和 30% 的 Git 流量迁移至 Azure,但在 5 月份仍记录了 9 起服务降级事故,其中一次由数据库模式迁移引发,导致 Pull Requests、Actions 及 Git 操作全面受阻。

这一现象揭示了 AI 时代基础设施架构的深层矛盾。AI 编程工具并非简单增加流量,而是改变了工作流的性质,使机器生成的提交量呈指数级上升,导致老旧的共享系统不堪重负。HashiCorp 创始人 Mitchell Hashimoto 等核心开发者的公开离场,证明了可靠性问题已直接威胁到 GitHub 作为开发者默认基础设施的地位。微软此举表明,在“代理式开发”带来的突发性洪峰面前,依靠单一内部云资源进行垂直整合的传统模式,在应对横向扩展需求时存在物理和时间上的滞后。

052026.06.21

生成式AI被指陷入“传销式”商业泡沫

生成式 AI 商业模式正面临严重的泡沫化质疑,其核心逻辑被类比为多层次营销(MLM)式的“传销”结构。文章指出,以 Replit 为代表的“氛围编码”类初创企业,通过 TikTok 等平台向年轻群体投放大量由网红制作的广告,宣扬“通过自然语言提示词即可构建软件并实现财富自由”的理念。这种营销策略利用了当前经济环境下年轻人对就业市场停滞的焦虑,将技术工具包装成通往经济独立的捷径。

从技术实现来看,此类产品本质上是 Anthropic、OpenAI 和 Google 等巨头基础模型的“包装器”。它们并未提供底层模型的突破,而是通过简化交互界面来降低使用门槛。然而,这种技术上的微创新被营销话术无限放大,掩盖了其商业模式的脆弱性。文章将此现象与 2010 年代的加密货币热潮及历史上的直销骗局相提并论,指出其共同特征在于:当经济环境恶化、社会流动性降低时,针对弱势群体兜售“快速致富”的虚假希望

该分析揭示了一个关键的市场错位:绝大多数此类产品的目标用户并非拥有购买力的企业,而是处于经济边缘的个人。这与 FTX 在加密货币泡沫期通过名人效应(如 Larry David、Paris Hilton)渗透主流市场的策略如出一辙。文章强调,这种商业模式的可持续性存疑,因为其利润主要依赖于不断招募新的“下线”用户或开发者,而非产品本身的技术壁垒或实际生产力价值。当前生成式 AI 领域的繁荣,很大程度上可能建立在对技术能力的过度承诺与对用户焦虑的收割之上。

06 / RELEASES2026.06.21

OpenAI推理模型辅助医生确诊18例儿童罕见遗传病

波士顿儿童医院与哈佛大学合作,利用 OpenAI 的 o3 Deep Research 推理模型,对 376 个既往未解决的疑难病例进行了重新分析。在传统基因组测序和专家审查未能确诊的情况下,该研究通过 AI 辅助工作流,额外确诊了 18 例儿童罕见遗传病,使诊断率提升了 4.8%。该成果证实了在知识库不断更新的背景下,利用大模型对历史积压病例进行周期性再分析具有临床实用价值。

技术方案上,研究团队并未将模型作为独立的诊断工具,而是将其构建为“解释优先”的推理层。输入数据包含标准化的人类表型本体术语、临床笔记及变异过滤表。模型被要求整合临床特征、遗传模式及科学文献,生成具有证据链的候选解释,而非仅输出排序后的基因列表。在验证阶段,针对已知诊断的病例,模型在 51 个案例的重复运行中 48 次成功恢复正确基因与变异;在 57 个神经肌肉病例集和 15 个长读长基因组集中,也分别展现了较高的定位准确性。模型输出的自评估置信度分数与正确诊断呈现相关性:正确呼叫的平均最低分数为 85.6,而错误或未知呼叫仅为 42.1

该研究的核心创新在于将 AI 的推理能力置于现有的基因组学流水线之上,专门用于处理数据碎片化与知识迭代带来的检索难题。尽管模型能够有效缩小搜索范围并生成假设,但所有确诊结论均严格遵循 ACMG/AMP 框架,经过至少两名专家的审查及 CLIA 认证实验室的确认。这表明,在处理极其复杂的罕见病诊断时,AI 的角色是辅助专家生成线索,而非替代临床决策。

07 / NEWS2026.06.21

Vercel发布Agent Stack:AI代理标准化框架

Vercel 发布的 Agent Stack 试图解决 AI 代理开发中的基础设施碎片化问题。构建生产级 Agent 需要模型连接、多步工作流执行及系统集成三大核心能力,目前的现状是开发者常被迫在单一供应商锁定、自行拼凑方案或自建抽象层之间做选择。Agent Stack 提供了一套标准化工具链,旨在降低工程复杂度并提升交付效率。

在模型连接层面,该方案通过 AI SDKAI Gateway 实现了统一接口。AI SDK 屏蔽了不同实验室 API 在流式传输、工具调用及结构化输出上的差异,允许开发者通过修改单一字符串(如 'anthropic/claude-sonnet-4.6')切换模型,而无需重构代码。AI Gateway 则充当“Token 的 CDN”,负责在单一端点后路由数百个模型,提供故障转移及跨供应商的统一计费,且不加价。例如 SERHANT. 利用该架构将市场分析、营销文案和图像生成分别路由至 Claude、GPT 和 Gemini。

针对长时间运行的工作流,Workflow SDK 引入了持久化机制。Agent 任务往往耗时数分钟甚至数小时,若中途某一步骤失败,传统方案需从头重跑并产生额外费用。Workflow SDK 通过对每个步骤进行 Checkpoint(检查点)保存,确保任务能从最后一个成功步骤恢复,而非归零重启。配合 Vercel Sandbox 提供的隔离虚拟机环境,Agent 可以安全地执行代码及敏感操作。

该架构的核心价值在于将 Token 视为类似带宽的生产依赖,利用 Vercel 既有的全球网络进行分发与治理。其局限性在于,虽然提供了构建模块,但 Agent 在复杂逻辑下的推理稳定性及工具调用的可靠性,仍取决于模型本身的能力边界,框架本身无法解决模型产生的幻觉或逻辑错误。

082026.06.21

印度与阿联AI合作:绕过谷歌微软共建主权模型

此次合作的核心在于构建一条绕过美国科技巨头(亚马逊、微软、谷歌)的算力路径,以实现数据主权与基础设施自主。目前印度虽有 450亿美元 的外资云厂商承诺投资,且国家 AI 计划完全依赖 Nvidia 处理器,但通过引入阿联酋 G42 与 Cerebras,印度试图建立一套由本土规则管辖、非美资运营的硬件设施。

技术方案上,该项目部署 64 套 Cerebras 系统。与 Nvidia 主导的模型训练不同,Cerebras 采用单晶圆级芯片,侧重于 AI 应用的高效推理运行。这契合印度在医疗、农业等公共服务场景的落地需求,而非从头训练大模型。G42 将负责设施的安装与运维,数据完全遵循印度法律管辖。

该模式验证了“数字主权”的务实化,即通过多边合作拼凑能力而非全产业链自建。然而,Cerebras 面临严峻生态挑战。Nvidia 与云厂商提供的是软硬件集成的成熟工具链,Cerebras 需证明其软件生态能支撑开发者需求。此外,G42 虽有在美国本土运营 Condor Galaxy 设施的经验,但在印度能否提供匹配 AWS 或 Azure 的综合服务能力,仍是其能否打破市场垄断的关键变量。

chat_bubbleAny thoughts on today's content?
Weekly Deep Reads 2026.06.15 — 2026.06.21 | AI Daily Pulse