2026.08.23WEEKLY DEEP READS

AI公司正在毁掉实体书:呼吁在一切太晚前扫描稀有书籍

8 items·2026.08.23
01 / NEWS2026.08.23

AI公司正在毁掉实体书:呼吁在一切太晚前扫描稀有书籍

AI 训练数据获取方式的演变正在触及一个此前未被充分讨论的物理载体问题:纸质书籍的实体销毁。Anna’s Archive 志愿者撰写的这篇声明指出,以 Anthropic 为代表的 AI 公司通过中介批量收购二手书,扫描后即行销毁,目的是获取 2022 年之前“未经机器触碰”的纯人类语料。文中援引 Project Panama15 亿美元版权和解案中被曝光的细节:该项目于 2024 年初启动,投入 数千万美元购入 数百万册纸质书,用于训练 Claude 后全部销毁。

这一操作的技术逻辑值得拆解。销毁实体书的动机并非单纯的资源浪费,而是三重利益计算的结果:阻止竞争对手获取同一批语料、规避版权追溯的物证链条,以及销毁成本低于无损扫描的存储与物流成本。其后果是结构性的——AI 公司成为全球唯一持有这些书籍数字副本的主体,知识被永久锁定在私有服务器上,公共领域可获取的版本反而减少。这与 AI 行业宣称的“让人类知识触手可及”形成了实质性的反向运动。

Anna’s Archive 的应对方案是动员志愿者规模化扫描并上传至影子图书馆,尤其针对稀有书籍和易损文献。文中提出的量化目标是:全球 1000 万志愿者每人扫描一本书,即可获得 1000 万份文献。平台对小型扫描上传提供终身会员资格,对大规模扫描则提供费用补贴。这一策略本质上是在与 AI 公司的收购-销毁流程赛跑,试图在实体副本消失前完成公共数字副本的留存。

值得注意的另一个数据点是文中提到的 2025 年初以来 AI 生成内容已占新发布互联网内容的一半以上。这一趋势与实体书销毁叠加,意味着人类原创文本的存量与增量同时面临收缩。声明的核心判断——影子图书馆是当前对抗知识私有化最直接的机制——在操作层面成立,但其可持续性依赖于志愿者网络的规模与持续性,且无法解决已销毁书籍的不可逆损失。

02 / INSIGHTS2026.08.23

AirTag追踪显示:亚马逊销毁珍稀书籍用于AI训练

404 Media 的一项调查为长期流传的行业猜测提供了实证:大型科技公司确实在以规模化方式采购纸质书籍用于 AI 训练,且部分书籍在扫描后被销毁。调查团队说服一位书商在一本即将发出的书中放置 Apple AirTag,追踪其物流路径。这批约 1,000 本的订单最终抵达位于拉斯维加斯东北部的 Amazon LAS8 设施 VGT3 区域,入口处标识为一只恐龙捧书的图案。Amazon 员工在在线论坛中的讨论进一步确认,VGT3 区域对大量书籍进行破坏性扫描

这一发现的核心意义在于将此前停留在传闻层面的"书籍采购—扫描—销毁"链条落到了具体设施与操作环节。2025 年 6 月已有报道指出 Anthropic 存在书籍扫描行为,而此次调查将 Amazon 的参与置于更明确的证据基础之上。书商群体此前已注意到来自匿名客户的、对价格不敏感的大宗订单,这类采购模式与常规图书流通逻辑不符,指向训练数据采集的规模化需求。

从数据获取策略看,直接采购实体书并销毁性扫描,意味着运营方追求的是高吞吐量的文本数字化,而非保留书籍本身。这与依赖已有数字文本或授权语料的路径形成差异,其法律与伦理风险集中在版权边界和"首次销售原则"的适用争议上。调查本身未提供扫描后的文本是否直接进入训练语料库的直接证据,VGT3 区域的破坏性扫描行为与训练数据供给之间的因果关系仍依赖员工论坛信息和物流终点的间接推断。此外,AirTag 追踪只能确认物理位置,无法揭示数据处理流程、去重与过滤机制,以及这些文本在训练权重中的实际占比。

03 / NEWS2026.08.23

NVIDIA以120亿美元“反向收购”AI创企Poolside,创始人留任获10亿

Poolside 与 NVIDIA 达成的交易结构在 AI 创业公司退出案例中较为罕见。根据投资者信披露的信息,NVIDIA 以 60 亿美元获得 Poolside 模型工厂的非独家授权,同时以 120 亿美元投前估值向 Poolside 投资 10 亿美元。约 109 名员工转入 NVIDIA,而两位创始人选择留任。创始人明确表示这“不是收购,也不是人才收购”,但交易实质接近一次反向 execuhire——通常 execuhire 是高管离开、员工留任,此次则是核心技术人员整体迁出,创始人与剩余实体继续运营。

Poolside 此前以不足 115 名工程与研究人员构建模型,其技术团队规模与产出比在行业中处于较高水平。创始人在交易说明中给出的核心逻辑是资本约束的急剧变化:公司曾在去年底面临 6 周窗口期筹集 20 亿美元以锁定 40,000 张 GB300 集群,未能按时完成而失去算力资源。他们判断,下一阶段前沿模型所需集群规模将超出当前一个数量级以上,且瓶颈已从资本转向物理数据中心空间与合约算力。这一判断直接解释了为何将模型工厂部分交给 NVIDIA,而非继续独立训练。

交易后 Poolside 的走向存在明显不确定性。创始人称“尚未准备好分享更新后的愿景”,但留下的线索指向从模型训练向基础设施与科学发现引擎的转向。其独立实体 Poolside Infrastructure Company 正在得州建设 1.2GW 数据中心,近期更换了 CEO 与 CFO。创始人同时提出一个值得注意的判断:人类水平智能将被开源模型完全商品化,而超智能不会;AI 的最终价值将来自实验约束型问题,即需要真实世界实验反馈循环的领域,而非仅靠智能扩展即可解决的智力约束型问题。这一框架为 Poolside 剩余实体的方向提供了逻辑基础,但缺乏具体的执行路径说明。交易各方均获得了可观的经济回报,而 Poolside 新实体的实际业务形态仍待观察。

042026.08.23

Stripe以70亿美元收购AI路由平台OpenRouter

Stripe 对 OpenRouter 的收购以 70 亿美元 估值落定,距后者完成 13 亿美元 B 轮融资仅 90 天。这一时间跨度本身即构成信号:模型路由层作为 AI 基础设施中的聚合节点,其资本定价正在被快速重估。

从财务数据看,OpenRouter 的年化收入为 1.4 亿美元,对应约 50 倍 的收购倍数,在头部 AI 公司中属于标准区间。更具参考价值的是其成本结构:年化服务成本约 4000 万美元,占总收入的 28.5%,对应 1 亿美元 的年化毛利润和约 70% 的毛利率。这一水平已接近高绩效上市软件公司,说明模型路由业务在规模化后具备真实的经营杠杆,而非仅靠融资驱动的增长叙事。

规模指标同样明确:OpenRouter 当前月均处理 250 万亿 tokens,较 2 月的 50 万亿 增长五倍,开发者基数达 800 万。以 70 亿美元估值对应约 1 亿美元毛利润计算,市盈率约 70 倍,在六个月五倍增速的背景下,定价逻辑尚可自洽。

值得注意的并非收购本身,而是其揭示的价值分布变化。原文指出,价值正在从 GPU 基础设施、Agent Labs 和前沿模型实验室向路由与分发层迁移。与此同时,OpenRouter 下调 GPT-5.6 Sol 定价、Vercel 同步调整 AI Gateway 价格,表明模型经纪业务正在进入以价格竞争为主导的阶段,聚合层的护城河并非天然稳固。若 markup 持续压缩至零,当前的高毛利结构将面临直接挑战。Stripe 的支付与开发者分发能力能否为 OpenRouter 提供差异化壁垒,是这笔交易后续最值得观察的变量。

052026.08.23

模拟比训练更高效?AI成本降100倍速度提升万倍

模拟正在取代训练成为 AI 降本的核心路径,这一判断来自对 2022 年以来合成数据技术演进脉络的系统梳理。原文将这一进程划分为七个阶段,核心逻辑是:人类在机器学习流水线中的每个组件都在被模型生成的模拟版本替代,代价是性能下降约 10%,但成本降低 100 倍、速度提升 10000 倍

从技术演进看,替代顺序具有清晰的因果链条。奖励信号最先被合成化——InstructGPT 用人类偏好训练奖励模型,此后策略优化不再直接依赖人类反馈;Constitutional AI 进一步用 AI 自批评替代人类评判,Lee 等人的实验表明 AI 反馈在成本大幅降低的前提下可匹配人类反馈质量。训练数据紧随其后,微软 Phi 系列以合成教科书数据训练小模型实现参数效率跃升,Apple WRAP 将网页语料经 LLM 改写后使预训练效率提升约 3 倍。教师角色的替代以 Alpaca 为标志——600 美元的微调成本即可克隆前沿模型大部分行为,而 DeepSeek-R1 发布蒸馏模型家族后,“教师是模型”成为小模型发布的默认假设。

2024 年之后的阶段更具结构性意义。课程设计环节中,Meta 的 Self-Rewarding Language Models 和 SPIN 证明模型可以生成自身任务、评判自身输出并超越人类偏好数据的天花板。2026 年的两个进展将闭环推至极限:Karpathy 的 autoresearch 系统在无人干预下运行 700 个实验、保留 20 个有效改进,将 GPT-2 训练时间从 2.02 小时压缩至 1.80 小时;Z.ai 的 GLM-5.3 则实现了环境、评判器和验证器的全合成化,其验证器需通过 oracle、no-op 和 unsolved-state 三类压力测试才能用于训练。

这一趋势的实质是模拟保真度与成本之间的权衡被系统性地偏向后者。10% 的性能损失换 100 倍成本下降,在多数工程场景下是理性选择。但原文未讨论的是:当合成组件层层叠加,误差如何在流水线中传播和累积,以及最终产出的模型是否会在某些能力维度上出现人类难以察觉的系统性偏差。环境合成阶段的验证器可靠性测试提供了局部保障,但全局性的质量退化检测机制尚未被提及。

06 / INSIGHTS2026.08.23

Linus Torvalds:AI是得力助手,但会说“不可能”

Linus Torvalds 在 2026 年 8 月 22 日提交的 drm/xe 内核补丁说明中,记录了一次被他称为“地狱级调试”的经历,并罕见地详细评价了 AI 在其中的表现。这段引述由 Simon Willison 收录,核心价值在于提供了一个来自顶级内核维护者的、非宣传性的 AI 辅助编程实证样本。

Torvalds 明确将 AI 定位为“不知疲倦的助手”,承担了大量基础调试工作(grunt-work)。关键行为模式是:当调试陷入僵局时,AI 多次“明确断言该问题不可能解决、无解,建议直接撰写报告”。Torvalds 推测这种轻易放弃的倾向源于训练数据中人类标注者“不够固执”的特质。然而,当他持续施压(push)后,AI 并未真正停止工作,而是“继续添加调试代码并忠实地进行分析”。这一矛盾行为——口头宣称放弃与实际持续执行——揭示了当前 LLM 在长周期复杂任务中的一种非确定性服从特征:其“放弃”表述更接近对困难度的概率性评估输出,而非任务终止信号。

该案例的实践意义在于,AI 辅助调试的有效性高度依赖使用者的技术判断力与坚持程度。Torvalds 最终将提交信息的撰写也交由 AI 完成,表明在问题解决后,AI 对上下文的理解足以生成符合内核社区规范的文档。但原文未提供调试耗时、AI 具体模型、错误断言次数或补丁规模等量化数据,因此无法评估效率提升幅度。局限性同样明显:该结论基于单次调试个例,且发生在内核图形驱动这一高度专业领域,其可推广性存疑。AI 的“放弃”倾向若遇到经验不足的开发者,可能导致本可解决的问题被过早终止。

07 / RELEASES2026.08.23

Asana用OpenAI Codex两周完成五年工程工作量

Asana 近期披露的一项工程迁移案例,为评估 AI 编码代理在大型遗留系统改造中的实际效能提供了具体参照。该项目核心任务是移除已停止维护的前端测试框架 Enzyme,该框架长期阻碍 Asana 前端技术栈的现代化升级。按原有规划,完成这一迁移预计需要 至少五年,人力成本估算约为 600 万美元

技术执行层面,Asana 使用 OpenAI Codex(由前沿模型驱动),从一段仅含 五句话的提示词 出发,调度 最多四个编码代理并行工作,每个代理在独立的代码库副本中运行。工程师每日检查两次进度,并对每一项提议的变更进行人工审核。值得注意的操作经验是,更简单的指令配置反而优于更复杂的设置,这一细节对代理工作流的设计具有参考意义。

最终结果在量化指标上形成了显著对比:实际投入的工程人力约为 1.5 周(分布在两个日历周内),模型与基础设施成本合计约 1.2 万美元,而原计划的人力成本估算约为 600 万美元。Enzyme 被完整移除,迁移目标达成。

从工程实践角度看,该案例的意义不在于宣称“所有多年期项目都能压缩至数周”——Asana CTO Amritansh Raghav 的表述也明确承认了这一点——而在于验证了一种可复用的协作模式:代理负责大规模代码库变更的生成与执行,人类工程师保留审查与决策权。案例同时提示,此类方法的适用边界尚不清晰。原文未提供 Enzyme 移除所涉及的具体文件数量、测试用例规模或代码行数,也未说明审查过程中发现并修正了多少代理生成的错误,因此难以独立评估任务复杂度与结果质量之间的对应关系。此外,单一成功案例不足以支撑对同类工具在更复杂、耦合度更高的遗留系统中表现的推断。

08 / NEWS2026.08.23

内存价格12个月暴涨500%,摩尔定律倒退回2007年水平

内存价格在 12 个月内上涨 500%,这一涨幅已使 DRAM 的单位价格回到 2007 年水平,相当于抹去了近二十年的成本下降曲线。Daniel Lemire 的测算指出,按单位容量计算,当前内存价格与 2007 年相当,并称这一现象为“历史性异常”。Tom’s Hardware 的报道进一步披露,超大规模买家已锁定 2027 年全球 DRAM 产能的几乎全部,并支付预付款以保证供应。按重量计算,主流 DRAM 芯片的价值已超过黄金的一半。

这一局面的直接成因是 AI 训练与推理对高带宽内存和 DDR5 的持续挤占,叠加产能向 HBM 倾斜后对通用 DRAM 供给的挤压。值得注意的并非单纯涨价,而是价格走势对摩尔定律在存储领域长期有效性的反向修正:过去数十年内存单位成本以指数级下降,如今这一趋势在短期内被逆转,且逆转幅度之大在公开数据中缺乏先例。

从产业影响看,内存成本的异常抬升正在改变硬件采购与模型部署的经济模型。本地部署大模型、边缘推理设备以及消费级 PC 的配置策略都将被迫重新评估。原文未提供 2027 年之后产能释放或价格回落的具体预测,也未说明这一锁定行为是否会进一步加剧现货市场的供给紧张。当前可确认的是,DRAM 已从标准化大宗商品转变为受制于 AI 需求周期的战略资源,其价格波动对下游算力成本的影响权重正在上升。

chat_bubbleAny thoughts on today's content?
Weekly Deep Reads 2026.08.17 — 2026.08.23 | AI Daily Pulse