小米MiMo-V2.6-Pro开源:1T参数A42B,训练成本仅300万美元
小米MiMo-V2.6-Pro开源:1T参数A42B,训练成本仅300万美元
小米发布MiMo-V2.6-Pro,成为新的顶级开源权重模型,采用1T总参数、42B激活参数架构,训练成本仅300万美元。该模型来自中国前沿实验室,标志着开源模型竞争加剧。开发者可免费获取权重进行研究和应用。
Claude Opus 5.5、GPT-6 Sol/Luna同日发布,AI模型价格战开打
Anthropic发布Claude Opus 5.5,约一小时后OpenAI发布GPT-6 Sol和GPT-6 Luna,此前一天还有Grok 4.7和小米MiMo v2.6 Flash/Pro。Simon Willison表示,这些新模型性能还需时间评估,但初步印象是竞争激烈、价格战已开启。多款前沿模型同日发布,开发者选择增多,但需要时间对比实际表现。
Claude Code v2.1.280发布:默认模型升级为Opus 5.5,支持100万上下文
Claude Code发布v2.1.280,新增Claude Opus 5.5并设为默认Opus模型,支持100万token上下文,定价为每百万token输入4美元、输出20美元,缓存读取每百万token 0.2美元。全屏模式下更多列表支持鼠标操作:滚轮可滚动/skills列表,/plugin中的技能状态选项可点击。新增CLAUDE_环境变量。
OpenAI发布GPT-6 Sol和Luna,主打不同能力与成本平衡
OpenAI正式推出GPT-6 Sol和GPT-6 Luna两款新模型,定位为将前沿智能带入日常工作场景。两款模型在能力和成本之间提供不同的平衡方案,用户可根据任务需求选择。Sol和Luna的具体参数、定价及可用渠道尚未在公告中详细披露。开发者可关注OpenAI平台后续更新的接入方式,以便在实际应用中根据预算和性能要求选择合适的模型。
长上下文模型会“中毒”:无关上下文越多,越找不到关键证据
一篇新论文提出“上下文中毒”现象:大模型虽然能处理越来越长的提示,但当无关或易混淆的内容增加时,定位并使用关键证据的能力会下降。作者将其建模为极值注意力干扰问题,从注意力机制层面解释这一退化。该研究对依赖长文档问答、法律与医疗检索等场景有直接参考价值,提示开发者不能只看上下文窗口大小,还要关注模型在噪声环境下的实际检索能力。
五角大楼:过度依赖AI导致伊朗学校遭导弹误击
五角大楼承认,对AI系统的过度依赖是导致伊朗一所学校遭导弹袭击的因素之一。该事件引发对军事AI应用风险的关注。HN上讨论热烈,评论数达183条。具体细节和责任归属尚待进一步调查。
斯坦福R&DE用AI把学生种族换脸用于广告宣传
据Stanford Review报道,斯坦福大学住宅与餐饮服务部门(R&DE)使用AI技术对学生的照片进行种族替换,用于广告宣传材料。该报道在Hacker News上引发关注,获得81个点赞和60条评论。事件涉及AI生成内容在高校宣传中的伦理问题,包括未经同意修改学生形象以及种族表征的敏感性。
训练OpenAI AI的人因用AI训练AI被解雇
据404 Media报道,为OpenAI训练AI模型的人员因使用AI来完成训练AI的工作而被解雇。该事件在Hacker News上获得71个点赞和53条评论。报道揭示了AI训练工作中存在的效率压力与质量控制之间的矛盾:工人可能借助AI工具加快标注或生成任务,但这与训练数据的真实性要求相冲突。
Sitefire 训练模型:仅凭网页结构判断内容是否由 AI 生成
Sitefire(YC W26)团队发布一项实验:训练模型仅根据网页的 HTML 结构特征,判断页面内容是否由 AI 生成,不依赖文本语义分析。两位创始人分别有斯坦福强化学习/优化和图慕尼黑工业大学的软件工程背景。该公司主要帮助营销团队在 AI 搜索中获得推荐。对内容平台和 SEO 从业者来说,这种基于结构的检测思路提供了一种不依赖文本模型的新判别路径,可用于内容审核或质量评估。
AI·rete·RAG:用规则引擎做决策,RAG负责解释原因
开发者发布ai·rete·rag项目,解决团队在贷款、欺诈检测、临床分诊等需可审计决策场景中先让LLM决策再补护栏的问题。该方案将两者串联:先用纯Python Rete引擎对YAML规则和事实进行求值做出决策,再通过RAG生成解释。这样决策过程可审计、可追溯,同时保留自然语言解释能力。适合对合规性和可解释性有要求的AI应用开发者。
PlaceReasoner-Beta:用推理做芯片宏单元布局,并给出评测基准
VLSI物理设计中的宏单元自动布局长期依赖人工设计的代理目标(如估算线长),效果有限。研究者发布PlaceReasoner-Beta,把布局问题改为由推理驱动,并配套推出基准测试,用于衡量模型在真实布局约束下的表现。相较以往只优化代理指标的做法,该工作强调可解释的推理过程与可复现的评测。对芯片设计团队而言,这意味着多了一个可对比的方案与评测集,便于判断推理式布局是否优于传统代理优化方法。
Parallel用GPT-6 Astra将研究时间和成本各砍一半
Parallel公司使用OpenAI的GPT-6 Astra模型,让其agent在劳动力市场数据的研究和综合任务上,相比此前使用的模型,时间和成本均降低50%。GPT-6 Astra在agent工作流中展现出更高的效率,使Parallel能够以更低开销完成数据密集型研究任务。该案例表明GPT-6 Astra在需要大量信息处理和综合的agent场景中具有实际的成本效益优势。
GPT-6提示缓存升级:命中率更高、延迟和成本更低
OpenAI为GPT-6升级提示缓存功能,提升缓存命中率,新增诊断工具、显式断点和控制选项,降低延迟和成本。开发者可以更精细地管理缓存行为,减少重复计算。实际影响是API调用更便宜、响应更快,尤其适合高频重复提示的场景。
llm 0.36发布:新增GPT-6两个模型,支持单轮对话插件声明
Simon Willison的llm工具发布0.36版本,新增对OpenAI GPT-6 Sol(gpt-6-sol)和GPT-6 Luna(gpt-6-luna)两个模型的支持。模型插件现在可以声明supports_conversation = False,用于仅接受单轮提示的模型;当这些模型收到assistant或tool历史记录时,LLM会抛出llm.ConversationNotSupported异常。该更新让开发者能更精确地控制模型对话行为,避免在不支持多轮对话的模型上误传历史消息。
llm-anthropic 0.29发布:新增Claude Opus 5.5支持
Simon Willison的llm-anthropic插件发布0.29版本,新增对Anthropic Claude Opus 5.5模型的支持。用户可通过命令行直接调用:llm -m claude-opus-5.5 “prompt goes here”。该更新让llm工具的用户能够方便地使用Anthropic最新旗舰模型进行推理和测试。
AI写的短视频脚本一眼就能看出来?这些套路太明显了
Simon Willison引用@therealcornpop的帖子指出,用AI写TikTok和YouTube脚本很容易被识别。典型特征包括:"不是X,而是Y"的句式、三连排比、以及断断续续的怪异节奏感。这些AI写作痕迹已成为观众识别AI生成内容的信号。对于内容创作者来说,如果希望脚本不被识破,需要避免这些模式化的表达方式。
谷歌奥斯卡得主John Platt谈AI科研:用算法自动发现科学规律
谷歌研究员John Platt曾凭《蜘蛛侠2》获奥斯卡技术奖,如今专注AI for Science。他在采访中讨论了如何用机器学习自动发现科学规律、应对气候变化,以及超级智能时代人类如何参与科研。Platt认为,AI可以加速材料发现和气候建模,但需要人类设定研究方向。他提到,未来科学家的角色将转向提出问题和验证AI发现,而非手动计算。
通用多模态基础模型:一次部署,支持新增模态和多种任务
现有大多数多模态融合模型在部署后只能处理预设模态(如视觉、文本、音频)和单一任务,难以快速适配新场景。一篇新论文提出“通用多模态基础模型”,目标是在部署后仍能支持新增模态和多种任务。该方向若成熟,可减少为每个新模态或新任务重新训练模型的成本,对需要快速接入新数据类型的应用团队有实际意义。目前仍属研究阶段,尚未看到开源实现或产品化信息。
AdaMem:RAG软压缩中的自适应记忆token分配方案
arXiv新论文提出AdaMem,针对检索增强生成(RAG)中处理大量长段落成本高且易引入干扰信息的问题。该方法通过软压缩将段落编码为紧凑序列,并自适应分配记忆token,以在压缩率和信息保留之间取得更好平衡。AdaMem旨在降低RAG的推理开销,同时减少无关内容对生成质量的干扰,对需要处理长文档的RAG应用有参考价值。
TreeSpark:面向半自回归推测解码的校准负载自适应草稿树
arXiv新论文提出TreeSpark,针对推测解码中草稿模型生成候选token的效率问题。现有块草稿器通过单次骨干网络前向传播生成整块草稿token,TreeSpark进一步引入校准和负载自适应的草稿树结构,以提升半自回归推测解码的验证效率和推理加速效果。该方法旨在降低语言模型推理延迟,对需要高吞吐推理的LLM部署场景有潜在价值。