---
id: 20260819-T0-02
title: "BCMT架构：块级因果记忆让Transformer摆脱平方级计算"
title_en: "BCMT: Blockwise Memory Architecture Beats Quadratic Attention"
url: https://ai.daily.yangsir.net/daily/20260819-T0-02
issue_date: 2026-08-19
publish_date: 2026-08-18T04:00:00.000Z
category: research
source_name: "arXiv cs.CL (NLP)"
source_url: https://arxiv.org/abs/2608.13578
---

# BCMT架构：块级因果记忆让Transformer摆脱平方级计算

arXiv新论文提出BCMT（Blockwise Causal Memory Transformer），一种专为长序列设计的新型Transformer架构。标准自注意力机制的计算复杂度随序列长度呈二次增长，BCMT通过块级因果记忆替代密集自注意力，有效降低长序列处理的计算开销，为大模型处理超长上下文提供了更高效的架构选择。

## English Version

**BCMT: Blockwise Memory Architecture Beats Quadratic Attention**

A new arXiv paper introduces BCMT (Blockwise Causal Memory Transformer), a novel architecture designed for long sequences. Standard self-attention has quadratic complexity with sequence length; BCMT replaces dense attention with blockwise causal memory, significantly reducing computational cost. This offers a more efficient architecture choice for LLMs handling ultra-long contexts.

---

**来源**：[arXiv cs.CL (NLP)](https://arxiv.org/abs/2608.13578)

**详情页**：https://ai.daily.yangsir.net/daily/20260819-T0-02

---

*智语观潮 · Daily — https://ai.daily.yangsir.net/llms.txt*