---
id: 20260828-T0-03
title: "免训练加速MoE推理，ExFold统一专家折叠方案发布"
title_en: "ExFold: Training-Free MoE Inference Acceleration via Expert Folding"
url: https://ai.daily.yangsir.net/daily/20260828-T0-03
issue_date: 2026-08-28
publish_date: 2026-08-27T04:00:00.000Z
category: research
source_name: "arXiv cs.LG (ML)"
source_url: https://arxiv.org/abs/2608.24938
---

# 免训练加速MoE推理，ExFold统一专家折叠方案发布

arXiv 新论文提出 ExFold，一种无需训练的 MoE 模型推理加速方案。它通过统一专家折叠技术，同时优化预填充（Prefill）和解码（Decode）阶段的性能瓶颈。该方法不改变模型权重，可直接应用于现有模型，有望显著降低 MoE 模型的服务延迟。

## English Version

**ExFold: Training-Free MoE Inference Acceleration via Expert Folding**

A new arXiv paper introduces ExFold, a training-free acceleration method for Mixture-of-Experts (MoE) models. By unifying expert folding, it optimizes both prefill and decode phases without altering model weights, offering a direct way to reduce serving latency for existing MoE models.

---

**来源**：[arXiv cs.LG (ML)](https://arxiv.org/abs/2608.24938)

**详情页**：https://ai.daily.yangsir.net/daily/20260828-T0-03

---

*智语观潮 · Daily — https://ai.daily.yangsir.net/llms.txt*