---
id: 20260621-T0-06
title: "LLM预训练数据的叙事内容分析：基于Dolma 3T tokens的研究"
title_en: "Characterizing Narrative Content in Web-scale LLM Pretraining Data"
url: https://ai.daily.yangsir.net/daily/20260621-T0-06
issue_date: 2026-06-21
publish_date: 2026-06-20T04:00:00.000Z
category: research
source_name: "arXiv cs.CL (NLP)"
source_url: https://arxiv.org/abs/2606.19468
---

# LLM预训练数据的叙事内容分析：基于Dolma 3T tokens的研究

arXiv新论文首次对网络规模LLM预训练语料库（Dolma）中的叙事特征进行了细粒度研究。分析了叙事在人类沟通及模型训练中的作用。

## English Version

**Characterizing Narrative Content in Web-scale LLM Pretraining Data**

A new arXiv paper presents the first fine-grained study of narrative features in the Dolma 3-trillion-token open corpus. It characterizes narrative content in web-scale pretraining data.

---

**来源**：[arXiv cs.CL (NLP)](https://arxiv.org/abs/2606.19468)

**详情页**：https://ai.daily.yangsir.net/daily/20260621-T0-06

---

*智语观潮 · Daily — https://ai.daily.yangsir.net/llms.txt*