---
id: 20260910-T0-18
title: "Data Scout：为小众领域定制的定向网络爬虫"
title_en: "Data Scout: Targeted Web Crawling Solves Sparse Domain Pretraining Data"
url: https://ai.daily.yangsir.net/daily/20260910-T0-18
issue_date: 2026-09-10
publish_date: 2026-09-09T04:00:00.000Z
category: research
source_name: "arXiv cs.LG (ML)"
source_url: https://arxiv.org/abs/2609.05766
---

# Data Scout：为小众领域定制的定向网络爬虫

构建特定领域预训练语料通常依赖过滤CommonCrawl等大规模网络档案，但这对小众、专业领域效果不佳，因为相关内容稀疏且难寻。新研究提出Data Scout，一种定向网络爬虫方法，主动寻找并抓取特定领域相关网页，为构建高质量专业预训练数据集提供了补充路径。

## English Version

**Data Scout: Targeted Web Crawling Solves Sparse Domain Pretraining Data**

Building domain-specific pretraining corpora usually involves filtering massive archives like CommonCrawl, which fails for specialized domains with sparse content. Data Scout is a targeted web crawling approach that actively discovers relevant pages, offering a new path to construct high-quality datasets for niche domains.

---

**来源**：[arXiv cs.LG (ML)](https://arxiv.org/abs/2609.05766)

**详情页**：https://ai.daily.yangsir.net/daily/20260910-T0-18

---

*智语观潮 · Daily — https://ai.daily.yangsir.net/llms.txt*