commit history@c0mmit P.49

commit history

У hugging face вышел качественный тех репорт о том, как они собирали свой датасет fineweb. Это набор дампов common-crawl(архив страниц из интернета), который почистили и превратили в 15T токенов на английском.

Почему круто. Common-crawl – это основной источник данных для претрейна LLM, если ты не open ai или antropic с собственными краулерами и парсерами. Его все по разному обрабывают или используют его производные. Обычно эти производные датасеты получены путем применения простых эваристик и максимум какой-то маленькой LM, обученной на википедии.

Но репортов с экспериментами на данных на таком масштабе с подробным описанием почти нет. А тут ребята 100k+ h100 gpu часов потратили на все и подробно описали.

Еще они выложили сабсет образовательных документов из кроула. Такой масштаб фильтрации классификаторами в open-source еще никто не выкладывал. И это как раз тот датасет, которым никто не делится (ни лама, ни мистраль, ни китайцы вроде qwen), но который все делают.

Все в статье, это по сути ровно то, чем моя команда занимается.
Тут и про экстракцию кроула, и про фильтрацию, и про дедупликацию, и про классификаторы.

P.S. Если на этом посте наберется хотя бы 1 огонек – напишу разбор репорта с комментариями.

huggingface.co

FineWeb: decanting the web for the finest text data at scale - a Hugging Face Space by HuggingFaceFW

Discover amazing ML apps made by the community

www.tgoop.com/c0mmit/49

4.4K viewsedited Jun 2, 2024 at 13:47

tgoop.com/c0mmit/49

Create: 2024-06-02
Last Update: 2025-04-05 14:29:25

BY commit history

Share with your friend now:
tgoop.com/c0mmit/49

Telegram News

У hugging face вышел качественный тех репорт о том