Ivan Begtin@begtin P.6175

BEGTIN Telegram 6175

Common Corpus [1] свежий дата продукт от Hugging Face с данными для обучения.

Внутри 2 триллиона токенов, а сам он построен на:

📦 OpenCulture: 926 миллиардов токенов из книг в открытом доступе
📦 OpenGovernment: 388 миллиардов токенов из финансовых и юридических документов
📦 OpenSource: 334 миллиарда токенов открытого кода, отфильтрованного по критериям качества
📦 OpenScience: 221 миллиард токенов из репозиториев открытой науки
📦 OpenWeb: 132 миллиарда токенов на контенте из сайтов с пермиссивной лицензией (Википедия и др.)

Можно обратить внимание что открытых данных нет в списке, но там был бы обучающий набор поменьше.

Корпус это огромен, в нём около 40% английского языка и много других язык.

Внутри всё состоит из бесконечно числа parquet файлов.

Ссылки:
[1] https://huggingface.co/blog/Pclanglais/two-trillion-tokens-open

#opendata #ai #datasets

www.tgoop.com/begtin/6175

543 viewsIvan Begtin, edited Nov 14 at 11:00

tgoop.com/begtin/6175

Create: 2024-11-14
Last Update: 2024-11-15 20:34:48

Common Corpus [1] свежий дата продукт от Hugging Face с данными для обучения.

Внутри 2 триллиона токенов, а сам он построен на:

📦 OpenCulture: 926 миллиардов токенов из книг в открытом доступе
📦 OpenGovernment: 388 миллиардов токенов из финансовых и юридических документов
📦 OpenSource: 334 миллиарда токенов открытого кода, отфильтрованного по критериям качества
📦 OpenScience: 221 миллиард токенов из репозиториев открытой науки
📦 OpenWeb: 132 миллиарда токенов на контенте из сайтов с пермиссивной лицензией (Википедия и др.)

Можно обратить внимание что открытых данных нет в списке, но там был бы обучающий набор поменьше.

Корпус это огромен, в нём около 40% английского языка и много других язык.

Внутри всё состоит из бесконечно числа parquet файлов.

Ссылки:
[1] https://huggingface.co/blog/Pclanglais/two-trillion-tokens-open

#opendata #ai #datasets

BY Ivan Begtin

Share with your friend now:
tgoop.com/begtin/6175

Open in Telegram

Telegram News

Date: 2024-11-15|

Healing through screaming therapy Add the logo from your device. Adjust the visible area of your image. Congratulations! Now your Telegram channel has a face Click “Save”.! Telegram desktop app: In the upper left corner, click the Menu icon (the one with three lines). Select “New Channel” from the drop-down menu. Deputy District Judge Peter Hui sentenced computer technician Ng Man-ho on Thursday, a month after the 27-year-old, who ran a Telegram group called SUCK Channel, was found guilty of seven charges of conspiring to incite others to commit illegal acts during the 2019 extradition bill protests and subsequent months. As of Thursday, the SUCK Channel had 34,146 subscribers, with only one message dated August 28, 2020. It was an announcement stating that police had removed all posts on the channel because its content “contravenes the laws of Hong Kong.”
from us

Telegram Ivan Begtin
FROM American