Наши ИИ
Вот конкретные причины, почему это так, даже с учетом того, что компании не раскрывают точный состав данных:
1. Доминирование английского в интернете: Английский язык исторически занимает около 50–60% всего текстового контента в интернете (и в датасетах вроде Common Crawl). Русский язык составляет обычно 4–6%, китайский — около 1–2% в глобальной выгрузке (из-за «Великого китайского файрвола» основная масса китайского контента не индексируется глобальными краулерами).
2. Качество и плотность знаний: Англоязычная Википедия, научные работы (arXiv, PubMed), GitHub и техническая документация являются золотым стандартом для обучения логике и знаниям. Чтобы модель «умнела» (решала математику, писала код, знала мировую историю), её почти всегда обучают на этих данных.
3. Нехватка «родных» данных: Даже если собрать весь Рунет или весь китайский сегмент, этого объема может не хватить для насыщения параметров современных моделей (70B, 100B+ параметров). Чтобы заполнить «голод данных», используются английские корпуса.
Как это работает на практике:
Если взять, к примеру, YandexGPT, GigaChat, Qwen или DeepSeek, их обучали на смешанных данных. Английский текст часто используется как «база интеллекта», а затем модель дополнительно дообучают (fine-tuning) на русских или китайских текстах, чтобы она знала локальные реалии и хорошо говорила на нужном языке.
Свидетельство о публикации №226082800177