Карта мировых frontier-моделей в ИИ
*********
см. также Вадимир Петросян. Программа лидерства России в сфере ИИ. т. 1 http://proza.ru/2026/09/10/1786
********
© В.К. Петросян (Вадимир) © Lag.ru [Large Apeironic Gateway, Большой Апейронический Портал (Шлюз), Суперпортал в Бесконечность].
При копировании данного материала и размещении его на другом сайте, ссылки на соответствующие локации порталов Lag.ru и Proza.ru обязательны
Работа написана на основе концепции и разработок В.К. Петросяна при творческом и техническом участии ChatGPT 5.6. Thinking, Sol - Демичат Сапиенс (Саппи), Солярис.
*********
1. Что считать frontier-моделью
Понятие frontier-модели нельзя отождествлять с любой крупной современной нейросетью.
В рамках настоящей Доктрины frontier-моделью следует считать систему, находящуюся у текущей границы практически достигнутых и воспроизводимо измеряемых возможностей искусственного интеллекта хотя бы по нескольким стратегически значимым классам задач.
К ним относятся:
reasoning;
программирование;
агентная деятельность;
научное мышление;
работа с большими контекстами;
мультимодальность;
использование инструментов;
длительное выполнение сложных задач.
При этом мировой frontier уже нельзя представить в виде единственной линейки:
модель A > модель B > модель C.
Одна система может быть сильнее в программировании.
Другая — в автономной агентной работе.
Третья — в научных задачах.
Четвёртая — значительно дешевле при близком качестве.
Пятая — иметь открытые веса и поэтому предоставлять принципиально большие возможности для независимого развития.
Поэтому корректнее говорить не об одной вершине, а о многомерном модельном frontier.
2. Текущая независимая срезка frontier
Одним из наиболее оперативных независимых источников сопоставления ведущих моделей является Artificial Analysis.
По состоянию на 7 сентября 2026 года версия Intelligence Index 4.3 объединяет десять оценочных систем, относящихся к агентным задачам, программированию, общему интеллектуальному качеству и научному reasoning. В этой версии лидируют Claude Fable 5.1 и GPT-6 Astra с одинаковым интегральным баллом 53. Далее следуют Claude Opus 5, Claude Fable 5, Muse Spark 1.3 и GPT-5.6 Sol.
Модель Лаборатория Центр экосистемы Intelligence Index v4.3
Claude Fable 5.1 Anthropic США 53
GPT-6 Astra OpenAI США 53
Claude Opus 5 Anthropic США 51
Claude Fable 5 Anthropic США 50
Muse Spark 1.3 Meta США 48
GPT-5.6 Sol OpenAI США 47
Эта таблица не означает абсолютного превосходства одной системы над другой во всех возможных задачах. Artificial Analysis прямо показывает различия между лидерами: Claude Fable 5.1 и GPT-6 Astra получают одинаковый общий балл, но имеют различные сильные стороны на составляющих benchmark. Кроме того, в cost–intelligence frontier располагаются системы, которые не обязательно имеют максимальный абсолютный балл.
Это принципиально важно:
frontier модели — это уже не одна точка, а поверхность компромиссов между интеллектом, стоимостью, скоростью, автономностью, надёжностью и специализацией.
3. Американский закрытый frontier
В сентябре 2026 года абсолютная вершина рассматриваемой независимой срезки преимущественно представлена американскими лабораториями.
OpenAI
GPT-6 Astra выпущена 3 сентября 2026 года как новая наиболее мощная модель OpenAI для сложной end-to-end работы, включая reasoning, coding, research и computer use.
Anthropic
Claude Fable 5.1 представлена 1 сентября 2026 года как наиболее сильная модель Anthropic для программирования и сложной интеллектуальной работы; одновременно Anthropic сохраняет в frontier-линейке Claude Opus 5 и Claude Fable 5.
Meta
Muse Spark 1.3 представлена 2 сентября 2026 года и в текущем Artificial Analysis v4.3 занимает одну из верхних позиций общего frontier.
Gemini 3.8 Flash представлена 2 сентября 2026 года как новая модель Gemini для программирования, сложного reasoning и агентных workflow. Её положение зависит от конкретного режима и benchmark, что ещё раз показывает невозможность свести мировой frontier к одному универсальному рейтингу.
xAI
Grok 4.6 выпущена 12 августа 2026 года с особым акцентом на long-running agents, работу с кодовыми базами, исследовательские процессы и многошаговые задачи.
Таким образом, американская модельная экосистема отличается не только наличием одного лидера.
Её главное преимущество — множественность независимых frontier-лабораторий, конкурирующих одновременно.
Это существенно устойчивее модели национального лидерства, основанной на одном сильном разработчике.
4. Китайский frontier
Китайская модельная система в 2025–2026 годах существенно приблизилась к американской.
По данным Stanford AI Index 2026, ещё в марте 2026 года верхняя группа Arena включала Anthropic с Elo 1503, xAI — 1495, Google — 1494, OpenAI — 1481, Alibaba — 1449 и DeepSeek — 1424. Stanford оценивал разрыв между лучшей американской и лучшей китайской моделью примерно в 2,7%, отмечая, что модели двух стран с начала 2025 года неоднократно менялись местами на вершине отдельных performance comparisons.
К сентябрю конкретные модели уже сменились, но структурный вывод сохраняется:
Китай сформировал второй самостоятельный центр производства передовых моделей.
Его особенностью становится особенно сильная линия open-weight и относительно открытых моделей.
5. Open-weight frontier
В Artificial Analysis v4.3 верхняя открытая группа представлена прежде всего китайскими системами.
Модель Разработчик Страна Intelligence Index v4.3 Особенность
GLM-5.3 max Z AI Китай 45 одна из наиболее сильных открытых линий
Kimi K3 max Moonshot AI Китай 44 крупная open-weight MoE-модель
GLM-5.3 Flash Z AI Китай 42 высокая эффективность относительно стоимости
Qwen3.8 2.4T A95B Alibaba Китай 40 2,4 трлн параметров, около 95 млрд активных
DeepSeek V4 Pro 0813 max DeepSeek Китай 36 сильная агентная линия
Текущие значения GLM, Kimi, Qwen и DeepSeek относятся к новой версии индекса; их нельзя непосредственно сравнивать с баллами прежних версий Artificial Analysis, поскольку набор тестов изменялся. Например, нынешняя оценка Kimi K3 составляет 44, тогда как в июльской версии индекса та же линия оценивалась иначе.
GLM-5.3 Flash имеет 320 млрд суммарных и около 18 млрд активных параметров, контекст около 1 млн токенов и открыт под MIT-лицензией.
Qwen3.8-2.4T-A95B — крупная MoE-система Alibaba с 2,4 трлн суммарных и примерно 95 млрд активных параметров; её открытые веса опубликованы в августе 2026 года.
Kimi K3 использует около 2,8 трлн суммарных и 104 млрд активных параметров и также относится к ведущей open-weight группе.
Таким образом, к сентябрю 2026 года возникает важная структурная картина:
абсолютная верхушка одной из наиболее комплексных независимых оценок сосредоточена у американских закрытых систем, тогда как китайские лаборатории образуют особенно сильный open-weight frontier.
Это стратегически существенно, поскольку открытые веса позволяют значительно большему числу государств и исследовательских центров проводить:
дообучение;
модификацию;
архитектурные эксперименты;
интеграцию;
исследования безопасности.
6. Frontier нельзя измерять только общим баллом
Для стратегической карты моделей необходимо выделять по меньшей мере восемь осей.
Интеллектуальная мощность
Комплексный reasoning и решение сложных задач.
Агентность
Способность выполнять длительные последовательности действий с инструментами.
Программирование
Работа с реальными программными проектами, а не только генерация отдельных функций.
Научное мышление
Работа с задачами высокой сложности, гипотезами, математикой и научными данными.
Мультимодальность
Текст.
Изображение.
Видео.
Аудио.
Интерфейс компьютера.
Физические действия через роботов.
Контекст и память
Способность работать с крупными объёмами информации и сохранять устойчивость на длинных траекториях.
Стоимость интеллектуального действия
Критически важный показатель массового масштабирования.
Открытость
Доступны ли:
API;
веса;
архитектура;
возможность локального запуска;
возможность независимого исследования.
Следовательно, будущая карта должна быть векторной, а не одномерной.
Модель может уступать несколько баллов по абсолютному интеллекту, но быть гораздо более стратегически важной из-за:
открытости;
стоимости;
эффективности;
возможности модификации.
7. Сжатие разрывов между ведущими лабораториями
Stanford AI Index фиксировал уже в марте 2026 года четыре ведущие компании в диапазоне всего 25 Elo-пунктов и подчёркивал быстрое насыщение benchmark: Humanity’s Last Exam за год показал рост frontier-показателей примерно на 30 процентных пунктов.
Это имеет важное стратегическое следствие.
Если стандартный benchmark быстро насыщается, лидерство всё меньше определяется способностью:
получить ещё несколько пунктов на старом тесте.
Всё большее значение приобретают:
новые классы задач;
агентная надёжность;
длительные траектории;
реальный scientific capability;
новые архитектуры;
новые benchmark.
Именно здесь появляется пространство для следующего frontier.
8. Положение России
В России существуют собственные крупные модельные линии.
Яндекс в апреле 2026 года характеризовал Alice AI LLM как свою наиболее мощную языковую модель и сообщал о масштабе в сотни миллиардов параметров.
Sber в июле 2026 года предоставлял GigaChat 3 Ultra как актуальную крупную модель семейства GigaChat.
Это важные компоненты российского ИИ-суверенитета.
Однако в используемой здесь международной независимой срезке Artificial Analysis v4.3 российские модели не представлены в верхней мировой группе.
Это необходимо трактовать точно.
Отсутствие модели среди лидеров данного benchmark не доказывает её слабость на всех возможных задачах.
Но оно также не позволяет утверждать, что модель принадлежит абсолютному мировому frontier без сопоставимых независимых данных.
Следовательно:
наличие собственной большой модели означает технологическую субъектность; принадлежность к frontier требует международно сопоставимого доказательства.
9. Российская задача на модельном frontier
Россия должна одновременно решать три задачи.
Первая — сокращать разрыв нынешних моделей
Необходимо иметь достаточно сильные:
LLM;
мультимодальные модели;
reasoning models;
агентные системы,
чтобы собственная инфраструктура могла работать на современном уровне.
Вторая — максимально использовать мировой open-weight frontier
Открытые модели создают возможность:
исследовать;
адаптировать;
модифицировать
передовые архитектуры без необходимости заново повторять весь мировой объём pretraining.
Третья — искать следующий архитектурный класс
Именно здесь возникает LPM.
Российская стратегическая траектория может выглядеть:
конкурентоспособная LLM
;
гибрид LLM + LPM
;
LPM/MetaLPM как самостоятельный структурный слой
;
LPM-native СИИ и ИМИ.
Но этот переход будет иметь значение только при доказанном преимуществе.
10. Главный вывод карты frontier-моделей
Текущий мировой модельный frontier характеризуется пятью признаками.
Во-первых, он развивается чрезвычайно быстро.
Во-вторых, абсолютная вершина остаётся преимущественно американской.
В-третьих, Китай сформировал мощный независимый центр и особенно сильный open-weight frontier.
В-четвёртых, различия между ведущими системами становятся многомерными и всё хуже описываются одним benchmark.
В-пятых, следующий крупный скачок может произойти уже не только через масштабирование существующей архитектуры, но через появление нового класса интеллектуальных систем.
Именно поэтому для России задача должна формулироваться не как:
«создать ещё одну модель в существующей таблице».
А как двойная программа:
создать модели, достаточно сильные для участия в сегодняшнем frontier, и одновременно экспериментально искать архитектуру, способную изменить саму таблицу.
Свидетельство о публикации №226091001816