Методологической основой обзора служит анализ первичных источников: официальных анонсов и системных карточек (system cards) разработчиков, технических отчётов, рецензируемых публикаций, документов регуляторов и раскрытий по сделкам. Вторичные источники использовались исключительно для навигации, но не как источник численных фактов.
Принципиальным методологическим требованием является разграничение данных, заявленных самими разработчиками (self-reported), и независимо проверенных результатов. В качестве порога пересмотра вывода принято расхождение независимой оценки с заявленной разработчиком более чем на ~5 процентных пунктов.
К началу 2026 года фронтир делят три компании — OpenAI, Google DeepMind и Anthropic, — за которыми с разной дистанцией следуют Meta, xAI и Microsoft.
OpenAI. Флагман — GPT-5.5 (кодовое имя «Spud»), выпущенный 23 апреля 2026 года; это первая полностью переобученная базовая модель со времён GPT-4.5, нативно мультимодальная, с контекстом до 1 млн токенов в API. Оценка компании достигла $852 млрд после раунда на $122 млрд (31 марта 2026) [3, 4].
Google DeepMind. Флагман — Gemini 3.1 Pro (19 февраля 2026). Gemini 3 Pro на момент выпуска возглавил LMArena (1501 Elo) и показал 91,9% на GPQA Diamond; Gemini 3.1 Pro более чем вдвое улучшил результат на ARC-AGI-2 (77,1%) [5].
Anthropic. Флагман — Claude Opus 4.8 (28 мая 2026). Opus 4.5 стал первой моделью, преодолевшей 80% на SWE-bench Verified. По оценке в $965 млрд после раунда Series H на $65 млрд Anthropic впервые превзошёл OpenAI [6, 7, 8].
Meta, xAI, Microsoft. Meta выпустила первую проприетарную фронтир-модель Muse Spark (8 апреля 2026). xAI объединилась со SpaceX с целевой оценкой IPO $1,75–2 трлн. Microsoft действует преимущественно через партнёрство с OpenAI с сообщаемой выручкой от ИИ порядка $13 млрд.
3.1. Индустриальные лидеры
Понятие искусственного интеллекта общего назначения (Artificial General Intelligence, AGI) обычно определяют как системы, способные решать широкий класс интеллектуальных задач на уровне компетентного человека и переносить навыки между предметными областями без целевого переобучения. От «узкого» ИИ AGI отличается универсальностью, от гипотетического сверхинтеллекта (ASI) — отсутствием систематического превосходства над человеком. На практике строгого, операционализируемого и общепринятого критерия достижения AGI не существует, что делает любые заявления о его «достижении» предметом методологической осторожности.
Период с 2024 по первую половину 2026 года стал переломным: центр тяжести разработки окончательно сместился от академических коллективов к индустрии, а решающими факторами конкуренции наряду с архитектурой модели стали капитал, доступ к вычислительным ресурсам и качество внутренних систем оценки.
Ключевой тезис: к середине 2026 года гонка перешла в фазу «многополярного паритета» — разрывы между флагманами на стандартных знаниевых бенчмарках сжались до нескольких процентных пунктов, тогда как возможности систем растут быстрее, чем развивается инструментарий их измерения и управления ими.
Safe Superintelligence (SSI) основана Ильёй Суцкевером (июнь 2024). Принципиально не имеет публичных моделей и продуктов; капитализация достигла ~$32 млрд при штате около 20 человек. DeepSeek V4 (MIT, апрель 2026) достигает 80,6% на SWE-bench при цене на порядки ниже проприетарных аналогов; заявленное отставание от закрытого фронтира — 3–6 месяцев. OLMo 3.1 Think 32B при почти в 90 раз меньшем числе параметров, чем у Grok 4, достигает сопоставимых результатов на ряде бенчмарков — за счёт тщательного курирования данных.
3.2. Специализированные лаборатории и институты
Индустриальное масштабирование остаётся доминирующей парадигмой: объём обучающих вычислений удваивается примерно каждые пять месяцев, а размеры датасетов — каждые восемь. Инференс подешевел оценочно в 280 раз за около полутора лет на уровне качества GPT-3.5. Слабые стороны — приближение к информационным и энергетическим пределам, непрозрачность и колоссальный барьер входа по капиталу [1].
4.1. Академическая наука против индустриального масштабирования
На многоходовых задачах (τ-bench / τ2-bench) даже лучшие модели дают менее 50% успеха; строгая метрика устойчивости pass^8 падает ниже 25%. На новом тесте ARC-AGI-3 (март 2026) все фронтир-системы показывают менее 1%. Дефекты валидности обнаружены в 8 из 10 популярных тестов — «ничего не делающий» агент проходит до 38% задач одной из подвыборок τ-bench [25, 26].
Anthropic позиционирует Opus 4.5 как «наиболее согласованную фронтир-модель в индустрии», приближаясь к порогам ASL-4. Число задокументированных инцидентов с ИИ выросло до 362 (против 233 годом ранее). AI Index фиксирует фундаментальный компромисс: улучшение одного измерения ответственного ИИ способно ухудшать другое [1].
4.3. Безопасность и согласование
Открытые китайские модели сократили отставание от закрытого фронтира до 3–6 месяцев. Индекс прозрачности фундаментальных моделей упал до 40 баллов из 100 (с 58 годом ранее). Стратегия xAI на данных X сопряжена с серьёзными правовыми рисками: нидерландский суд признал нарушение GDPR. Нейроморфные решения (Intel Loihi 2, IBM NorthPole) демонстрируют до 25-кратного прироста производительности на ватт, однако остаются в фазе ранней коммерциализации [27–31].
4.4–4.6. Открытые модели, данные X, биологически-инспирированные архитектуры
4. Сравнение исследовательских подходов
Таблица 1. Флагманские модели и бенчмарки (середина 2026). Большинство значений заявлены разработчиками (self-reported); независимо подтверждены прежде всего ARC-AGI-2 (BenchLM/Epoch), Artificial Analysis Index и LMArena.
Article ID
IAE-2026-AGI-001
DOI
Присваивается по мере подключения Crossref
Издание
IAE Review · онлайн (rolling)
Год публикации
2026
УДК
004.8
Лицензия
CC BY 4.0Рецензирование
Независимое · два рецензента
Критерии выдающихся достижений в свете прецедентов апелляций 2025 года
Верификация методологий в медицинской экспертизе: протоколы IAE
Аттестационные протоколы ЕС: сравнение стандартов EQF и ECVET
Кандидат юридических наук
Ректор ННИИ · Основатель · Директор IAE
5. Критическая оценка Stanford HAI AI Index
AI Index 2026 (опубликован 13 апреля 2026) фиксирует: частные инвестиции в ИИ в США достигли $285,9 млрд в 2025 году (более чем в 23 раза превысив показатель Китая); генеративный ИИ достиг 53% проникновения за три года — быстрее персональных компьютеров и интернета; позитивного влияния ИИ на занятость ожидают 73% экспертов против 23% широкой общественности [1].
Совокупность данных позволяет сформулировать несколько обобщений. Во-первых, лидерство индустрии над академией закрепилось окончательно. Во-вторых, наблюдается парадокс: при быстром росте возможностей сохраняется устойчивый провал в долгогоризонтных агентных задачах и снижается прозрачность. В-третьих, регуляторный фактор (AI Act, дело Grok) становится самостоятельной переменной.
Выводы о приближении к AGI целесообразно делать стадийно. Триггером для пересмотра следует считать устойчивое преодоление порогов — условно, свыше 50% по метрике pass^k на τ2-bench и свыше 30% на ARC-AGI-2 — несколькими независимо проверенными системами. Маркетинговые заявления о конкретной «вероятности AGI» следует исключать из доказательной базы.
К середине 2026 года гонка за AGI представляет собой многополярный паритет небольшой группы лидеров (OpenAI, Google DeepMind, Anthropic) при быстром сокращении отставания открытых китайских моделей и нарастающем влиянии капитала, инфраструктуры и регулирования.
Главным методологическим выводом является необходимость строгого разграничения заявленных и независимо проверенных результатов и осторожной, стадийной интерпретации любых утверждений о достижении AGI. Дальнейшие исследования целесообразно сосредоточить на надёжности агентных систем, валидности бенчмарков и восстановлении прозрачности фронтира.
- Stanford HAI. The AI Index 2026 Annual Report. Stanford University, Human-Centered AI Institute, 13 апреля 2026.
- Stanford HAI. The AI Index 2025 Annual Report (8th ed., 456 p.). Stanford University, апрель 2025.
- OpenAI. Introducing GPT-5.5. Официальный блог OpenAI, 23 апреля 2026.
- Bloomberg. OpenAI valued at $852 billion after $122 billion round. 31 марта 2026.
- Google DeepMind. Introducing Gemini 3 Pro. Блог Google, 18 ноября 2025 (Gemini 3.1 Pro — 19 февраля 2026).
- Anthropic. Claude Opus 4.5 System Card. Anthropic, ноябрь 2025.
- CNBC; Axios. Anthropic raises Series H ($65B) at $965B valuation. 28 мая 2026.
- Reuters; Bloomberg. Anthropic revenue run-rate and Q2 2026 guidance. апрель–май 2026.
- Financial Times. Hyperscaler AI capital expenditure outlook 2026. 2026.
- Reuters; Bloomberg. xAI–SpaceX merger and planned IPO. февраль–июнь 2026.
- Financial Times; The Wall Street Journal. Safe Superintelligence valuation. март–апрель 2025.
- Bloomberg. Thinking Machines Lab funding talks (~$50B). 13 ноября 2025.
- TechCrunch. Mistral AI valuation and Mistral Large 3 release. 2025–2026.
- DeepSeek. DeepSeek V4 release and model card. 24 апреля 2026.
- Zhipu AI. GLM-5 / GLM-5.1 release notes. февраль–апрель 2026.
- Alibaba. Qwen3.5 release notes. февраль–май 2026.
- Moonshot AI. Kimi K2.6 release notes. 20 апреля 2026.
- BAAI et al. Emu3: native multimodal generation. Nature, январь 2026.
- Госсовет КНР. Заключения о реализации действия «Искусственный интеллект+» (Guo Fa [2025] No. 11). 26 августа 2025.
- The White House. Executive Order 14179 (23.01.2025); «Winning the AI Race: America's AI Action Plan» (23.07.2025).
- European Commission. InvestAI (11.02.2025); Regulation (EU) 2024/1689 (AI Act).
- Правительство РФ. Национальная стратегия развития ИИ до 2030 года (2019, ред. 2023); AI Journey, 19 ноября 2025.
- Artificial Analysis. Intelligence Index. 2026.
- ARC Prize; BenchLM.ai. ARC-AGI-2 / ARC-AGI-3 leaderboard. по состоянию на 1 июня 2026.
- Pan et al. Survey of practitioners on the reliability of LLM agents (n=306). 2025.
- Kang et al. On the validity of agentic benchmarks. 2024.
- Center for Countering Digital Hate. Grok floods X with sexualized images. 2026.
- Rechtbank (Нидерланды). Решение по обработке данных в Grok (нарушение GDPR). 2026.
- Court of Justice of the EU. Russmedia (платформы как совместные контролёры по GDPR). 2 декабря 2025.
- Intel Labs (Loihi 2); IBM Research (NorthPole). 2023–2025.
- Hawkins J. A Thousand Brains: A New Theory of Intelligence. Numenta, 2021.
- Parli V., Minhas A.; IBM Think. On benchmark overfitting in AI evaluation. 2025.
Авторы AI Index сами признают ключевые ограничения: изменения методологии делают ряды не вполне сопоставимыми; часть данных представляет собой «снимок» на конкретную дату; рецензенты предупреждают о риске «подгонки» моделей под бенчмарки (overfitting) [1, 32].
GPT-5.5
Gemini 3.1 Pro
Claude Opus 4.5
DeepSeek V4-Pro
Kimi K2.6
GLM-5
Mistral Large 3
OpenAI
Google
Anthropic
DeepSeek
Moonshot
Zhipu AI
Mistral
23.04.2026
19.02.2026
24.11.2025
24.04.2026
20.04.2026
11.02.2026
02.12.2025
~93 (5.2 Pro)
91,9 (3 Pro)
—
—
90,5
86,0
~44 (незав.)
—
76,2 (3 Pro)
80,9%
80,6%
80,2
77,8
—
Проприетарная
Проприетарная
Проприетарная
MIT (откр.)
Mod. MIT (откр.)
MIT (откр.)
Apache 2.0 (откр.)
В статье представлен фактологически выверенный сравнительный анализ состояния гонки за искусственный интеллект общего назначения (AGI) в период 2024 — первой половины 2026 года. Систематизирован ландшафт ключевых претендентов — индустриальных лидеров, специализированных лабораторий, исследовательских институтов и национальных программ — на основе первичных источников с последовательным разграничением данных, заявленных самими разработчиками (self-reported), и независимо проверенных результатов.
Критически рассмотрены шесть конкурирующих исследовательских подходов. Дана оценка методологии и выводов отчётов Stanford HAI AI Index. Показано, что к середине 2026 года фронтир перешёл в фазу многополярного паритета при опережающем росте возможностей над способностью их измерять и контролировать; сформулированы стадийные критерии для обоснованных выводов о приближении к AGI.
The paper provides a fact-checked comparative analysis of the race toward Artificial General Intelligence (AGI) over 2024 — the first half of 2026. It maps the landscape of key contenders drawing on primary sources and consistently separating self-reported figures from independently verified results. Six competing research paradigms are critically examined, and the methodology and findings of the Stanford HAI AI Index reports are assessed. By mid-2026 the frontier has entered a phase of multipolar parity, with capabilities outpacing the ability to measure and govern them; staged criteria for sound conclusions about approaching AGI are proposed.