Сравниваем Gemini 3 Pro и ChatGPT 5.1 в главном противостоянии ИИ 2025 года. Узнайте, какая модель лидирует в рассуждении, программировании и мультимодальных задачах, чтобы определить победителя гонки ИИ.
Ландшафт искусственного интеллекта претерпел кардинальные изменения в ноябре 2025 года, когда Google и OpenAI с разницей всего в несколько дней выпустили конкурирующие флагманские модели. 18 ноября 2025 года Google представила Gemini 3 Pro в режиме предварительного просмотра, а 12 ноября 2025 года OpenAI обновила GPT-5 до GPT-5.1.
Такое совпадение по времени вызвало оживлённые дискуссии в сообществах ИИ: r/wallstreetbets на Reddit обсуждало влияние на рынок, а рынки прогнозов Polymarket продемонстрировали высокую уверенность в сроках выпуска Google. Этот запуск лицом к лицу означает нечто большее, чем просто постепенные обновления: он свидетельствует о фундаментальном изменении возможностей ИИ. Обе компании ориентируются на разработчиков, предприятия и обычных пользователей, предлагая значительно улучшенные возможности рассуждения, программирования и работы с разными типами данных.

Результаты тестов производительности: цифры не лгут
Сравнение Gemini 3 Pro и ChatGPT 5.1 выявляет существенные различия в производительности по результатам стандартных отраслевых оценок. Методология Google использует строгие настройки с одной попыткой, без голосования большинства или параллельных вычислений во время тестирования, а все результаты усредняются по нескольким испытаниям для снижения вариативности. Понимание этих тестов помогает разработчикам и организациям выбрать подходящую модель для конкретных задач.
Превосходство в математике и рассуждении
Gemini 3 Pro набирает впечатляющие 1501 балл в таблице лидеров LMArena и демонстрирует рассуждение на уровне PhD, получая 37,5% в Humanity's Last Exam без использования каких-либо инструментов. Модель тестировалась с включёнными поиском и кодом через Gemini API; для предотвращения загрязнения данных были применены списки блокировки сайтов, содержащих числа из тестов.
Особенно впечатляет математический потенциал модели: она устанавливает новый ориентир, набирая 23,4% в MathArena Apex — математическом тесте уровня соревнований, о котором сообщает matharena.ai и который оценивает модели на задачах олимпиадного уровня. При прямом сравнении:
Тест на абстрактное рассуждение ARC-AGI 2, считающийся одним из наиболее близких приближений к измерению общего искусственного интеллекта, показывает следующее:
-
Gemini 3 Deep Think достигает точности 45,1% на полуприватном наборе ARC Prize Verified.
-
GPT-5.1 достигает лишь 17,6% — преимущество в 2,5 раза, демонстрирующее значительный перевес Google в решении задач, требующих нового распознавания закономерностей и концептуального мышления за пределами запомненных обучающих данных.
Мультимодальное понимание и визуальный интеллект
Помимо текстового рассуждения, Gemini 3 Pro переосмысливает возможности ИИ при работе с изображениями и видео. Модель демонстрирует расширенные способности в нескольких ключевых тестах:
-
Общее мультимодальное понимание: 81% в MMMU-Pro и 87,6% в Video-MMMU.
-
Работа с визуальными интерфейсами: исключительные 72,7% в ScreenSpot-Pro с использованием вызова функций.
Эти результаты демонстрируют возможности нативной мультимодальной архитектуры, которая обрабатывает визуальную информацию так же свободно, как и текст. Это особенно важно для таких практических задач, как анализ медицинских изображений, мониторинг производственных помещений, видеонаблюдение и модерация контента.
Кроме того, Gemini 3 Pro демонстрирует высокие способности к пониманию документов, показывая впечатляющие результаты в следующих тестах:
-
OmniDocBench 1.5, где усредняются показатели Edit Distance по подметрикам Text, Formula, Table и ReadingOrder.
-
CharXiv Reasoning, где модель решает 1000 задач на рассуждение из валидационной выборки.
OpenAI не раскрыла сопоставимые результаты GPT-5.1 в тестах на понимание видео, что указывает на сохранение существенного конкурентного преимущества Google благодаря инвестициям в нативное мультимодальное обучение с нуля.
Возможности программирования и разработки ПО
Gemini 3 Pro набирает 76,2% в SWE-bench Verified — результат усреднён по 10 запускам с использованием сценария с одной попыткой. Хотя это отличный показатель, Claude Sonnet 4.5 немного опережает модель с результатом 77,2%, что делает этот тест единственным крупным испытанием, в котором Gemini не занимает первое место.
Модель также показывает впечатляющие результаты в других тестах, демонстрируя сильные способности к агентному использованию инструментов:
-
LiveCodeBench Pro: рейтинг ELO 1487.
-
Terminal-Bench 2.0: результат 54,2% с использованием стандартной оболочки агента Terminus 2.
В тестах на использование инструментов Gemini 3 Pro превосходит конкурентов в τ2-bench с применением стандартного фреймворка sierra, показывая следующие результаты по категориям:
-
Розничная торговля: 85,3%
-
Авиалинии: 73,0%
-
Телекоммуникации: 98,0% Это демонстрирует её практические возможности выполнения задач в реальных условиях.
Для GPT-5.1 OpenAI сообщает о значительном улучшении результатов в математическом тесте AIME 2025 и тестах программирования Codeforces, хотя конкретные процентные показатели публично не раскрыты. Модель предлагает адаптивное рассуждение, специально оптимизированное для рабочих процессов программирования: время размышления выбирается в зависимости от сложности задачи.
Фактическая точность и контроль галлюцинаций
Одно из наиболее важных различий проявляется в надёжности фактов. Gemini 3 Pro набирает 72,1% в SimpleQA Verified по данным официальной таблицы лидеров Kaggle — тесте, проверяющем, признают ли модели незнание вместо того, чтобы выдумывать ответы. Модель также показывает исключительные результаты в FACTS Benchmark Suite — комплексном наборе тестов на фактическую точность, демонстрирующем способности к обоснованию ответов. GPT-5.1 набирает примерно 34,9% в SimpleQA — менее половины показателя Gemini. Для предприятий из регулируемых отраслей, таких как здравоохранение, финансы и юридические услуги, этот разрыв в надёжности может стать решающим.
Строгий подход Google к оценке, использующий показатель pass@1 при настройках с одной попыткой и без голосования большинства, гарантирует, что эти результаты фактической точности отражают реальные показатели, а не оптимистичные сценарии с несколькими попытками.
Таблица сравнения результатов
|
Тест
|
Gemini 3 Pro
|
GPT-5.1
|
Победитель
|
Разрыв в производительности
|
|
Таблица лидеров LMArena (Elo)
|
1501
|
~1450
|
Gemini
|
На 3,5% выше
|
|
MathArena Apex
|
23,40%
|
1,00%
|
Gemini
|
Разница в 23 раза
|
|
ARC-AGI 2 (полуприватный)
|
31,1% (45,1% Deep Think)
|
17,60%
|
Gemini
|
Разница в 2,5 раза
|
|
Humanity's Last Exam
|
37,50%
|
~30% (оценка)
|
Gemini
|
Значительное преимущество
|
|
GPQA Diamond
|
91,90%
|
~85% (оценка)
|
Gemini
|
Умеренное преимущество
|
|
SimpleQA Verified
|
72,10%
|
34,90%
|
Gemini
|
Разница в 2 раза
|
|
SWE-bench Verified
|
76,2% (в среднем за 10 запусков)
|
76,30%
|
GPT-5.1
|
Почти равные результаты
|
|
MMMU-Pro (среднее Standard+Vision)
|
81%
|
Нет данных
|
Gemini
|
Н/Д
|
|
Video-MMMU (высокое разрешение)
|
87,60%
|
Нет данных
|
Gemini
|
Н/Д
|
|
ScreenSpot-Pro
|
72,70%
|
3,50%
|
Gemini
|
Разница в 20 раз
|
|
Terminal-Bench 2.0
|
54,20%
|
Нет данных
|
Gemini
|
Н/Д
|
|
LiveCodeBench Pro (ELO)
|
1487
|
Нет данных
|
Gemini
|
Н/Д
|
Архитектурные инновации: как они работают
Различия в производительности этих моделей обусловлены принципиально разными архитектурными решениями и подходами к обучению, отражающими стратегические приоритеты каждой компании.
Нативный мультимодальный подход Google
Gemini 3 Pro создана на основе уникальной нативной мультимодальной архитектуры Google, представленной в Gemini 2.0. В отличие от традиционных моделей, которые обучаются отдельно на текстах и изображениях, а затем объединяют эти возможности, Google обучает все модальности одновременно с самого начала. Текст, изображения, видео и аудио используют единое пространство семантических представлений, позволяя модели с беспрецедентной свободой рассуждать между разными модальностями.
Эта архитектура позволяет Gemini понимать контекст, который частично содержится в тексте, а частично — в визуальной информации. Благодаря этому модель особенно эффективна в таких задачах, как анализ архитектурных схем одновременно со спецификациями, понимание мемов, объединяющих текст и изображения, или обработка медицинских заключений вместе с рентгеновскими снимками.
Модель также использует архитектуру Mixture of Experts с предполагаемым общим количеством параметров в один триллион, хотя для конкретной задачи активируются лишь от 150 до 200 миллиардов. Это позволяет Google достигать передовых результатов, эффективно контролируя вычислительные затраты.
Революция адаптивного рассуждения OpenAI
GPT-5.1 предлагает адаптивное рассуждение, которое определяет, когда следует подумать перед ответом на сложный вопрос. Это значительное развитие по сравнению с GPT-5, поведение которого при рассуждении не зависело от сложности задачи.
Теперь система оценивает каждый запрос и выделяет соответствующие вычислительные ресурсы. Если попросить показать простую npm-команду для вывода глобально установленных пакетов, GPT-5.1 ответит за 2 секунды вместо 10. И наоборот, для сложных математических доказательств или запутанных задач программирования модель автоматически выделит больше времени на размышление.
OpenAI также представила режим "без рассуждения" для разработчиков, создающих приложения, чувствительные к задержкам. Этот режим сохраняет интеллект GPT-5.1 и одновременно обеспечивает скорость, сопоставимую с традиционными языковыми моделями, что делает его идеальным для чат-ботов реального времени и интерактивных приложений.
Сценарии применения в реальном мире
Понимание сильных сторон каждой модели помогает организациям и разработчикам принимать обоснованные решения о внедрении с учётом конкретных вариантов использования.
Когда Gemini 3 Pro однозначно выигрывает
-
Управление корпоративными знаниями: Организации с огромными хранилищами документов получают значительную выгоду от контекстного окна Gemini на 1 миллион токенов в сочетании с механизмами кэширования. Первый запрос к 500 000 токенов стоит $2.00, а последующие запросы — $0.20, что означает экономию 90% при повторном обращении к данным.
-
Научные и математические вычисления: Благодаря 23-кратному преимуществу в тестах продвинутой математики Gemini 3 Pro становится очевидным выбором для исследовательских учреждений, компаний количественного финансирования и инженерных организаций, которым требуются сложные вычисления и доказательства.
-
Масштабный мультимодальный анализ: Производственные компании, анализирующие видео с заводских площадок, медицинские организации, изучающие снимки, и службы безопасности, обрабатывающие записи видеонаблюдения, получают существенную пользу от нативного мультимодального понимания Gemini. Результат 87,6% в Video-MMMU подтверждает практическую надёжность модели для промышленного внедрения.
-
Точность в критически важных задачах: Финансовым учреждениям, юридическим фирмам и медицинским организациям, которым необходимо свести галлюцинации к минимуму, стоит обратить внимание на результат Gemini 72,1% в SimpleQA — фактически вдвое превосходящий надёжность GPT-5.1 в вопросах, связанных с фактами.
Когда ChatGPT 5.1 выходит вперёд
-
Разговорный ИИ для конечных пользователей: GPT-5.1 Instant по умолчанию стал теплее и разговорнее, нередко удивляя пользователей игривостью, сохраняя при этом ясность и полезность. Для чат-ботов поддержки клиентов, виртуальных помощников и пользовательских приложений, где важна индивидуальность, улучшенные разговорные способности ChatGPT обеспечивают превосходный пользовательский опыт.
-
Быстрое прототипирование и разработка: Адаптивное рассуждение и оптимизация скорости делают GPT-5.1 идеальным для разработчиков, работающих в условиях коротких циклов итерации. Режим без рассуждения обеспечивает быстрые ответы без потери интеллекта и отлично подходит для интегрированных сред разработки и ассистентов программирования.
-
Персонализированный пользовательский опыт: OpenAI представила новые пресеты тона, включая Professional, Candid и Quirky, позволяющие приложениям легко соответствовать стилю бренда и предпочтениям пользователя. Организации, которым нужен ИИ с узнаваемым голосом бренда, получают преимущества благодаря такой детальной настройке.
-
Типовые бизнес-задачи: Для стандартных бизнес-операций, таких как составление писем, резюме встреч, создание отчётов и подготовка презентаций, сбалансированные производительность, скорость и экономичность GPT-5.1 делают её практичным выбором.
Анализ цен и затрат
Экономические факторы часто определяют внедрение ИИ в масштабах организации, поэтому ценовая стратегия для многих компаний не менее важна, чем чистая производительность.
Структура цен Gemini 3 Pro
Цены Google на API на первый взгляд выше, чем у конкурентов:
-
Ввод: $2.00 за миллион токенов
-
Вывод: $12.00 за миллион токенов
-
Кэшированный ввод: $0.20 за миллион токенов
Однако механизм кэширования меняет экономику корпоративных приложений. Рассмотрим систему поддержки клиентов, которая обращается к базе знаний объёмом 400 000 токенов для 10 000 ежедневных запросов. Традиционная архитектура стоит $8,000 в день ($2.00 × 4 × 1,000), тогда как кэширование Gemini снижает стоимость примерно до $880 ($8 за первоначальный запрос + $0.80 × 1,000 последующих), то есть на 89%.
Подход ChatGPT 5.1 к ценообразованию
OpenAI пока не раскрыла подробные цены на API GPT-5.1, хотя предыдущая цена GPT-5 составляла $1.25 за миллион входных токенов и $10.00 за миллион выходных токенов. OpenAI внедряет расширенное кэширование подсказок с хранением кэша до 24 часов, повышая экономичность приложений с повторяющимся контекстом.
Для конечных пользователей ChatGPT сохраняет понятные уровни подписки: Plus ($20/месяц), Pro ($200/месяц) и бесплатный уровень. GPT-5.1 с сегодняшнего дня становится доступной платным пользователям Pro, Plus, Go и Business, а затем постепенно будет распространена среди бесплатных пользователей.
GPT Proto: ваш путь к доступным API ИИ
GPT Proto — это универсальная платформа API ИИ, предоставляющая разработчикам и компаниям экономичный единый доступ к передовым моделям, таким как Gemini 3 Pro, ChatGPT 5.1 и Claude. Она устраняет сложность управления несколькими аккаунтами поставщиков и платёжными системами благодаря единому консолидированному интерфейсу. Такой упрощённый подход специально разработан для поддержки vibe coding и быстрых экспериментов, делая финансово доступным выполнение сотен вызовов API.
Конкурентоспособная ценовая структура платформы особенно выгодна стартапам, независимым разработчикам и исследовательским командам, работающим в условиях ограниченного бюджета. Используя эффект масштаба, GPT Proto существенно снижает порог входа как для экспериментов с ИИ, так и для промышленного внедрения, позволяя командам ускорять разработку без непомерных затрат.
Ключевые возможности:
-
Единый доступ к новейшим моделям (Gemini 3 Pro, ChatGPT 5.1, Claude и др.)
-
Единый API-интерфейс и платёжные отношения
-
Значительно более доступные и стабильные цены
-
Оптимизация под vibe coding и рабочие процессы быстрых итераций
-
Радикальное снижение порога входа в разработку ИИ

Заключение
Сравнение Gemini 3 Pro и ChatGPT 5.1 показывает два разных подхода к передовому ИИ. Модель Google демонстрирует техническое превосходство, особенно в математическом рассуждении, абстрактном мышлении и мультимодальном понимании. Она получила максимальный результат 1501 Elo в таблице лидеров LMArena и победила в 19 из 20 основных тестов, что делает её идеальной для технических команд, которым нужна максимальная производительность в научных и критически важных задачах.
OpenAI, напротив, делает приоритетом пользовательский опыт, предлагая более тёплое общение, продвинутую настройку личности и адаптивное рассуждение, оптимизированное для скорости и глубины. Тесно интегрированный с корпоративной экосистемой Microsoft, GPT-5.1 представляет собой убедительный выбор для организаций, ориентированных на внедрение, вовлечённость и качество общения. В конечном счёте обе модели знаменуют собой колоссальный скачок в возможностях ИИ, предоставляя разработчикам и компаниям беспрецедентный доступ к рассуждению на уровне PhD и человекоподобной коммуникации.
Источники
- Google DeepMind: оценка модели Gemini 3 Pro
- TechRadar: сравнение Gemini 3 и ChatGPT 5.1 с Claude Sonnet 4.5
- r/wallstreetbets на Reddit: Google представляет Gemini 3 на фоне обострения борьбы с OpenAI