Новая модель · проверено 6 сентября 2026 г. · 8 минут

GPT-6 Astra: 99,9% на ARC-AGI-3. ИИ поднимает ставки

Самая дорогая часть работы с ИИ часто начинается после его ответа: проверить, исправить, собрать разрозненные куски и снова объяснить задачу. GPT-6 Astra заставляет пересмотреть эту привычку. На ARC-AGI-3 у нового флагмана OpenAI — 99,9%. Разбираемся, что стоит за громкой цифрой, где искать пользу для своей работы и как попробовать Astra через Celestria Gate.

99,9% — цифра, после которой хочется переспросить

По данным OpenAI, GPT-6 Astra получила 99,9% на ARC-AGI-3 и 97,6% на FrontierMath Tier 4 (v2); в тексте анонса второй результат округлён до 98%. Это результаты конкретных испытаний, а не универсальная оценка интеллекта.

В названии ARC-AGI легко заметить три буквы, вокруг которых строится вся интрига. Но шкала теста не измеряет, на сколько процентов человечество добралось до общего искусственного интеллекта. Высокий результат даёт повод ставить модели более трудные задачи. Гарантию безошибочной работы он не выдаёт.

Представьте школьника, который получил почти максимальный балл на сложном экзамене. Вы наверняка захотите посмотреть, как он справится с настоящим проектом. Но не станете считать, что один экзамен проверил каждое решение, которое ему предстоит принять. С Astra полезна та же логика: впечатлиться, а затем усложнить собственный эксперимент.

Самое интересное на графике — в том числе под столбцами

У официального сравнения ARC-AGI-3 есть существенная оговорка: Astra оценивали с Responses API harness — программным окружением, через которое модель выполняет задания. У показанного столбца Sol окружение другое; OpenAI оценивает Sol с Responses harness примерно в 30%. Считать по этим столбцам чистый рост одной только модели некорректно.

Для покупателя API здесь полезный урок. Результат зависит от модели, доступных ей инструментов и правил работы приложения. Если помощнику не дали документы, он не сможет честно сверить договор. Если не подключили браузер, он не откроет сайт по одной лишь силе своего названия.

Поэтому вопрос «какая модель умнее?» стоит дополнить вопросом «что именно ей дали сделать?». В своём сравнении сохраняйте одинаковые входные данные, ограничения и критерий готовности. Иначе легко принять удачную настройку приложения за скачок качества модели.

Официальный график OpenAI: результаты моделей на ARC-AGI-3
ARC-AGI-3: 99,9% у Astra. Модели на графике тестировались в разных программных окружениях; оценка Sol с окружением Astra — около 30%. Источник: OpenAI

Почти потолок математического теста. А что с вашей задачей?

Результат FrontierMath — хороший повод испытать Astra на работе, где важно удержать несколько условий одновременно. Например, на проверке расчёта: какие допущения использованы, где единицы измерения расходятся, какой вывод перестанет работать при изменении исходных данных. Это сценарий для проверки, а не обещание результата.

Допустим, у вас три предложения поставщиков. В одном доставка включена, в другом вынесена отдельной строкой, в третьем скидка действует только при большом заказе. Попросите собрать сопоставимую таблицу, показать формулы и перечислить недостающие данные. Готовый результат должен позволять другому человеку повторить расчёт.

Именно проверяемость делает сложный ответ полезным. Красиво написанное «выбирайте второго» мало помогает, если непонятно, учтены ли доставка и минимальный объём. Дайте Astra право сказать «для вывода не хватает данных» — и потребуйте показать, каких именно.

Официальный график OpenAI: точность на FrontierMath Tier 4 относительно стоимости API
FrontierMath Tier 4 (v2): 97,6% у Astra. В анонсе результат округлён до 98%. Голубые звёзды — Astra, тёмно-синие круги — Sol, коричневые фигуры — модели Claude. Ось стоимости относится к условиям теста OpenAI, а не к тарифам Gate. Источник: OpenAI

Следующий уровень: сколько работы осталось после ответа

В анонсе OpenAI сообщает об ускорении выполнения задач Mind2Web в 1,9 раза для связки Astra и обновлённого окружения Codex относительно текущего опыта с Sol. Эта цифра относится к конкретному тесту и связке, а не к скорости каждого API-запроса.

Для разработчика интереснее другой замер: сколько минут пройдёт до принятой правки. Допустим, нужно добавить оплату в незнакомый проект. Компонент кнопки — только начало. Есть авторизация, повторное нажатие, неуспешный платёж и подтверждение от провайдера. Попросите сначала найти существующие правила проекта, затем внести изменение и проверить критические состояния.

Для руководителя похожий эксперимент — подготовить решение по закупке. Исходные документы, сопоставление условий, спорные места, короткая записка с рекомендацией. Оценивайте, сколько пришлось пересчитать и дописать вручную. Такой результат понятнее абстрактного «ответ стал гораздо лучше».

Не измеряйте пользу длиной ответа. Хороший помощник может вернуть меньше текста, если в нём есть нужный расчёт, ссылка на исходные данные и понятное следующее действие.

Официальный график OpenAI: точность на OSWorld 2.0 Offline относительно стоимости API
OSWorld 2.0 Offline: точность выполнения компьютерных задач и стоимость в условиях теста OpenAI. Голубые звёзды — Astra, тёмно-синие круги — Sol, коричневые фигуры — модели Claude. Это отдельный тест; ускорение Mind2Web из текста выше здесь не показано. Источник: OpenAI

Миллион токенов — место для контекста, а не повод отправлять всё

Официальная карточка Astra указывает контекст 1 050 000 токенов, максимум входа 922 000 и выхода 128 000. На входе доступны текст и изображения, на выходе — текст. Дата отсечения знаний: 30 апреля 2026 года. Свежие сведения после этой даты нужно передавать или получать через подключённые инструменты.

Большой контекст удобно представлять как рабочий стол. На нём помещается много документов, но беспорядок всё равно мешает. Для анализа договора приложите сам договор, требования и связанные приложения; для исправления кода — нужные файлы, ошибку и шаги воспроизведения. Объясните, что считать источником истины при противоречиях.

Вместо «изучи всю компанию и дай стратегию» попробуйте: «Сравни эти три предложения по указанным критериям. Для каждого вывода назови документ и пункт. Если данных не хватает, вынеси вопрос отдельно». Так и ответ проще проверить, и повторный эксперимент легче воспроизвести.

Проверка, которая скажет о пользе больше любого хайпа

Возьмите задачу, результат которой вы умеете оценивать. Не самую эффектную для демонстрации, а ту, которая регулярно отнимает время. Сохраните исходные данные и заранее запишите, что должно получиться. Дайте одинаковое задание Astra и привычной модели.

Не меняйте требования после того, как увидели любимый ответ. Если одна модель получила дополнительные подсказки, повторите сравнение с ними для обеих. Ошибки сохраняйте: на следующем обновлении они станут хорошими контрольными примерами.

Что сравнитьЧто записать
ГотовностьМожно ли принять результат по заранее заданным условиям
Ручные правкиЧто пришлось исправить, пересчитать или объяснить повторно
ВремяВесь путь до принятого результата, включая проверку
РасходСтоимость всей попытки с повторами, а не только одного ответа

GPT-6 Astra уже в Celestria Gate. Начните со своей задачи

На 6 сентября 2026 года gpt-6-astra есть в публичном каталоге Celestria Gate со статусом available. Откройте карточку модели: там указаны характеристики и рублёвые ставки, которые обновляются из каталога. Для запроса используется тот же API-ключ Gate.

В примере ниже достаточно задать переменную CELESTRIA_API_KEY в своём окружении и установить пакет openai. Затем замените задание на собственное. Сначала проверьте ответ на небольшом наборе данных; удачный результат будет поводом расширить эксперимент.

При переходе на Astra проверьте параметры старого клиента: OpenAI не поддерживает для неё temperature, top_p и режим reasoning none. Для вызова инструментов нужен Responses API. Возможности вроде управления браузером требуют соответствующей интеграции приложения; смена model сама по себе её не добавляет.

import OpenAI from "openai";

const client = new OpenAI({
  apiKey: process.env.CELESTRIA_API_KEY,
  baseURL: "https://api.celestriagate.com/v1",
});

const response = await client.responses.create({
  model: "gpt-6-astra",
  input: "Составь план запуска продукта. Укажи зависимости, " +
    "проверь слабые места и перечисли недостающие данные.",
});

console.log(response.output_text);

Дайте новой модели задачу, которую давно откладывали

Громкая цифра привлекает внимание. Решение о переходе принимает ваш рабочий процесс: стал ли расчёт проверяемым, проходит ли исправление нужные проверки, можно ли отправить документ без ещё одного вечера редактуры.

Выберите один такой результат. Подготовьте данные, назовите критерий готовности и сохраните ответ. Если Astra снимет с вас неприятную часть работы, у вас появится причина пользоваться ей, которую не нужно доказывать чужим графиком.

Частые вопросы

99,9% на ARC-AGI-3 означает, что AGI уже создан?

Этот результат относится к определённому тесту. Он не является процентом достижения общего искусственного интеллекта и не гарантирует успешность любой реальной задачи.

Правильно говорить GPT Astra 6 или GPT-6 Astra?

Официальное название — GPT-6 Astra. Идентификатор модели для API — gpt-6-astra.

Astra доступна через Celestria Gate?

На 6 сентября 2026 года публичный каталог Gate содержит gpt-6-astra со статусом available. Перед интеграцией проверьте каталог и доступные вашему ключу модели.

Нужно ли переводить на Astra все запросы?

Начните со сложной задачи и сравните стоимость принятого результата с привычной моделью. Для простого извлечения полей или коротких типовых ответов сохраните более экономичный маршрут, если его качество вас устраивает.

Источники

Канонический адрес материала · Получить API-ключ