GPT-5.6 вышла под контролем государства: почему самую мощную модель OpenAI увидят единицы
2026-06-27 13:15
OpenAI анонсировала семейство моделей GPT-5.6, включающее три варианта: флагманскую Sol, универсальную Terra и экономичную Luna. Sol позиционируется как наиболее продвинутая разработка компании на текущий момент, однако воспользоваться ею смогут лишь единицы: на этапе запуска доступ получили порядка двадцати отобранных компаний, работающих исключительно через API и Codex. Список этих партнёров был согласован с американскими властями. Массовый выход в ChatGPT и API запланирован на ближайшие недели.
Впрочем, куда важнее самих моделей обстоятельства их выхода. Ограниченный релиз стал инициативой правительства США: OpenAI предварительно продемонстрировала GPT-5.6 федеральным чиновникам, и по их требованию запуск начался в формате закрытого превью с передачей списка участников властям. Прецедент беспрецедентный — впервые американское государство вмешалось в выход ИИ-модели ещё до её релиза. При этом событие происходит всего через две недели после того, как Anthropic под давлением экспортных ограничений была вынуждена отключить Fable 5 и Mythos 5. То, что поначалу выглядело как разовое давление на отдельную компанию, стремительно оформляется в новый отраслевой стандарт.
Архитектура линейки также изменилась. Теперь цифра в названии указывает на поколение, тогда как Sol, Terra и Luna — это постоянные уровни, каждый из которых будет развиваться самостоятельно. По заявлению OpenAI, Terra по возможностям не уступает предыдущей GPT-5.5, при этом обходясь вдвое дешевле; Luna же — наиболее доступный вариант из трёх. В линейку добавлены два новых режима: max отдаёт модели максимум вычислительного времени на обдумывание, а ultra задействует субагентов для решения комплексных задач. Стоимость обработки миллиона токенов составляет 5/30 долларов для Sol, 2,5/15 для Terra и 1/6 для Luna. В июле Sol планируется перевести на чипы Cerebras — это должно обеспечить скорость генерации до 750 токенов в секунду.
Бенчмарки, представленные OpenAI, выглядят следующим образом:
TerminalBench 2.1 (терминальные задачи): Sol в режиме ultra достигает 91,9%, стандартная Sol — 88,8%. Для контекста: Claude Mythos 5 — 88,0%, GPT-5.5 — 83,4%, Claude Opus 4.8 — 78,9%, Gemini 3.1 Pro Preview — 70,7%.
GeneBench v1 (геномика и количественная биология): Sol превосходит GPT-5.5 при меньшем расходе токенов.
ExploitBench (анализ уязвимостей): Sol показывает результаты, сопоставимые с Mythos Preview, потребляя при этом примерно в три раза меньше токенов.
ExploitGym (совместный бенчмарк UC Berkeley, OpenAI и других лабораторий): у всех трёх моделей прослеживается прямая зависимость между глубиной рассуждений и итоговым результатом.
Именно соображения кибербезопасности стали причиной сдержанного старта. По внутренней классификации OpenAI GPT-5.6 получила уровень High, не добравшись до Critical: в ходе тестов на Chromium и Firefox модель успешно выявляла уязвимости и генерировала заготовки для эксплойтов, однако не смогла выстроить полноценную цепочку атаки. Итоговый вывод компании: Sol эффективнее в поиске и устранении проблем, чем в проведении атак от начала до конца. Защитный контур выстроен многоуровневым: модель обучена отклонять запросы, связанные с запрещёнными киберсценариями, работу дополняют классификаторы, контролирующие генерацию в реальном времени, а также система мониторинга аккаунтов на предмет подозрительной активности.
Сама OpenAI открыто выражает недовольство сложившейся ситуацией: в компании настаивают на том, что обязательное согласование релизов с государством не должно превращаться в постоянную практику — это лишает доступа к передовым инструментам разработчиков, бизнес и специалистов по защите. Текущий режим преподносится как временный: параллельно OpenAI и федеральная администрация работают над уточнением рамок кибер-указа. К августу власти намерены ввести закрытую процедуру оценки киберпотенциала моделей и зафиксировать критерии отнесения к категории «covered frontier models», на которые распространяется особый надзор. По существу, история с Anthropic и ограниченный запуск GPT-5.6 — это первые два прецедента регуляторного механизма, который ещё только обретает форму.