Сразу три громких релиза ИИ-моделей: Qwen3.8-Max, DeepSeek V4 Pro и Grok 4.6
2026-08-13 16:29
На рынке больших языковых моделей произошёл настоящий рывок: Alibaba представила Qwen3.8-Max и открыла доступ к её весам, DeepSeek обновила API до версии V4 Pro 0813, а xAI выпустила Grok 4.6.
При всех различиях между моделями у них есть общий вектор развития. Они постепенно уходят от роли обычных чат-ботов к полноценным AI-агентам, которые способны самостоятельно решать многоэтапные задачи — программировать, работать с инструментами, анализировать результаты и продолжать выполнение после ошибок.
Qwen3.8-Max: 2,4 трлн параметров и миллион токенов контекста
Alibaba представила Qwen3.8-Max как крупнейшую модель в линейке Qwen и открыла её веса. Модель использует архитектуру Mixture-of-Experts (MoE): общее количество параметров составляет около 2,4 трлн, однако на обработку каждого токена приходится примерно 95 млрд активных параметров. Всего в архитектуре 512 экспертов.
Такой подход позволяет значительно наращивать ёмкость модели без пропорционального увеличения вычислительных затрат.
Контекстное окно Qwen3.8-Max достигает 1 млн токенов. Это делает модель подходящей для работы с большими репозиториями, объёмными документами и длительными агентными сессиями.
По данным Alibaba, модель получила 86,6% на Terminal-Bench 2.1 и 93,0% на PaperBench.
DeepSeek V4 Pro 0813: большой контекст и низкая стоимость
DeepSeek обновила свою Pro-модель до версии DeepSeek-V4-Pro-0813. В официальном API заявлены контекст до 1 млн токенов, максимальный ответ размером до 384 тыс. токенов, поддержка tool calls, а также два режима — thinking и non-thinking.
Одним из главных преимуществ новой версии стала стоимость инференса:
$0,435 за 1 млн входных токенов при cache miss;
$0,003625 за 1 млн входных токенов при cache hit;
$0,87 за 1 млн выходных токенов.
Для агентных систем это особенно важно. Такие сценарии предполагают множество последовательных обращений к модели и повторную передачу уже обработанного контекста. Поэтому низкая стоимость cache-hit токенов может существенно снизить общие расходы.
По данным DeepSeek, версия 0813 улучшила результаты на ряде агентных тестов: до 87,9% на Terminal-Bench 2.1, 83,3% на CyberGym и 62,7% на DeepSWE. Эти показатели скорее демонстрируют направление развития модели — автономное программирование, работу с окружением и решение многоэтапных задач, — чем подтверждают её абсолютное превосходство над другими LLM.
Grok 4.6: ставка на продолжительную работу агентов
В тот же день xAI представила Grok 4.6. В новой версии компания также делает акцент не столько на обычном общении, сколько на продолжительном выполнении сложных задач: программировании, исследованиях, создании приложений и взаимодействии с инструментами.
Согласно данным xAI, Grok 4.6 набрала 61 балл в Artificial Analysis Intelligence Index. На специализированных тестах модель показала 69,9% на CursorBench 3.2, 65,9% на DeepSWE 1.1 и 61,3% на FrontierCode 1.1 Extended.
xAI позиционирует модель для сценариев, где агенту приходится долго работать над одной задачей: использовать внешние инструменты, анализировать промежуточные результаты, находить ошибки и самостоятельно продолжать работу.
Ещё в Grok 4 компания активно использовала reinforcement learning для развития reasoning-навыков. Последующие продукты вокруг Grok всё сильнее смещаются в сторону агентного подхода.
Три модели — один вектор развития
Эти релизы хорошо показывают, куда сейчас движется индустрия LLM.
1. Количество параметров уже не является единственным показателем масштаба.
Qwen3.8-Max с 2,4 трлн параметров использует MoE и активирует только часть сети при обработке каждого токена. Это позволяет получить огромную ёмкость модели без вычислений по всей архитектуре на каждом шаге.
2. Длинный контекст превращается в важную часть инфраструктуры.
Миллион токенов позволяет держать в одном контексте крупный кодовый проект, историю взаимодействия с инструментами, результаты предыдущих действий и дополнительные документы. При этом большой контекст сам по себе не гарантирует эффективную работу модели со всем его содержимым.
3. Бенчмарки всё чаще проверяют самостоятельность моделей.
Terminal-Bench, DeepSWE и другие агентные тесты оценивают не только способность генерировать текст или код. Они проверяют, насколько хорошо модель взаимодействует с окружением, использует инструменты и доводит задачу до конечного результата.
4. Цена инференса становится частью практической эффективности.
Для обычного общения разница в стоимости нескольких миллионов токенов может быть несущественной. Но агент способен сделать десятки или сотни запросов, многократно передавать большой контекст и генерировать длинные цепочки действий. В таком сценарии стоимость токенов напрямую влияет на экономику продукта.