Новости

Стоимость токенов для LLM упала почти на 100% за 33 месяца

Недавний релиз Google — модель Gemini 3 Flash — продемонстрировал кратный рост эффективности: по показателю «цена–производительность» она превосходит большинство передовых моделей в 4–9 раз (в зависимости от используемых метрик и тарифов API). Венчурный инвестор Томаш Тунгуз, партнёр фонда Theory Ventures, проанализировал последствия этого шага для рынка и пришёл к выводу: за последние 33 месяца цена «единицы интеллекта» снизилась примерно на 98%.

В своих расчётах Тунгуз использовал показатель «стоимость за балл качества» — сколько долларов требуется, чтобы получить одну условную единицу производительности по бенчмаркам. Для GPT-4 в марте 2023 года этот показатель составлял около $65, тогда как у Gemini 3 Flash сегодня — примерно $1,10.

Стоимость Gemini 3 Flash составляет $0,50 за миллион входных токенов и $3,00 за миллион выходных. При этом по среднему качеству модель уступает лидерам всего на 9,2%. Однако ключевым фактором становится именно эффективность затрат. По подсчётам Тунгуза, количество «баллов качества» на каждый потраченный доллар на выходные токены распределяется следующим образом: Gemini 3 Flash — 30,3, Gemini 3 Pro — 7,8, GPT-5.2 — 6,6, Claude Opus 4.5 — 3,5. Таким образом, преимущество Gemini 3 Flash над флагманской моделью Anthropic достигает почти девятикратного значения.

Методика оценки включала анализ 20 различных бенчмарков — от MMLU-Pro и MATH-Hard до SWE-bench Verified и ARC-AGI-1. Для каждого теста определялся лучший результат среди всех моделей, после чего вычислялось среднее отставание остальных. Цена токенов рассчитывалась как «смешанная» (80% входных и 20% выходных), что соответствует типичному распределению в реальных запросах. Финальный показатель представлял собой отношение этой цены к совокупному баллу качества.

Сам Тунгуз описывает стратегию Google как «ликвидационные цены» — компания фактически предлагает огромную вычислительную мощность по стоимости распродажи. Почему Google может позволить себе такую политику, до конца не ясно, однако очевидные преимущества — собственные TPU-чипы и полный контроль над инфраструктурой дата-центров.

Общий тренд подтверждается и аналитикой Andreessen Horowitz. Фонд ввёл термин LLMflation, обозначающий ситуацию, при которой стоимость инференса снижается примерно в 10 раз в год — быстрее, чем действовал закон Мура для транзисторов с его удвоением каждые 18–24 месяца. По их оценкам, сегодня обработка всей годовой человеческой речи моделью уровня GPT-3 обходится примерно в $2, а анализ всего исходного кода ядра Linux — менее чем в $1. Для самых продвинутых моделей эти цифры выше, но динамика сохраняется: задачи, которые ещё вчера казались экономически абсурдными, уже в ближайшем будущем станут обыденными.