Компания сообщила о заметном росте эффективности обучения больших языковых моделей (LLM) без ущерба для качества и масштаба проектов. Благодаря глубокой оптимизации инфраструктуры ежегодная экономия операционных расходов составила 4,8 млрд рублей — примерно 400 млн рублей ежемесячно, сообщили Хабру в пресс-службе компании.
Ключевым технологическим нововведением стала разработанная внутри компании библиотека YCCL (Yet Another Collective Communication Library). Она позволила вдвое ускорить обмен данными между графическими процессорами при обучении нейросетей, сократить объём передаваемой информации и перенести часть управления вычислениями с GPU на центральные процессоры. Решение масштабируется на крупные кластеры, а сопоставимые технологии, по словам представителей компании, есть лишь у ведущих мировых игроков.
Дополнительный прирост производительности обеспечил переход на вычисления в формате FP8 с пониженной точностью. Это ускорило процесс обучения моделей на 30% и сократило объём коммуникаций между узлами вдвое. В ходе исследований также выяснилось, что увеличение батча — объёма данных, обрабатываемых за один шаг, — не приводит к замедлению обучения. В результате его размер довели до 16–32 млн токенов, что позволило практически полностью исключить простой графических процессоров.
Кроме того, были повышены надёжность IT-инфраструктуры, снижено количество аппаратных сбоев и издержки на перезапуск обучения, а также оптимизирован код и усовершенствована архитектура систем обучения ИИ.
Российские LLM выходят на новый уровень. Будем надеяться, что всё-таки догоним передовые модели мира, лет эдак через 100. Ну а пока, можем порадоваться удешевлению токенов.
Ключевым технологическим нововведением стала разработанная внутри компании библиотека YCCL (Yet Another Collective Communication Library). Она позволила вдвое ускорить обмен данными между графическими процессорами при обучении нейросетей, сократить объём передаваемой информации и перенести часть управления вычислениями с GPU на центральные процессоры. Решение масштабируется на крупные кластеры, а сопоставимые технологии, по словам представителей компании, есть лишь у ведущих мировых игроков.
Дополнительный прирост производительности обеспечил переход на вычисления в формате FP8 с пониженной точностью. Это ускорило процесс обучения моделей на 30% и сократило объём коммуникаций между узлами вдвое. В ходе исследований также выяснилось, что увеличение батча — объёма данных, обрабатываемых за один шаг, — не приводит к замедлению обучения. В результате его размер довели до 16–32 млн токенов, что позволило практически полностью исключить простой графических процессоров.
Кроме того, были повышены надёжность IT-инфраструктуры, снижено количество аппаратных сбоев и издержки на перезапуск обучения, а также оптимизирован код и усовершенствована архитектура систем обучения ИИ.
Российские LLM выходят на новый уровень. Будем надеяться, что всё-таки догоним передовые модели мира, лет эдак через 100. Ну а пока, можем порадоваться удешевлению токенов.