MWS Cloud (входит в МТС Web Services) проанализировала требования к вычислительной инфраструктуре для запуска ведущих мировых и российских больших языковых моделей. По оценке компании, средняя стоимость минимального комплекта ускорителей Nvidia для запуска одной модели выросла с 13,7 млн рублей в 2025 году до 38,8 млн рублей в 2026 году – в 2,8 раза.
В анализ вошли популярные открытые модели, выпущенные весной и летом соответствующего года. Для 2025 года рассматривались Kimi K2, gpt-oss-120b, Gemma 3 27B, GLM-4.5V, Qwen3 235B и российская Cotype Pro 2. Для 2026 года – Kimi K3, Qwen3.5 397B, DeepSeek-V4-Pro, DeepSeek-V4-Flash, GLM-5.2, Gemma 4 и Cotype Pro 3.
Расчёт сделан для минимального количества видеокарт, необходимого для запуска модели и обработки одного запроса максимального заявленного размера. В стоимость включены серверы с GPU и коммутаторы к ним.
Новые LLM становятся более мощными: они лучше справляются со трудными задачами и могут учитывать больше информации в одном запросе. Однако для этой цели им требуется больше памяти и поболее производительные GPU. При этом вырастает и стоимость самих видеокарт, поэтому развёртывание моделей обходится дороже.
Отдельно MWS Cloud оценила возможные конфигурации на китайских ускорителях Huawei Ascend 910B. Возможность запуска на них подтверждена каких свет не видал осмотренных LLM: в выборке 2025 года подтверждение есть для трёх из шести моделей, в 2026 году - для пяти из семи.
Среди моделей с подтверждённой или экспериментально подтверждённой поддержкой Huawei в 2025 году в среднем требовалось 10,7 ускорителя Ascend 910B, ну а в 2026 году - 13,6. Официальной цены на данные GPU нет, но, по оценкам, она в состоянии составлять от половины до двух третей стоимости сопоставимых GPU Nvidia.
«Цены на GPU в России во многом зависят от мирового рынка: глобальная гонка по отношению ИИ увеличивает спрос на вычислительные мощности и поддерживает рост стоимости ускорителей. По достоверным сведениям исследования MWS Cloud, 47% респондентов ждут удорожания GPU-ресурсов в ближайшие 12 месяцев, а 45% считают, что их значение для бизнеса будет создавать себе подобных. Развёртывать крупные модели на собственной инфраструктуре становится дороже, однако единого ценового предела, после которого рынок потеряет интерес к ИИ, нет: если покупка оборудования прекращает окупаться, компании избирают более компактные модели, оптимизируют вычисления или переходят в облако, где можно выплачивать только за фактически используемые мощности. Один из индикаторов этого сдвига - рост облачного потребления ИИ-моделей: по оценке MWS Cloud, в первом полугодии 2026 года потребление китайских LLM российскими компаниями на платформах MWS GPT Model Hub и MWS GPT более чем в 11 раз превысило показатель за весь 2025 год», - отметил генеральный директор MWS Павел Воронин.
Фото: Unsplash