Почему общаться с ИИ на русском в 4 раза дороже, чем на английском Как оказалось, зарубежные нейросети тратят гораздо б
Как оказалось, зарубежные нейросети тратят гораздо больше токенов на обработку русского текста, чем английского. И здесь нет никакого заговора корпораций или дискриминации — это чистая математика. Дело в том, что искусственный интеллект «мыслит» не целыми словами, а их кусочками, размер которых зависит от алфавита. Именно за объём этих сгенерированных фрагментов вы платите при использовании API или расходуете лимиты в подписках.
Поскольку большинство ИИ-моделей создаются на Западе, их словари заточены под английский язык. Популярные английские слова ИИ считывает целиком как один токен. А вот с русской кириллицей, сложной морфологией и длинными окончаниями зарубежные алгоритмы справляются плохо. Нейросеть буквально «шинкует» русские слова на мелкие части из 2-3 букв. В итоге один и тот же текст по смыслу на русском языке занимает в разы больше токенов, чем на английском.
Масштаб переплаты сильно зависит от архитектуры модели. Например, у последних версий GPT и Gemini разница составляет всего около 20%. У китайской DeepSeek русский язык выходит дороже примерно на 38%. А вот абсолютным антирекордом отметилась модель Claude Opus от Anthropic — из-за неэффективного токенизатора обработка кириллицы в ней обходится почти в 4 раза дороже, чем работа с аналогичным английским текстом в GPT.
OZMAN