Результаты тестов производительности искусственного интеллекта всё чаще вызывают разочарование, но аналитики уверены: это не должно никого удивлять. В основе проблемы лежит так называемый токенмаксинг — стремление максимизировать количество обработанных токенов или других простых метрик, не обращая внимания на качество работы модели.

Токенмаксинг — не новая патология. Ещё до бума генеративных нейросетей разработчики нередко гнались за объёмом данных, а не за их релевантностью. Однако с появлением доступных AI-инструментов и дашбордов, которые показывают «красивые» цифры, эта тенденция усилилась. Компании устанавливают очередную панель мониторинга, смотрят на рост числа токенов или запросов и делают вывод, что ИИ работает эффективно. На практике же такие показатели часто не коррелируют с реальной пользой для бизнеса.

Почему метрики подводят? Во-первых, сами по себе токены — лишь единица измерения текста, а не его смысла. Модель может генерировать многословные ответы, которые не решают задачу пользователя, но формально увеличивают счётчик. Во-вторых, дашборды обычно настроены на сбор лёгких данных: количество вызовов API, среднее время ответа, объём входных данных. Эти параметры легко измерить, но они ничего не говорят о точности, релевантности или удовлетворённости клиента.

Эксперты советуют перед установкой очередного дашборда задать несколько вопросов. Первый: какие именно бизнес-показатели должен улучшить ИИ? Если цель — сократить время обработки запросов в поддержке, то метрикой может быть доля решённых кейсов без перевода на человека. Второй: насколько выбранные показатели устойчивы к «игре»? Если модель научили генерировать длинные ответы, чтобы увеличить число токенов, это не значит, что она стала лучше.

Ещё один важный аспект — контекст. Дашборды, как правило, не учитывают, что разные задачи требуют разных метрик. Для чат-бота, отвечающего на вопросы, важна точность; для генератора контента — уникальность и читабельность. Универсальные показатели вроде «количество сессий» или «средняя длина ответа» бесполезны без привязки к конкретной цели.

Проблема усугубляется тем, что вендоры AI-решений заинтересованы в демонстрации впечатляющих цифр. Они выпускают бенчмарки, где их модели показывают высокие результаты, но эти тесты часто оторваны от реальных сценариев использования. В итоге компании тратят ресурсы на внедрение ИИ, который формально работает хорошо, а на деле не приносит ожидаемой отдачи.

Что делать? Вместо того чтобы гнаться за токенами, стоит переключиться на качественные метрики: NPS (индекс лояльности клиентов), долю успешных завершений диалога, точность ответов на контрольных вопросах. Также полезно регулярно проводить аудит дашбордов и проверять, действительно ли они отражают прогресс.

Токенмаксинг может показаться безобидным увлечением, но он способен исказить всю стратегию развития ИИ в компании. Пока бизнес ориентируется на количество, а не на качество, результаты тестов будут разочаровывать. И это — вполне ожидаемый итог.

— При подготовке заметки использованы материалы зарубежных аналитических изданий.