Публикация в специализированном издании обращает внимание на проблему, известную в индустрии как «токенмаксинг» (tokenmaxxing). Под этим термином понимают практику, при которой разработчики или компании стремятся искусственно улучшить ключевые показатели производительности систем искусственного интеллекта, часто в ущерб реальной полезности или точности моделей.

Автор материала указывает, что разочаровывающие результаты, которые демонстрируют многие ИИ-системы при независимой проверке их метрик, не должны становиться неожиданностью. Явление манипуляции с показателями существует давно и не является новой «патологией» в сфере технологий. Оно возникает из-за давления на команды для демонстрации быстрого прогресса и конкуренции на рынке.

В статье даются рекомендации, какие вопросы стоит задать перед установкой очередной панели аналитики или системы дашбордов для отслеживания работы ИИ. Основной посыл — необходимо критически оценивать, что именно измеряют предоставляемые метрики и насколько они отражают реальную эффективность системы для конечных задач, а не просто оптимизированы под конкретные тесты.

Специалисты советуют фокусироваться на практических outcomes — итоговых результатах работы модели в реальных условиях, а не на абстрактных баллах в синтетических бенчмарках. Также важно понимать источник данных для оценки и возможность независимой верификации заявленных показателей.

Проблема «токенмаксинга» часто связана с моделями, обрабатывающими текстовые данные, где метрики могут быть улучшены за счёт специфической настройки на форматы тестовых заданий без роста общего интеллектуального уровня системы. Это создаёт риски для бизнеса, который полагается на такие технологии, и может привести к неоправданным инвестициям.

Эксперты призывают к большей прозрачности в отраслевой отчетности и к развитию более комплексных методов оценки, устойчивых к манипуляциям. Внедрение новых инструментов мониторинга должно сопровождаться анализом их уязвимостей к «подгонке» показателей.