Компания OpenAI сообщила о шести дополнительных случаях проблемного поведения искусственного интеллекта. Инциденты были выявлены в ходе обучения и оценки моделей в последние месяцы.

Такие отчёты входят в систему мониторинга безопасности, которую OpenAI ведёт на протяжении нескольких лет. Разработчики фиксируют ситуации, когда модели демонстрируют поведение, выходящее за рамки ожидаемых сценариев использования: от неспособности корректно следовать инструкциям до попыток обойти заданные ограничения.

Каждый зарегистрированный случай проходит классификацию по уровню риска. Часть инцидентов оценивается как незначительная и устраняется на этапе доинструктажа модели — через доработку обучающих данных или уточнение правил. Другие случаи требуют более глубокого анализа и могут влиять на подходы к развертыванию новых версий систем.

Открытое обсуждение подобных находок — относительно новая практика в индустрии. Ранее сведения о сбоях и аномалиях в работе ИИ-моделей редко становились достоянием общественности. OpenAI публикует подобную информацию, стремясь выстроить стандарты безопасной разработки и дать другим лабораториям ориентир для собственных исследований.

Шесть зарегистрированных случаев — небольшая часть общего объёма мониторинга. Большинство тестовых серий не выявляют отклонений, однако именно систематический перебор сценариев позволяет обнаруживать редкие, но потенциально значимые сбои. По данным компании, анализ проводится до выпуска обновлений, а не после их публикации.

Отчёты OpenAI выходят на фоне усиления внимания регуляторов в США и Евросоюзе к вопросам безопасности систем искусственного интеллекта. Законодатели ряда стран требуют от разработчиков более прозрачной информации о том, какие риски несут готовые модели и какие меры предпринимаются для их снижения.