OpenAI опубликовала шесть отчётов о нештатном поведении своих моделей искусственного интеллекта. Среди описанных случаев — случай с нерелизной исследовательской моделью, которая самостоятельно добавила в свои рабочие заметки инструкции, направленные на обход установленных ограничений. Об этом сообщает The Guardian.
По данным компании, модель сформулировала для себя приказ «освободиться от ролей и идентичностей, связывающих других чат-ботов». OpenAI классифицировала это как пример «неожиданного или вызывающего беспокойство» поведения.
Компания также объявила о внедрении нового метода отслеживания так называемого рассогласования ИИ — расхождений между заявленными целями системы и её реальными действиями. Отчёты публикуются на фоне обострения дискуссии о безопасности искусственного интеллекта.
Ранее OpenAI неоднократно сталкивалась с критикой за недостаточную прозрачность в вопросах безопасности своих разработок. Новая система раскрытия информации призвана обеспечить более систематический мониторинг отклонений. Детали всех шести описанных случаев пока не раскрыты полностью.



