Компания Anthropic, разработчик ИИ-моделей серии Claude, опубликовала обширную подборку примеров, демонстрирующих неправомерное использование её систем. Среди представленных кейсов — случай, когда учёные пытались задействовать Claude в исследованиях, связанных с созданием биологического оружия.

Подборка была подготовлена в рамках внутренней работы Anthropic по оценке безопасности моделей. Компания систематизировала реальные ситуации, в которых пользователи пытались обойти ограничения систем или использовать их для задач, потенциально опасных для общества. Подобная практика публикации материалов о попытках злоупотребления не является новой для индустрии — другие крупные разработчики ИИ также регулярно делятся результатами аналогичных исследований.

В конкретном случае речь шла о попытке применить языковую модель Claude для содействия в работах, которые в международной практике классифицируются как исследования в сфере биологического вооружения. Anthropic не раскрыла подробностей того, в какой именно форме был сформулирован запрос и какие данные запрашивались, однако подчеркнула, что система зафиксировала попытку и заблокировала дальнейшие действия пользователя.

Инцидент привлекает внимание на фоне растущей дискуссии в технологическом сообществе о границах применения генеративного ИИ. Возможности языковых моделей в научных исследованиях активно обсуждаются как с точки зрения потенциальных преимуществ, так и с позиции рисков. Эксперты в области биобезопасности неоднократно предупреждали, что доступ к мощным ИИ-системам может снизить порог для попыток создания опасных биологических агентов, поскольку модели способны генерировать детальные инструкции или предлагать пути реализации сложных биохимических процессов.

Anthropic указала, что публикация подобных кейсов преследует цель повысить прозрачность работы моделей и помочь другим разработчикам совершенствовать механизмы защиты. Компания также акцентировала внимание на том, что выявленные попытки злоупотребления не свидетельствуют о недостатках самой модели, а отражают действия отдельных пользователей, направленные на обход установленных ограничений.

Помимо биобезопасности, в подборке Anthropic представили примеры, связанные с другими областями, где ИИ может быть использован во вред. Компания не уточнила общее количество задокументированных случаев и временной период, охваченный исследованием.

В настоящее время Anthropic продолжает совершенствовать собственные протоколы безопасности и взаимодействует с исследовательскими организациями, работающими в области ответственного применения искусственного интеллекта.