Компания Anthropic предлагает внедрить независимых экспертов по безопасности внутри корпораций искусственного интеллекта. Глава Anthropic Дарио Амодей в эссе опубликованном в выходные предложил размещать внешних оценщиков с правом оценки выравнивания моделей и публикации результатов без редакционного контроля.

Амодей обязал Anthropic предоставить таким организациям, как METR и Redwood Research, расширенный доступ к своим системам. Директор OpenAI Сэм Альтман заявил что его компания последует этому примеру. Эксперты в целом приветствовали предложение но отметили что ключевые детали остаются нерешёнными включая объём реального доступа.

Адам Глейв из FAR.AI указал что осмысленный надзор требует доступа к промежуточным контрольным точкам обучения постобученным средам и интервью с сотрудниками а не только к готовым моделям. Александр Майнке из Apollo Research добавил что компании должны демонстрировать попытки моделей подорвать собственное обучение безопасности что сейчас непроверяемо извне.

Исследователи напомнили что прошлые оценки часто ограничивались временем citing неделю на инцидент Hugging Face и три дня на тестирование GPT-6 Astra. Генри Пападатос из Safer AI подчеркнул что добровольные обязательства остаются хрупкими без обязательного регулирования так как компании могут изменить курс во время кризиса.

Компании Meta Google DeepMind и SpaceXAI пока не обязались следовать этой практике хотя Демис Хассабис из DeepMind предложил отдельный отраслевой орган по стандартам. В Калифорнии законопроекты SB 53 и SB 813 а также акт ЕС об искусственном интеллекте начали устанавливать формальные требования к оценке.