Высокопоставленные представители компании Microsoft критически высказались в адрес методов работы коллеги по рынку OpenAI. В центре внимания оказалось использование веб-скрейпинга для обучения искусственного интеллекта. Один из руководителей корпорации назвал эту практику крупнейшей кражей труда в истории человечества. Речь идет о масштабном извлечении контента из открытых источников без явного разрешения авторов.
По имеющейся информации, внутри компаний Microsoft и OpenAI возникли серьезные разногласия по поводу стратегии развития технологий генеративного интеллекта. Руководство обеих организаций обеспокоено тем, что процесс подготовки модели ChatGPT включал анализ миллионов новостных статей. Такие действия вызвали вопросы у юристов и этических комитетов, следящих за соблюдением авторских прав.
Основной конфликт связан с тем, что данные собирались из различных новостных изданий и публикаций. Инженеры загружали огромные массивы текста для обучения нейросетей. Это позволяет системе генерировать ответы, имитирующие стиль профессиональных журналистов. Однако оригинальные материалы использовались без прямого согласия издательств или отдельных авторов.
Сотрудники Microsoft указывали на то, что подобный подход подрывает экономическую модель традиционных СМИ. Издательства вкладывают средства в создание контента, но не получают вознаграждения за его использование в тренировочных наборах данных. Это создает риски для финансовой устойчивости новостных организаций в долгосрочной перспективе.
Внутри компании OpenAI также обсуждались возможные последствия таких действий. Некоторые специалисты выражали опасение, что общественность и регуляторы могут негативно воспринять методы сбора данных. Это может привести к судебным разбирательствам и ограничению доступа к определенным ресурсам в будущем.
Технологии генеративного интеллекта быстро развиваются и требуют больших объемов информации для обучения. Однако вопрос легитимности источников данных остается одним из самых острых в индустрии. Компании ищут баланс между необходимостью доступа к информации и уважением к правам владельцев контента.
Масштаб извлеченных данных вызывает особые опасения. Когда речь идет о миллионах статей, вопрос компенсации становится практически неразрешимым при текущих подходах. Это заставляет пересматривать стратегии сотрудничества с правообладателями и искать новые форматы взаимодействия.
Ситуация подчеркивает необходимость выработки общих стандартов для отрасли. Без четких правил использование чужих материалов для обучения моделей может привести к конфликтам между технологическими гигантами и медиакомпаниями. Решение этих вопросов потребует времени и участия регуляторных органов.



