В Microsoft называли обучение ИИ на новостях "крупнейшей кражей труда"

искусственный интеллект, технологии / Getty Images
Фото: искусственный интеллект, технологии / Getty Images

Рассекреченные материалы судебного дела между американскими издателями, OpenAI и Microsoft показали, что внутри технологических компаний годами обсуждали риски использования миллионов газетных статей для обучения искусственного интеллекта. Один из руководителей Microsoft называл массовое копирование контента потенциально "крупнейшей кражей труда в истории человечества", а в OpenAI предупреждали, что ИИ может стать "экзистенциальной угрозой" для издателей.

Документы были обнародованы в рамках иска The New York Times и других американских медиакомпаний против OpenAI и Microsoft. Издатели обвиняют технологические компании в использовании защищённых авторским правом статей без разрешения и оплаты для создания и обучения больших языковых моделей. Microsoft и OpenAI отрицают нарушения и утверждают, что обучение моделей подпадает под американскую доктрину fair use - допустимого использования защищённых произведений.

Наиболее резкие оценки содержатся во внутренних документах директора Microsoft по прикладным наукам Брента Хехта. В 2023 году он писал, что миллионы людей могут воспринять использование их работ большими моделями как беспрецедентную кражу, а сам процесс называл потенциально "крупнейшей кражей труда в истории человечества".

В другой внутренней презентации Microsoft Хехт предупреждал о риске своеобразного "замкнутого круга". По его мнению, ИИ-сервисы могут сокращать трафик и доходы издателей, ослабляя бизнес компаний, которые создают качественный контент, необходимый самим разработчикам ИИ для обучения будущих моделей. Microsoft зафиксировала падение переходов на сайты отдельных издателей из Copilot на 83-93% по сравнению с традиционным поиском Bing, следует из материалов, приведённых истцами.

Похожие опасения существовали и внутри OpenAI. Руководитель ChatGPT Ник Терли в июне 2023 года писал, что искусственный интеллект представляет "экзистенциальную угрозу" для издателей. В феврале 2024 года он отмечал, что ИИ-продукты уже в значительной степени заменяют первоисточники и с развитием технологии будут делать это всё больше.

Масштаб использованного контента также стал одним из ключевых аргументов медиакомпаний. По данным судебных материалов, один лишь набор данных на основе Common Crawl содержал более 2 млн документов из домена The New York Times. В других наборах для дополнительного обучения моделей истцы насчитали десятки тысяч копий материалов NYT, Daily News и Center for Investigative Reporting.

Отдельная часть претензий касается материалов с платным доступом. В судебных документах приводится внутренняя переписка, в которой сотрудник OpenAI сообщал сооснователю и президенту компании Грегу Брокману о способе обхода платного доступа The New York Times. В то же время именно истцы трактуют эти материалы как доказательство сознательного обхода ограничений, а значительная часть первичных приложений к судебным документам до сих пор остаётся закрытой.

Генеральный директор Microsoft Сатья Наделла во время дачи показаний заявил, что материалы, находящиеся за paywall, должны лицензироваться для использования в обучении или работе ИИ. По его словам, если бы ему было известно, что OpenAI обучала модели на полученных таким образом материалах, Microsoft могла бы потребовать переобучения моделей.

Microsoft подчеркнула, что высказывания Хехта являются личной позицией одного сотрудника, а не юридической оценкой или официальной позицией компании. Корпорация продолжает настаивать, что использование материалов для ИИ является трансформативным и соответствует законодательству об авторском праве, а Copilot не является заменой журналистским материалам.

Дело рассматривает федеральный суд Южного округа Нью-Йорка. Судья Сидни Стайн сейчас рассматривает ходатайства сторон о вынесении решения без полноценного судебного разбирательства. Для издателей внутренние документы стали важным аргументом в попытке доказать, что ИИ-продукты не только используют их контент, но и могут напрямую конкурировать с первоисточниками. Окончательного решения о законности такого использования материалов суд пока не вынес.

По материалам: The New York Times, TechCrunch, Ars Technica

Популярные темы форума

analytics