Перейти к содержимому

OpenAI и Microsoft раскрыли неудобную правду об ИИ: внутренние документы говорят о «краже» контента и разрушении веба

В рассекреченных материалах судебного дела The New York Times против OpenAI и Microsoft обнаружились внутренние документы и переписка сотрудников компаний, в которых использование интернет-контента для обучения ИИ называлось «кражей беспрецедентных масштабов». Одновременно представители компаний признавали, что генеративный ИИ способен отбирать аудиторию у сайтов, на материалах которых он обучался.

В рамках продолжающегося дела The New York Times против OpenAI и Microsoft были опубликованы ранее закрытые материалы. Они содержат переписку и внутренние документы, показывающие, что сотрудники обеих компаний задолго до нынешних публичных споров осознавали возможные последствия массового сбора контента для обучения больших языковых моделей.



Microsoft назвала происходящее «кражей»

Одно из наиболее резонансных высказываний принадлежит Бренту Хехту, директору Microsoft по прикладным исследованиям. Внутренних документах он охарактеризовал массовое использование чужого контента для обучения ИИ как «ошеломляющую кражу беспрецедентных масштабов», а в другом контексте — как «крупнейшую кражу труда в истории человечества».

При этом Microsoft подчёркивает, что эти слова отражали личную позицию сотрудника и не являлись юридической оценкой компании. Официальная позиция Microsoft в суде заключается в том, что использование материалов для обучения ИИ в соответствующих случаях может подпадать под доктрину fair use.

В Microsoft опасались «замкнутого цикла»

Ещё более показательной оказалась внутренняя оценка последствий развития ИИ. В одном из документов Microsoft говорится о так называемом «doom loop» — замкнутом цикле, который способен одновременно ухудшать качество моделей и наносить ущерб всему интернету.

Логика описанного механизма проста: ИИ использует материалы сайтов для обучения и формирования ответов, после чего пользователю уже необязательно переходить на оригинальный ресурс. В результате сайты получают меньше посещений, доходов и стимулов создавать новый контент — а это, в свою очередь, сокращает количество качественных материалов, доступных для будущего обучения моделей.

В документе этот конфликт описывался как необычная ситуация, когда конечный продукт угрожает экономической основе поставщиков контента, от которых зависит его собственная информационная база.

OpenAI тоже видела угрозу для СМИ

В рассекреченных материалах обнаружились и высказывания руководителей OpenAI. Глава ChatGPT Ник Турли, согласно документам, предупреждал, что издатели сталкиваются с «экзистенциальной угрозой», поскольку продукты компании могут заменять традиционное потребление новостей.

Президент OpenAI Грег Брокман, в свою очередь, отмечал способность моделей хорошо работать с новостными текстами и предсказывать продолжение статей.

Отдельно в документах упоминаются случаи обхода платного доступа к материалам СМИ. TechCrunch сообщает, что сотрудники OpenAI обсуждали способы обхода paywall The New York Times, а один из руководителей положительно отреагировал на сообщение о подобном способе.

ИИ действительно начал отбирать трафик у сайтов

Судебные материалы содержат и данные о практическом эффекте подобных систем. Согласно представленным в деле данным Microsoft, переходы пользователей из Bing Chat на сайты The New York Times были на 87–93% ниже, чем при обычном поиске Bing. Для сайтов других истцов снижение составляло примерно 83–91%.

Глава Microsoft Сатья Наделла также говорил на допросе, что пользователи получают информацию непосредственно в интерфейсе чат-бота, вместо перехода на исходный сайт. Это принципиально меняет привычную модель работы интернета, где поисковая система выступала посредником, но всё же направляла пользователя к первоисточнику.

Спор теперь выходит далеко за пределы авторского права

Главный юридический вопрос дела заключается в том, может ли использование защищённого авторским правом контента для обучения ИИ считаться допустимым fair use. OpenAI и Microsoft отстаивают такую позицию, тогда как издатели утверждают, что компании фактически используют их материалы без разрешения и создают продукты, способные напрямую конкурировать с оригинальными источниками.

Рассекреченные документы важны именно потому, что позволяют увидеть внутренние опасения компаний относительно последствий собственной бизнес-модели. Однако сами по себе отдельные высказывания сотрудников не означают признания компаниями нарушения закона: Microsoft прямо заявляет, что приведённые слова одного из руководителей не отражают официальную позицию корпорации.

Вывод

Новые материалы судебного дела показывают, что внутри OpenAI и Microsoft существовало серьёзное понимание проблемы, которая сегодня становится одним из главных споров вокруг генеративного ИИ. Речь идёт уже не только о том, имеют ли компании право использовать чужие тексты для обучения моделей, но и о более фундаментальном вопросе: что произойдёт с интернетом, если ИИ будет получать информацию с сайтов, а затем постепенно заменять сами переходы пользователей на эти сайты.

Пока окончательная юридическая оценка этих практик остаётся за судом. Но опубликованные документы показывают, что потенциальный конфликт между ИИ и экономикой традиционного веб-контента обсуждался внутри самих технологических компаний задолго до того, как стал публичным.

Пока нет комментариевВойдите в аккаунт, чтобы начать обсуждение.