Сегодня, 17 сентября, частично рассекретили материалы по делу The New York Times и других издателей против OpenAI и Microsoft. Самая сильная часть — внутренние высказывания сотрудников компаний, которые издатели теперь используют против них в суде.
Как пишет Bloomberg Law, руководитель ChatGPT в OpenAI Ник Тёрли писал: «Наши продукты в значительной степени являются заменой, точка». Глава Microsoft Сатья Наделла в показаниях тоже признал, что разговоры с чат-ботами в некоторых случаях уже заменяют посещение сайтов издателей.
Но ещё жёстче высказался директор Microsoft по прикладным исследованиям Брент Хехт. Обсуждая копирование миллионов новостных статей без разрешения их владельцев, он написал, что это потенциально может стать «крупнейшей кражей труда в истории человечества». Хехт также считал, что признание такого использования контента добросовестным фактически превратит само понятие fair use в насмешку.
Внутри OpenAI звучали похожие опасения. Директор по политике Джек Кларк писал, что создаваемые компанией системы всё чаще будут заменять труд людей, формирующих культуру общества. То есть сотрудники компаний обсуждали не только возможные проблемы с авторским правом, но и более широкий эффект: ИИ получает человеческий контент, а затем начинает конкурировать с теми, кто этот контент создаёт.
Из документов также стало известно, насколько тесно Microsoft помогала OpenAI собирать данные. В рамках проекта Project Taxi компания передала OpenAI массив из миллиардов веб-страниц, первоначально собранных для Bing. Для другого проекта — Project Mango — Microsoft разработала и обслуживала специальный краулер, который копировал содержимое сайтов для OpenAI.
Есть и особенно неприятный для OpenAI эпизод. По версии издателей, сотрудники компании рассказали президенту OpenAI Грегу Брокману о способе обходить платный доступ The New York Times при сборе данных. В опубликованных судебных материалах его ответ приводится как короткое: «ah nice».
Сотрудники Microsoft при этом сами опасались, что система может войти в своеобразный «порочный круг». Если чат-боты всё чаще отвечают вместо сайтов, издатели получают меньше переходов и денег, производство новых материалов становится менее выгодным, а значит со временем уменьшается и объём нового человеческого контента, на котором могут обучаться следующие поколения ИИ.
В ходатайстве издателей приводятся внутренние данные Microsoft: в отдельных сценариях переходы к материалам The New York Times и New York Daily News после появления ИИ-ответов снижались на 83–93%, а к сайтам Ziff Davis — на 51–94%. Это данные, которые истцы приводят в свою пользу, а не итоговый вывод суда.
Microsoft подчёркивает, что слова Брента Хехта были его личным мнением и не отражают официальную позицию компании. OpenAI и Microsoft продолжают настаивать, что использование большого массива доступных материалов для обучения моделей может подпадать под принцип fair use.
Однако рассекреченные документы делают спор заметно острее: теперь издатели могут ссылаться не только на собственные утверждения о том, что ИИ использует их контент и одновременно отбирает аудиторию. Очень похожие риски обсуждались и внутри самих OpenAI и Microsoft.
Комментарии