ВОСКРЕСЕНЬЕ, 02 АВГУСТАUSD: 79.46EUR: 91.19

Почему ИИ внезапно начал скупать старые книги по всему миру?

Художественная иллюстрация. Бумажные книги неожиданно стали ценным источником данных для обучения современных моделей искусственного интеллекта.
@ridlife.ru Художественная иллюстрация. Бумажные книги неожиданно стали ценным источником данных для обучения современных моделей искусственного интеллекта.

Старые книги, десятилетиями пылившиеся на полках букинистов, внезапно превратились в ценный ресурс для индустрии искусственного интеллекта.

Продавцы в Европе, Австралии и Северной Америке сообщают о необычных массовых заказах на давно снятые с продажи справочники, научную литературу и малотиражные издания. Покупателей интересует не состояние переплета и не коллекционная ценность — им нужен текст.

Причина проста: значительная часть человеческих знаний до сих пор не попала в интернет. Одновременно сам интернет все быстрее заполняется материалами, созданными нейросетями. Поэтому книги, написанные и отредактированные людьми до бума генеративного ИИ, становятся особенно привлекательным источником данных для обучения новых моделей.

Но у этой гонки есть тревожная сторона. Некоторые компании не просто сканируют купленные книги, а срезают с них корешки, пропускают отдельные страницы через промышленные сканеры и отправляют остатки на переработку. Документально подтверждено, что именно так поступала компания Anthropic, создавшая чат-бот Claude. При этом доказательств того, что все нынешние массовые заказы связаны с разработчиками ИИ, пока нет.

Проект, который хотели сохранить в тайне

Наиболее подробно подобная схема описана в материалах судебного разбирательства между Anthropic и группой писателей. Из документов стало известно о внутреннем проекте компании под кодовым названием Project Panama.

В начале 2024 года Anthropic начала в промышленных масштабах покупать бумажные книги. Компания привлекла бывшего руководителя партнерских программ Google Books и сотрудничала с крупными продавцами подержанной литературы. Целью было создание собственной цифровой библиотеки для обучения языковых моделей.

Процесс называли «разрушительным сканированием». У книги снимали переплет, гидравлическая машина срезала корешок, после чего свободные страницы быстро оцифровывали. Бумажный экземпляр при этом восстановить было уже невозможно: после сканирования его выбрасывали или отправляли в переработку.

Во внутренних документах Project Panama описывался как попытка «разрушительным способом отсканировать все книги мира». Там же сотрудников просили не рассказывать о проекте за пределами компании. Подробности операции стали публичными лишь после раскрытия материалов судебного дела. О проекте подробно сообщила The Washington Post.

Точное количество обработанных экземпляров в опубликованных документах частично скрыто. Однако речь шла о миллионах книг и десятках миллионов долларов. Одна из представленных подрядчиками схем предполагала оцифровку от 500 тысяч до двух миллионов томов всего за шесть месяцев.

Почему компаниям понадобилась бумага

Большие языковые модели обучаются на огромных массивах текстов. Чем разнообразнее и качественнее эти материалы, тем лучше модель понимает язык, факты, стили письма и связи между понятиями.

Первые поколения генеративного ИИ получили значительную часть знаний из открытого интернета. Но веб-страницы не охватывают всю человеческую культуру. Многие учебники, региональные исследования, технические руководства, мемуары и специализированные монографии никогда не оцифровывались или доступны лишь за плату.

Книга при этом представляет собой особенно удобный обучающий материал. Ее текст обычно прошел авторскую доработку, редактуру и проверку издательства. В отличие от случайного набора веб-страниц, книга содержит последовательное изложение темы и сохраняет контекст на протяжении сотен страниц.

Старые издания обладают еще одним преимуществом: они гарантированно созданы до появления ChatGPT и массового распространения генеративных моделей. Современный интернет все сильнее смешивает человеческие и машинные тексты. Исследователи уже предупреждают, что распространение синтетических материалов снижает разнообразие источников и способно создавать замкнутый цикл, в котором новые модели учатся на результатах работы предыдущих. Эту проблему, в частности, изучают авторы работы о «коллапсе поиска» из-за загрязнения интернета синтетическим контентом.

Букинисты заметили необычные заказы

В 2026 году продавцы подержанных книг в нескольких странах начали рассказывать о массовых заказах, не похожих на обычные покупки коллекционеров или библиотек.

Берлинский букинист Урбан Церфас сообщил немецкому общественному вещателю Tagesschau, что за короткое время получил множество заказов на издания, которые до этого годами почти никого не интересовали. Покупатели приобретали по одному экземпляру разных книг, включая устаревшую научную и техническую литературу.

Похожие сообщения поступали из Нидерландов. Один из местных продавцов получил от компании 2077AI список примерно из трех тысяч англоязычных изданий — от сборников фольклора до специализированных научных работ. В письме говорилось о международном проекте по сбору книг на разных языках. Об этом рассказывало издание NL Times.

Однако происхождение всех подобных заказов остается неясным. Некоторые книги покупают посредники, не раскрывающие конечных клиентов. Канадская компания Zoom Books, оказавшаяся в центре внимания австралийских продавцов, называет себя переработчиком и распространителем книг и отрицает, что занимается их разрушительным сканированием для обучения ИИ.

Поэтому нельзя утверждать, что за каждой крупной закупкой стоят технологические корпорации. Сейчас подтвержден сам необычный всплеск спроса и существуют отдельные документированные проекты вроде Project Panama. Связь остальных заказов с обучением нейросетей во многих случаях остается обоснованным, но все же предположением книготорговцев.

Действительно ли уничтожают редкие книги?

Самый громкий тезис этой истории — будто ИИ-компании массово уничтожают уникальные раритеты. Пока доступные доказательства не позволяют говорить об этом настолько категорично.

Известно, что Anthropic разрушительным способом оцифровала миллионы приобретенных книг. Но опубликованный список не показывает, сколько среди них было действительно редких или единственных сохранившихся экземпляров. Значительную часть закупок могли составлять массовые издания, учебники и обычная подержанная литература.

Совсем другая ситуация возникает, когда речь идет о малотиражной или давно не переиздававшейся книге. Уничтожение одного из немногих доступных экземпляров может сократить возможность исследователей и читателей познакомиться с оригиналом.

Физическая книга также содержит информацию, которой нет в распознанном тексте: особенности бумаги и печати, владельческие пометки, подписи, вклейки, штампы, исправления и следы прежнего использования. Для историка или архивиста они иногда не менее важны, чем напечатанные слова.

Австралийские букинисты, опрошенные газетой The Guardian, опасаются именно этого. По их мнению, автоматическая закупка по ISBN не позволяет отличить обычный дублет от экземпляра с уникальными особенностями.

Цифровая копия остается, но не у читателя

Сторонники промышленного сканирования могут возразить: содержание книги не исчезает, а переходит в цифровую форму. С юридической точки зрения американский суд частично согласился с такой логикой.

В июне 2025 года судья Уильям Алсап рассмотрел дело Bartz v. Anthropic. Он постановил, что компания законно купила бумажные экземпляры и могла распоряжаться ими, а замена одной физической копии одной внутренней цифровой копией в данном случае подпадала под принцип добросовестного использования.

Суд отдельно отметил, что Anthropic не распространяла полученные сканы за пределами компании. Но именно это и создает культурную проблему: физический экземпляр исчезает из обращения, а его цифровая версия остается в закрытой корпоративной библиотеке.

В отличие от проектов публичной оцифровки, читатель, библиотека или исследователь не получают доступа к созданному файлу. Знание сохраняется для обучения коммерческой системы, но не обязательно сохраняется как общедоступный источник.

Спор об авторских правах этим не исчерпывается

Судебное решение не признало законными все способы, которыми Anthropic собирала книги. До запуска Project Panama компания скачала миллионы произведений из пиратских библиотек, включая Books3, LibGen и Pirate Library Mirror.

Суд счел обучение моделей преобразующим использованием произведений, но отказался распространить такую защиту на создание постоянной библиотеки из нелегально полученных файлов. Позже Anthropic согласилась выплатить авторам 1,5 миллиарда долларов для урегулирования претензий, связанных с пиратскими копиями.

Таким образом, здесь необходимо разделять два вопроса. Первый — может ли компания обучать модель на книгах. Второй — каким способом она получила эти книги и имеет ли право создавать из них собственное хранилище. Юридические ответы зависят от страны и продолжают оспариваться.

Почему старые книги стали новым сырьем для ИИ

Происходящее показывает, как изменилась главная проблема индустрии. Еще недавно гонка ИИ была прежде всего гонкой за более мощными процессорами. Теперь разработчики все чаще сталкиваются с другим дефицитом — нехваткой качественных человеческих данных.

Старые книги ценны не потому, что они старые сами по себе. Они содержат тексты, которые не повторяют содержимое современного интернета, отражают языки и профессиональные области с небольшим цифровым присутствием и гарантированно созданы людьми.

Для ИИ-компаний это практически неосвоенный континент информации. Для библиотек, авторов и книготорговцев — часть культурного наследия, ценность которого невозможно свести только к набору слов.

Поэтому главный спор заключается не в том, можно ли разрезать еще один массовый учебник. Вопрос в другом: кто решает, какие книги можно превратить в закрытые обучающие данные, как убедиться, что среди них нет незаменимых экземпляров, и почему цифровые копии уничтоженных изданий не должны становиться доступными обществу.

Индустрия искусственного интеллекта вернулась к бумаге потому, что в интернете оказалось далеко не все. Теперь от правил этой новой гонки зависит, помогут ли старые книги сохранить человеческие знания — или исчезнут с полок ради цифровых библиотек, которые никто, кроме их владельцев, не сможет открыть.