Зачем искусственному интеллекту книги
Чтобы обучать языковые ИИ-модели, нужны огромные массивы текстов. Бумажные книги подходят для этого лучше, чем веб-тексты. В них есть:
- проверенные данные;
- узкие знания, которых нет в интернете;
- профессиональная редактура;
- сложная структура, которую не могут воспроизвести поисковые роботы.
Но главная причина — чистота данных. Интернет все больше наполняется текстами, сгенерированными ИИ. Обучение на таком материале приведет к коллапсу модели: нейросеть попадет в замкнутый круг и будет воспроизводить собственные паттерны и ошибки.
Бумажные книги таких рисков лишены, особенно изданные до 2022 года — в них точно нет сгенерированного текста. По мнению разработчиков, книги научат ИИ писать так же точно и убедительно, как люди.

Почему бумажные, а не электронные
Поначалу компании использовали не только печатные книги, но и пиратские копии — так было дешевле и проще, чем оцифровывать бумажные. Однако вскоре разработчики столкнулись с судебными исками от правообладателей.
В результате судьи признали: обучать ИИ на книгах можно, если они получены законно. Пиратские копии под такую защиту не подпадают. Купить и оцифровать печатное издание проще, чем искать правообладателей и получать лицензию на электронную версию, поэтому ИИ-компании обратились к книжным магазинам и букинистам.

Как книги превращают в обучающий материал
Чтобы обучать ИИ с помощью бумажных книг, их нужно оцифровать. Для этого у книги срезают корешок, а полученную стопку листов пропускают по одному через потоковый сканер. Текст распознают с помощью OCR (англ.Optical Character Recognition — технология оптического распознавания символов), исправляют ошибки и добавляют в цифровую библиотеку.
Такое сканирование называется деструктивным. Преимущество в том, что страницы не изгибаются и не дают теней — оцифровка получается быстрой и точной. Есть и минус: восстановить разобранную книгу нельзя, поэтому бумага идет в переработку. Бережные методы существуют, но они медленнее и дороже.
