1. Главная
  2. Зачем ИИ-компании скупают книги

Зачем ИИ-компании скупают книги

6 октября 20262 минуты чтения
Иллюстрация материала

Разработчики ИИ скупают миллионы бумажных книг, чтобы использовать их для обучения нейросетей. О небывалом спросе сообщают книжные магазины и букинисты. Рассказываем, почему печатная литература стала ценным ресурсом и по какой причине книги после оцифровки уничтожают.

Зачем искусственному интеллекту книги

Чтобы обучать языковые ИИ-модели, нужны огромные массивы текстов. Бумажные книги подходят для этого лучше, чем веб-тексты. В них есть:

  • проверенные данные;
  • узкие знания, которых нет в интернете;
  • профессиональная редактура;
  • сложная структура, которую не могут воспроизвести поисковые роботы.

Но главная причина — чистота данных. Интернет все больше наполняется текстами, сгенерированными ИИ. Обучение на таком материале приведет к коллапсу модели: нейросеть попадет в замкнутый круг и будет воспроизводить собственные паттерны и ошибки.

Бумажные книги таких рисков лишены, особенно изданные до 2022 года — в них точно нет сгенерированного текста. По мнению разработчиков, книги научат ИИ писать так же точно и убедительно, как люди.

Почему бумажные, а не электронные

Поначалу компании использовали не только печатные книги, но и пиратские копии — так было дешевле и проще, чем оцифровывать бумажные. Однако вскоре разработчики столкнулись с судебными исками от правообладателей.

В результате судьи признали: обучать ИИ на книгах можно, если они получены законно. Пиратские копии под такую защиту не подпадают. Купить и оцифровать печатное издание проще, чем искать правообладателей и получать лицензию на электронную версию, поэтому ИИ-компании обратились к книжным магазинам и букинистам.

Как книги превращают в обучающий материал

Чтобы обучать ИИ с помощью бумажных книг, их нужно оцифровать. Для этого у книги срезают корешок, а полученную стопку листов пропускают по одному через потоковый сканер. Текст распознают с помощью OCR (англ.Optical Character Recognition — технология оптического распознавания символов), исправляют ошибки и добавляют в цифровую библиотеку.

Такое сканирование называется деструктивным. Преимущество в том, что страницы не изгибаются и не дают теней — оцифровка получается быстрой и точной. Есть и минус: восстановить разобранную книгу нельзя, поэтому бумага идет в переработку. Бережные методы существуют, но они медленнее и дороже.

Текст: