Разработчики ИИ массово закупают бумажные книги для обучения моделей — после эти книги уничтожаются Миллионы подержанны
Миллионы подержанных книг закупают через посредников разработчики систем искусственного интеллекта, чтобы формировать из них массивы высококачественных данных для обучения своих ИИ-моделей. Основной проблемой ставится то, что в последние годы интернет заполонил некачественный сгенерированный ИИ-контент, загрязняющий обучающие массивы и контрпродуктивный для обучения ИИ.
В итоге разработчики стали обращаться к печатным книгам, которые вышли до 2022 года, когда появился ChatGPT. В частности, компания Anthropic потратила несколько миллионов долларов на оцифровку огромного количества печатных книг для обучения Claude, после чего эти книги были просто уничтожены.
Так, для сканирования книг компания пользовалась услугами нескольких фирм, поставивших весь физический процесс на конвейер. Одна из них, Datamation Information Services, предлагает услуги по сканированию больших объемов книг «разрушающим методом» — книги разбираются и постранично отправляются в промышленный сканер.
Общественники и эксперты видят здесь фундаментальную проблему. Отсканированные материалы попадают в закрытые базы данных, к которым у широкой публики нет доступа. Таким образом, ИИ становится умнее, но ценная структурированная информация может быть утрачена безвозвратно.
Это Борус | Мы в MAX