Для тех, кто пропустил на прошлой неделе: 404 Media выпустило расследование о том, как ИИ-корпорации массово скупают и физически уничтожают бумажные книги ради чистых датасетов для обучения LLM. Что об этом известно:
- ➡️ Открытый интернет критически «отравлен» ИИ-контентом. Разработчикам LLM срочно нужны чистые датасеты — тексты, гарантированно написанные людьми до 2022 года. И они нашли решение — скупать физические книги. Это идеальный, структурно чистый источник данных.
- ➡️ Компании (в частности, в этом уличили Anthropic) закупают книги, срезают переплеты гидравлическими резаками, прогоняют листы через высокоскоростные промышленные сканеры, а бумагу уничтожают.
- ➡️ Крупные книжные базы (например, ISBNdb) стали выступать дата-брокерами. Они собирают для ИИ-лабораторий оптовые партии от 1 000 до 1 000 000 книг. Брокеры гарантируют ИИ-компаниям полную секретность закупок, чтобы избежать PR-катастроф (просчитались, но где).
- ➡️ Процесс опирается на «доктрину первой продажи» (владелец физической копии может делать с ней что угодно) и fair use (оцифровка для обучения алгоритма судами часто признается «трансформативным» использованием).
- ➡️ Букинисты в США и Европе фиксируют аномальный спрос на любые книги с ISBN. Под нож массово и безвозвратно идут редкие, иностранные и вышедшие из печати издания, которые скупаются не глядя. Anthropic уже пришлось выплатить $1,5 млрд по коллективному иску авторов за нарушение авторских прав при таком сборе данных.
Telegram🛑Канал для трансляций🛑ВКонтакте🛑Max🛑Дорогой дневник🛑Дзен


Дискуссия