Google судят не за ответы AI, а за право читать всю библиотеку

Сегодня • Techmeme
Для индустрии искусственного интеллекта книги давно выглядят как топливо: чем больше текстов попадает в обучающий корпус, тем убедительнее ответы модели. Но новый иск заставляет посмотреть на эту формулу иначе. Возможно, главный ресурс Google — не алгоритмы, а чужая работа, которую компания считает доступной для машинного чтения.

Hachette, Elsevier, Cengage Learning и писатель Скотт Туроу подали иск против Google, обвинив компанию в использовании миллионов защищённых авторским правом книг и статей для создания и обучения AI-моделей. Об этом сообщает A.J. Katz в The Wrap. Истцы утверждают, что тексты были превращены в материал для коммерческих систем без необходимого разрешения авторов и правообладателей. В центре дела — не отдельная ошибка чат-бота, а сам способ производства генеративного AI.

Общепринятая позиция технологических компаний звучит привычно: обучение модели — это анализ данных, а не публикация каждой исходной книги. Google и другие разработчики рассматривают машинное чтение как технологический процесс, сопоставимый с индексированием веба. В этой логике модель не продаёт роман или научную статью, а извлекает закономерности из огромного массива информации. Значит, использование текста должно быть допустимой частью инновационного цикла.

А что если эта рамка перевёрнута? Тогда Google не просто «изучает» книги, а получает экономическое преимущество благодаря масштабу чужого труда. Миллионы произведений становятся невидимой инфраструктурой продукта: пользователь видит ответ модели, а автор не видит ни контроля, ни переговоров, ни понятной компенсации. Для Hachette, Elsevier, Cengage Learning и Туроу вопрос поэтому звучит жёстче, чем спор о fair use: может ли компания строить новый рынок, сначала присвоив материал, на котором этот рынок держится?

Юридический исход определит не только судьбу Google. Он задаст цену доступа к культурному архиву для всей отрасли: если обучение признают обычным техническим использованием, издатели потеряют рычаги влияния; если нет, разработчикам придётся договариваться о лицензиях, ограничивать корпуса или раскрывать, какие именно тексты использованы. Формулировка об «миллионах» особенно важна: речь идёт не о случайной цитате, а о промышленном масштабе потребления контента.