Тестирование — это искусство предугадывать ошибки до того, как они появятся. (автор не известен)

Microsoft называла обучение ИИ на новостных статьях «крупнейшей кражей труда»


Microsoft называла обучение ИИ на новостных статьях «крупнейшей кражей труда»

Вопрос о том, на каких данных обучаются современные системы искусственного интеллекта, постепенно превратился из технической дискуссии в один из наиболее серьёзных конфликтов между технологическими компаниями и владельцами авторского контента. Особенно остро проблема проявилась в журналистике: публикации СМИ одновременно являются ценным источником информации для языковых моделей и основой бизнеса самих издателей.

Новые документы, опубликованные в рамках судебного разбирательства между The New York Times, OpenAI и Microsoft, позволяют взглянуть на эту проблему изнутри. Из материалов следует, что сотрудники компаний задолго до нынешнего масштаба генеративного ИИ понимали потенциальные последствия массового использования журналистских материалов.

При этом важно разделять несколько разных вопросов. Сам факт использования защищённого авторским правом материала для обучения модели ещё не означает автоматически, что суд признает такое использование нарушением закона. Именно это является одним из центральных предметов продолжающегося спора.

 

Откуда появился термин «крупнейшая кража труда»

В 2023 году директор по прикладным исследованиям Microsoft Брент Хехт подготовил внутренний документ, посвящённый использованию новостных публикаций для обучения систем искусственного интеллекта. В нём он описывал возможные последствия массового поглощения контента большими языковыми моделями.

Именно в этом документе появилась крайне жёсткая формулировка — «крупнейшая кража труда в истории человечества». Хехт рассматривал ситуацию, в которой огромные объёмы работы журналистов могут использоваться для создания продуктов, способных в дальнейшем конкурировать с самими СМИ.

В документе также высказывалась мысль, что миллионы людей могут воспринимать ситуацию, когда большие языковые модели «поглощают» результаты человеческого труда, как беспрецедентное присвоение интеллектуальной работы.

Особое внимание уделялось экономической цепочке производства новостей. Журналист создаёт материал, редакция проверяет и публикует его, издатель получает доход от рекламы, подписки или лицензирования, а читатель посещает сайт. Если же пользователь получает готовый ответ непосредственно от чат-бота, часть этой цепочки может исчезнуть.

Таким образом, проблема заключается не только в авторском праве как юридической категории. Она касается самой экономической модели существования журналистики.

 

Почему журналистские материалы особенно важны для ИИ

Новостные сайты представляют собой практически идеальный источник данных для языковых моделей. Публикации постоянно обновляются, охватывают огромное количество тем и написаны профессиональными авторами.

Для обучения ИИ особенно ценны:

  • новостные статьи и репортажи;
  • аналитические материалы;
  • интервью и комментарии экспертов;
  • технические публикации;
  • обзоры и расследования;
  • архивные материалы крупных изданий.

 

Но для издателя каждый такой материал является результатом работы журналиста, редактора, фотографа, корректора и других специалистов. Поэтому технологическая возможность автоматически собрать миллионы публикаций не означает, что экономическая стоимость этой работы исчезает.

Именно здесь возник конфликт между двумя подходами. Технологические компании рассматривают обучение модели как статистическую обработку большого массива информации. Издатели же указывают, что для создания такого массива были затрачены реальные деньги и человеческий труд.

OpenAI предупреждала о возможной замене журналистики ещё до ChatGPT

Документы показывают, что подобные опасения существовали в OpenAI ещё до появления ChatGPT в конце 2022 года.

В 2020 году тогдашний руководитель направления политики OpenAI Джек Кларк подготовил для Сэма Альтмана и Грега Брокмана материал, в котором рассматривалось развитие систем, способных выполнять работу людей, создающих культурный и информационный контент.

Это важно потому, что нынешний конфликт возник не внезапно после популяризации ChatGPT. Потенциальное влияние больших языковых моделей на профессии, связанные с созданием информации, обсуждалось внутри индустрии ещё на ранних этапах развития технологии.

Впоследствии этот вопрос стал намного более практическим. Если раньше языковая модель могла рассматриваться преимущественно как экспериментальная технология, то современные чат-боты используются миллионами людей как инструменты поиска информации, подготовки текстов, анализа документов и получения новостей.

Читать  Отключение Fable 5 от Anthropic стало сигналом для Европы: ИИ превратился в вопрос национальной безопасности

 

Проблема платных стен

Одним из наиболее спорных эпизодов в опубликованных документах стали материалы о доступе к статьям, находившимся за платной подпиской.

Адвокаты издателей утверждают, что OpenAI использовала инструменты и методы, позволявшие получать информацию с сайтов, ограниченных paywall. В опубликованных материалах присутствует сообщение Грега Брокмана, связанное с обнаружением способа обойти платную стену The New York Times.

Если публикация доступна только подписчикам, возникает дополнительный юридический вопрос. Издатель не просто заявляет авторское право на текст — он одновременно ограничивает доступ к нему коммерческими условиями.

Сатия Наделла, генеральный директор Microsoft, в приведённых документах говорил, что материалы, ограниченные платной стеной, должны использоваться на основании лицензии. Он также заявлял, что при наличии информации о том, что OpenAI использовала данные за paywall для обучения, Microsoft могла потребовать переобучения соответствующих моделей.

При этом необходимо учитывать позицию самой Microsoft. В опубликованной сегодня документации компания указывает, что её политика обучения моделей предусматривает исключение источников с paywall, а также использование договорённостей с издателями и правообладателями для получения лицензированного контента.

 

Почему лицензирование стало отдельным направлением бизнеса

По мере развития генеративного ИИ технологические компании начали заключать прямые соглашения с издателями.

Такие договоры позволяют получить легальный доступ к контенту и одновременно создать для медиа новый источник дохода. В числе компаний, заключавших подобные соглашения с разработчиками ИИ, находятся крупные издательские группы, информационные агентства и владельцы специализированных медиаресурсов.

Microsoft также заключала соглашения с рядом издателей для использования материалов в продуктах Copilot. Например, в рамках Copilot Daily компания использовала материалы таких партнёров, как Reuters, Axel Springer, Hearst Magazines, USA Today Network и Financial Times.

В 2025 году стало известно и о планах Microsoft создать специальную площадку Publisher Content Marketplace, которая должна была позволить издателям получать компенсацию за использование их материалов продуктами искусственного интеллекта.

Это показывает, что индустрия постепенно движется сразу по нескольким направлениям:

  • обучение моделей на общедоступных данных;
  • исключение сайтов, запретивших автоматический сбор информации;
  • покупка или лицензирование специализированных наборов данных;
  • заключение прямых договоров с издателями;
  • создание систем распределения доходов между ИИ-компаниями и владельцами контента.

 

Но лицензии не решают проблему полностью

Даже если крупная технологическая компания заключила договор с несколькими издателями, это не означает, что вопрос с обучающими данными автоматически решён.

Современные модели создаются на огромных массивах информации. Один договор с конкретным издателем покрывает только определённый набор материалов и определённые способы их использования.

Кроме того, остаётся вопрос о старых моделях, которые уже были обучены на больших массивах веб-данных. Если впоследствии выясняется, что часть этих данных использовалась без согласия правообладателя, возникает гораздо более сложный вопрос: достаточно ли прекратить использование источника в будущем или необходимо каким-либо образом менять уже обученную модель?

Именно поэтому спор вокруг обучения ИИ нельзя свести только к вопросу «есть лицензия или нет». Значение имеют дата сбора информации, способ получения данных, содержание лицензии, назначение использования и конкретный юридический режим в соответствующей стране.

 

ИИ как конкурент традиционных СМИ

Ещё одна проблема, которую обсуждали представители OpenAI, связана не непосредственно с обучением, а с конечным использованием модели.

В 2023 году Ник Тёрли, отвечавший за развитие ChatGPT, называл искусственный интеллект серьёзной угрозой для журналистики. Позже в документах появилось ещё более прямое утверждение о том, что продукты на основе ИИ в значительной степени являются заменой традиционным источникам информации.

Экономическая логика здесь проста. Пользователь раньше вводил запрос в поисковую систему, открывал несколько сайтов, читал статьи и тем самым создавал посещаемость для издателей.

Теперь тот же пользователь может сформулировать вопрос в чат-боте и получить структурированный ответ непосредственно в интерфейсе ИИ.

В таком сценарии пользователь может вообще не открыть исходную статью.

 

Почему ссылки на источники не всегда спасают СМИ

Одним из внутренних опасений OpenAI было то, что пользователи могут не переходить по ссылкам, даже если чат-бот показывает источники.

Это принципиально отличается от классического поиска. Поисковая система показывает пользователю список результатов, а сайт получает посещение, если человек нажимает на ссылку. Генеративный ИИ стремится сразу сформировать ответ.

Читать  Microsoft может вскоре разрешить ИТ-администраторам удалять Copilot

В результате ссылка на оригинальную публикацию может превратиться из основного элемента поиска в дополнительную справочную информацию.

Для медиа это имеет большое значение. Посещаемость сайта связана не только с количеством читателей, но и с рекламными показами, подписками, регистрациями и другими источниками дохода.

Если большая часть информационного запроса заканчивается внутри интерфейса ИИ, издатель может потерять часть аудитории даже в том случае, если его материал продолжает использоваться в качестве источника информации.

Что говорят последние судебные материалы

Судебный спор между The New York Times, OpenAI и Microsoft продолжается, поэтому отдельные заявления сторон нельзя воспринимать как окончательное установление фактов судом.

Microsoft, например, указывает на результаты анализа миллионов диалогов Copilot. В сентябре 2026 года компания заявила, что среди 8,2 млн исследованных разговоров случаи существенного воспроизведения защищённого контента встречались редко. По версии Microsoft, эти данные поддерживают аргумент о том, что обучение ИИ на защищённых материалах может иметь иной, преобразующий характер и подпадать под доктрину fair use в американском праве.

The New York Times и другие правообладатели с такой интерпретацией не согласны. Они утверждают, что технологические компании использовали их произведения для создания коммерческих продуктов, которые конкурируют с традиционной журналистикой.

Таким образом, спор идёт сразу на нескольких уровнях: о самом сборе данных, о способах обучения моделей, о воспроизведении исходных текстов и об экономическом воздействии ИИ на издателей.

 

Обучение модели и копирование статьи — не одно и то же

Для понимания проблемы важно не смешивать два процесса.

При обычном обучении языковая модель анализирует огромное количество текстов и настраивает параметры таким образом, чтобы научиться статистическим закономерностям языка. В идеальном случае модель не должна работать как база данных, из которой можно по запросу извлечь любой исходный документ.

Именно такой подход описывает Microsoft в своей документации: компания заявляет, что генеративные модели предназначены для создания новых результатов, а не для хранения и последующего воспроизведения исходных обучающих материалов.

Однако на практике большие модели могут запоминать отдельные фрагменты данных. Если текст встречался в обучающем наборе достаточно часто или обладает определёнными характеристиками, модель в некоторых условиях способна воспроизвести значительную часть исходного материала.

Поэтому юридический спор не сводится к вопросу о том, «хранит ли ChatGPT статьи». Необходимо также определить, каким образом произведения использовались для создания модели и что модель способна выдавать пользователю.

 

Почему дело важно для всей индустрии ИИ

Результат подобных судебных разбирательств может повлиять не только на Microsoft и OpenAI. Потенциально он затрагивает всю индустрию генеративного ИИ.

Если использование больших массивов защищённого контента без специального разрешения будет признано допустимым при определённых условиях, это создаст одну модель развития рынка.

Если же суды установят, что для такого использования необходимо получать лицензии, стоимость создания и эксплуатации крупных моделей может существенно измениться.

Особенно важным станет вопрос о том, какие именно данные считаются допустимыми для обучения и каким образом правообладатель может отказаться от их использования.

Для владельцев сайтов уже сейчас становится важным технический контроль над автоматическим доступом к контенту. Для ИИ-компаний, в свою очередь, становится необходимой прозрачность происхождения обучающих наборов данных.

Ситуация меняется от «собрать всё» к лицензированию

В первые годы развития больших языковых моделей интернет представлялся практически неисчерпаемым источником данных. Публикации, документация, форумы и другие страницы могли автоматически собираться в огромные наборы для обучения.

Теперь ситуация изменилась. Крупные издатели научились защищать свои интересы через суды и переговоры, а технологические компании начали заключать лицензии на использование профессионального контента.

Исследование Columbia Journalism Review показывает, что к середине 2025 года различные ИИ-компании уже заключили множество соглашений с издателями. Среди участников подобных сделок были Associated Press, Hearst, Condé Nast, Axel Springer и News Corp.

Это может привести к появлению нового рынка, на котором информация становится не просто бесплатным сырьём для обучения моделей, а лицензируемым цифровым ресурсом.

 

Что это означает для обычного пользователя

Для пользователя развитие такого рынка может быть практически незаметным. Чат-бот продолжит отвечать на вопросы, а поисковые системы продолжат показывать ответы, сформированные с использованием ИИ.

Читать  Невозможно определить, сделано ли это видео с актерами 'Stranger Things' с использованием искусственного интеллекта или нет. Это проблема

Но за интерфейсом будет происходить перераспределение доходов между несколькими участниками.

Если ИИ получает информацию от журналистов, но пользователь больше не посещает сайт издания, возникает вопрос: кто должен финансировать производство следующей статьи?

Именно поэтому проблема авторского права в эпоху ИИ имеет экономическое измерение. Даже если технически возможно обучить модель практически на всём интернете, это не означает, что такая модель информационной экономики будет устойчивой в долгосрочной перспективе.

Выводы

Опубликованные документы по делу The New York Times против OpenAI и Microsoft показывают, насколько рано технологические компании начали осознавать потенциальный конфликт между обучением искусственного интеллекта и экономикой журналистики.

Особенно показательна история с внутренним документом Microsoft, где использование журналистских материалов для обучения ИИ было охарактеризовано как «крупнейшая кража труда в истории человечества». Однако это выражение является оценкой автора внутреннего документа, а не юридическим выводом суда.

Одновременно современные заявления Microsoft демонстрируют другую сторону истории. Компания утверждает, что использует определённые публичные данные с ограничениями, исключает источники с paywall и заключает договоры с правообладателями для получения лицензированного контента.

Главный конфликт поэтому постепенно смещается от вопроса «можно ли использовать интернет для обучения ИИ?» к гораздо более конкретным вопросам: какие данные можно использовать, на каких условиях, как компенсировать создателям контента их работу и должна ли модель направлять пользователя обратно к оригинальному источнику.

Ответы на эти вопросы будут определять не только будущее Microsoft и OpenAI, но и экономику цифровой журналистики, поисковых систем и генеративного ИИ в целом.

 

Первоисточники и дополнительные материалы

 

Часто задаваемые вопросы

Такую формулировку использовал директор по прикладным исследованиям Microsoft Брент Хехт во внутреннем документе 2023 года, обсуждая использование журналистских материалов для обучения моделей ИИ. Это не является судебным выводом о наличии кражи.

Да. The New York Times подала иск против OpenAI и Microsoft в конце 2023 года, утверждая, что её статьи использовались для обучения ИИ без разрешения и компенсации. Компании отрицают неправомерность своих действий и оспаривают позицию издателя.

Материал за paywall одновременно защищён авторским правом и ограничен условиями доступа. Поэтому использование такой информации без разрешения правообладателя создаёт дополнительные юридические и договорные вопросы.

Технологически ИИ уже способен самостоятельно формировать сводки и ответы на вопросы о текущих событиях. Однако производство оригинальной журналистики требует репортёров, редакторов, источников и финансирования. Поэтому широкое использование ИИ не отменяет экономическую необходимость поддерживать производство первичного контента.

Переход пользователя на исходный материал позволяет издателю получить посещение, рекламный показ или потенциальную подписку. Для журналистики это особенно важно, поскольку производство оригинального контента требует постоянных расходов.

Да. Microsoft указывает на использование данных, полученных по договорённостям с издателями и правообладателями. Компания также заключала соглашения с крупными медиакомпаниями для использования их материалов в продуктах Copilot.

Нет. Юридическая оценка зависит от конкретной юрисдикции, характера использования, способа получения материалов, содержания произведения и других обстоятельств. В США одним из ключевых вопросов в подобных делах является применение доктрины fair use.

Если пользователи будут получать информацию непосредственно от ИИ, посещаемость оригинальных сайтов может измениться. Одновременно ИИ-компаниям нужны качественные источники данных. Поэтому будущее интернет-контента во многом зависит от того, какая модель взаимодействия между правообладателями и разработчиками ИИ сформируется в результате судебных решений и коммерческих соглашений.

Редактор: AndreyEx

Если статья понравилась, поделитесь ей в социальных сетях

Спасибо!

Теперь редакторы в курсе.

Прокрутить страницу до начала