Компания Anthropic внедрила в свои новейшие языковые модели механизм скрытой статистической маркировки, который добавляет невидимый «водяной знак» к каждому сгенерированному тексту. Технология не ухудшает читаемость и не искажает смысл, но сохраняется при копировании и даже после некоторых видов правок. Маркировка действует для всех версий Claude, вышедших начиная с 2 августа, а для более старых моделей компания обещает добавить её в течение четырёх месяцев.
Принцип работы основан на тонком смещении вероятностного выбора токенов во время генерации. На каждом шаге алгоритм, используя секретный ключ и контекст предыдущих слов, делит словарь на две категории и слегка предпочитает определённые варианты там, где это не снижает качество текста. В результате в ответе накапливается статистический паттерн, который может быть обнаружен специальным детектором с тем же ключом. Однако метка крайне чувствительна к изменениям: интенсивное перефразирование, перевод, смешивание с другим текстом или слишком короткий ответ могут сделать её нераспознаваемой.
Anthropic заявляет, что в будущем предоставит сторонним организациям инструменты для верификации происхождения текстов, но на данный момент детектировать маркеры может только сама компания. Публичного API или открытой документации пока нет, что превращает технологию скорее в элемент корпоративной отчётности, чем в доступный общественный инструмент. Внедрение связано с обязательствами по прозрачности в рамках европейского AI Act — закона, требующего маркировки синтетического контента.
Для издательской индустрии и академической среды такой механизм выглядит долгожданным, учитывая серию скандалов последних месяцев. В июле литературный агент отказался поддерживать роман «Call Me, I’ll Hide the Body» после подозрений в использовании ИИ, а издательство Hachette сняло с публикации хоррор «Shy Girl» по аналогичным основаниям. В обоих случаях авторы отрицали применение нейросетей, но объективных доказательств не существовало. Водяной знак мог бы стать арбитром в таких спорах, если бы он был общедоступен.
Однако даже обнаруженный маркер не даёт стопроцентной гарантии. Anthropic признаёт, что след может появиться в тексте, если Claude использовался только для корректуры, перевода или локального перефразирования — то есть даже при минимальном вмешательстве. Кроме того, для нетекстовых форматов (изображения, аудио) применяется другой стандарт — метаданные C2PA, которые не связаны со статистическим паттерном и могут быть легко удалены.
Anthropic стала второй крупной ИИ-компанией после Google DeepMind, внедрившей подобную маркировку (Gemini использует систему SynthID с 2024 года). Однако ключевое отличие — Google уже предоставил сторонние детекторы, тогда как Anthropic пока держит инструменты внутри. Это означает, что технология остаётся скорее формальным выполнением регуляторных требований, чем практическим решением для проверки контента. Её реальная ценность проявится только тогда, когда детекторы станут публичными, а суды и издатели начнут принимать их показания как доказательства. Пока же авторы, использующие ИИ для черновиков и финальной редактуры, могут быть спокойны — их текст, прошедший даже лёгкую правку, вряд ли будет идентифицирован как нейросетевой.
