Перейти к содержимому
Эмигрантский Вестник
  • Новости исследований
  • Конференции
  • Рецензии на книги
  • Интервью с учёными
  1. Главная
  2. Интервью с учёными
  3. Будущее архивов: интервью о применении ИИ для атрибуции анонимных текстов 1930-х годов
Интервью с учёными

Будущее архивов: интервью о применении ИИ для атрибуции анонимных текстов 1930-х годов

Автор: 23.06.2025 13 минут чтения

Читайте также

  • В Праге обнаружена неизвестная переписка редакторов парижского журнала «Русские записки»
  • Конференция в Сорбонне о «Парижской ноте» и эмигрантской периодике
  • Интервью: как сегодня ищут пропавшие рукописи эмигрантских журналов в архивах Франции
  • Рецензия на монографию 2026 года: «Эстетика и авторы парижского журнала «Числа»»
  • Открыт новый цифровой архив журнала «Современные записки»: итоги проекта 2026 года

Анонимные публикации в русской эмигрантской периодике давно остаются одной из самых трудных тем для исследователя. В парижских журналах и газетах 1920–1940-х годов автор мог скрываться по редакционным причинам, из осторожности, из-за жанровой игры или потому, что текст собирался из нескольких правок внутри редакции. Мы поговорили с исследователем digital humanities о том, как сегодня нейросеть, оптическое распознавание символов и сравнительный анализ помогают разбирать такие случаи, а где искусственный интеллект пока выдавать может только гипотезу, но не правильный ответ.

Почему проблема анонимного авторства снова стала актуальной

— Почему именно сейчас тема атрибуции анонимных текстов снова в центре внимания?

Потому что совпали сразу несколько процессов. Во-первых, архив и библиотечные собрания активнее оцифровываются, а значит, исследователь получает доступ не к единичной публикации, а к массиву текстов одного журнала, редактора или круга общения. Во-вторых, появились инструменты, которые позволяют проверять большие корпуса быстрее, чем это делал человек вручную. И, в-третьих, само понятие авторства стало обсуждаться заново: нас интересует не только имя под статьей, но и редакционная среда, повторяющиеся словесные привычки, эмоциональный рисунок и устойчивые композиционные модели.

Для истории эмиграции это особенно важно. Русский Париж существовал как плотная сеть журналов, издателей, салонов, кружков и архивных следов. Один и тот же человек мог публиковаться под своей фамилией, инициалами, псевдонимом или вовсе без подписи. Когда мы начинаем сопоставлять документ, рукопись, редакционную правку и печатный текст, атрибуция перестает быть просто угадыванием и становится исследовательской процедурой.

— То есть речь не о замене филолога машиной?

Совсем нет. Нейросеть не обладает сознанием, не понимает культурный контекст так, как его понимает специалист по литературе, и не несет ответственности за принятие решения. Но использование нейросеть полезно там, где нужно быстро проверить гипотезу, выделить подозрительные совпадения или обратить внимание на незаметные повторяющиеся признаки. Машина помогает задавать вопрос к корпусу, а ответ на вопрос все равно формулирует человек.

Какие источники важны для атрибуции эмигрантской прессы

— С чего начинается работа с конкретным анонимным текстом из эмигрантского издания?

С описания источниковой среды. Нужно понимать, где именно сохранился текст: в подшивке журнала, в газетной вырезке, в редакционном деле, в личной переписке или в архивной копии. Для истории русской литературы и журналистики очень важны большие архивные собрания. Например, Российский государственный архив литературы и искусства остается одним из ключевых мест, где хранятся материалы по истории отечественной литературы и фонды личного происхождения. Для исследователя эмиграции такие фонды ценны не только рукописями, но и письмами, внутренними записками, вариантами публикаций и следами редакторской работы.

Если говорить шире, важны и перемещенные архивы. Русский культурно-исторический музей в Праге был закрыт в 1944 году, а его архивы вывезены в СССР в январе 1946 года. Для исследователя это напоминание о том, что эмиграция как исторический процесс оставила документы в разных странах и институциях, и нередко путь текста к современному архиву сам по себе объясняет, почему авторство оказалось размытым.

— Получается, архив здесь так же важен, как и алгоритм?

Даже важнее. Алгоритм ничего не сможет без качественного корпуса. Если в архив попал только один газетный номер, а соседние выпуски не сохранились, модель будет видеть не литературную среду, а случайный фрагмент. Поэтому цифровая работа начинается не с промпта, а с подготовки материала: что считать текстом, какой вариант брать за основной, какие правки учитывать, а какие считать позднейшей редакцией.

От скана к машиночитаемому тексту: OCR и подготовка данных

— Где в этой цепочке появляется искусственный интеллект?

Первый практический этап — распознавание документов. Большая часть эмигрантской периодики дошла до нас в виде сканов разного качества: пожелтевшая бумага, потерянный контраст, пятна, нестандартный шрифт, деформированная строка. Чтобы такой документ превратить в корпус, используется оптическое распознавание символов. В исследовательской практике часто применяются ABBYY FineReader и открытая библиотека Tesseract, разработанная Google. Это не просто техническая деталь: от качества OCR зависит весь дальнейший анализ авторства.

Перед тем как распознавать текст, старые страницы обычно приходится очищать. Для улучшения качества сканов используются алгоритмы бинаризации изображения, включая метод Оцу и адаптивную бинаризацию. Если страница сложная, с колонками, рамками, иллюстрациями и вставками, для автоматического обнаружения текстовых блоков до OCR может применяться нейросеть YOLO. Такой конвейер — сначала выделение зоны текста, затем распознавание, затем ручная верификация — сегодня становится нормой для работы с исторической периодикой.

— Насколько много ошибок дает OCR на эмигрантских изданиях?

Ошибок достаточно. Старые шрифты, смешение орфографических привычек, бледная печать, французские или немецкие вкрапления, нестабильные интервалы между буквами — все это сбивает автоматическое распознавание. Поэтому машиночитаемый текст нельзя просто выгрузить и сразу отдавать алгоритму атрибуции. Нужна верификация, хотя бы выборочная. Особенно если исследователь хочет ловить не только частотные слова, но и пунктуацию, длину фразы, характер цитирования и другие тонкие признаки авторства.

— То есть OCR — это уже интерпретация?

Именно. Распознавание документов кажется нейтральной операцией, но на деле это момент, когда документ превращается в данные. Если Tesseract перепутал буквы, разбил одно слово на два или пропустил тире, статистический профиль текста меняется. А для задач авторства это критично. Поэтому хороший цифровой исследователь обязан понимать, как устроено оптическое распознавание символов, даже если сам не пишет код.

Как нейросети помогают определять авторство

— Что происходит после того, как корпус подготовлен?

Дальше начинается сравнительный анализ. Мы берем анонимный текст и сопоставляем его с текстами потенциальных авторов. Причем не в одном измерении, а сразу в нескольких. Алгоритм может учитывать частотность служебных слов, типичную длину предложения, набор любимых конструкций, способы вводить цитату, характер абзацного деления, устойчивые пары слов, особенности обращения к читателю и даже распределение эмоции в тексте. Человек обычно чувствует стиль интуитивно, а машинное обучение пытается превратить это чувство в измеряемые параметры.

— Нейросеть действительно способна узнать писателя по стилю?

Иногда — да, но лучше говорить осторожнее. Она не узнает автора как личность; она фиксирует статистически устойчивые следы письма. Это особенно полезно, когда круг вероятных имен уже ограничен редакцией, жанром и временем публикации. Если у нас есть несколько кандидатов и достаточно сравнимого материала, алгоритм может показать, чьи языковые привычки ближе к анонимному тексту. Но чем сильнее редакционная правка и чем меньше корпус, тем более шатким становится вывод.

— Какие признаки оказываются самыми надежными?

Часто не самые заметные. Исследователь обращает внимание не только на редкие яркие слова, но и на тихие параметры: как человек ставит тире, как часто использует вводные конструкции, любит ли двоеточия, как строит период, предпочитает ли эмоциональный нажим или сухую аргументацию. Для эмигрантской прессы полезны и внешние признаки: кто в это время был в редакции, какие темы обсуждались, какой документ или письмо может подтвердить участие автора. Машина показывает вероятную близость, архив дает контекст, а филолог проверяет, не является ли совпадение случайным.

Роль больших языковых моделей и промптов

— А где здесь место таким системам, как ChatGPT?

ChatGPT — это нейросеть другого типа. Она хороша для рабочих задач вокруг корпуса: помочь составить черновой список тем, предложить схему разметки, упростить первичную классификацию заметок по жанрам или подготовить варианты запросов к данным. Иначе говоря, промпт становится инструментом постановки вопроса. Но когда речь идет об атрибуции, модель, которая умеет генерацию текста, не должна быть единственным аналитиком. Она может красиво объяснить гипотезу, но красивое объяснение еще не доказательство.

— Значит, тексты сгенерированные нейросетями, могут даже мешать исследованию?

Да, если исследователь перестает отделять интерпретацию от данных. Большая языковая модель способна создавать уверенные формулировки там, где корпус неоднозначен. Поэтому я всегда советую фиксировать, на каком этапе использовался искусственный интеллект: при описании источника, при разметке, при кластеризации, при написании черновика статьи. Прозрачность методики здесь важнее эффекта новизны. Иначе границы авторства размываются уже не в архиве, а в самой научной практике.

— Есть ли полезный сценарий, где ChatGPT действительно экономит время?

Конечно. Например, когда нужно быстро нормализовать OCR-ошибки по заранее заданным правилам, собрать список возможных псевдонимов из корпуса или подготовить вопросы для ручной проверки. Но и тут человек обязан проверять результат. Нейросеть выдавать может удобный черновик, а не окончательный вывод. В историко-литературной работе это принципиально.

Как проверяют и перепроверяют гипотезу

— Что вы считаете достаточным основанием для атрибуции?

Одного совпадения мало. Нужен набор признаков, которые поддерживают друг друга. Сначала машинное обучение показывает языковую близость. Затем проводится сравнительный анализ по независимым параметрам. После этого исследователь ищет внешние подтверждения: рукопись, письмо, редакционный документ, заметку в дневнике, свидетельство современника. В идеале гипотеза должна проходить несколько уровней проверки, чтобы мы могли не просто предположить автора, а объяснить, почему именно этот вывод выглядит убедительным.

— А если внешних подтверждений нет?

Тогда лучше честно говорить о вероятности, а не о доказанном авторстве. В digital humanities это нормальная позиция. Плохо не то, что алгоритм дает вероятностный ответ, а то, что исследователь маскирует гипотезу под окончательную истину. Особенно в поле литературы, где стиль может имитироваться, редактор может вмешиваться в текст, а один и тот же человек сознательно менять язык в зависимости от жанра.

— Можно ли использовать сервисы, которые распознают ИИ-текст, как часть проверки?

Вспомогательно — да, но с пониманием ограничений. Есть инструменты, которые проверять могут происхождение текста по очень короткому фрагменту. Например, Sapling делает вывод уже на основе отрывка длиной в 50 слов. Content at Scale рассчитывает так называемую оценку человеческого контента, опираясь на предсказуемость, вероятность и закономерность фраз. Copyleaks предлагает категории вроде созданный ChatGPT, GPT3, человеком или в смешанном виде. Но эти системы разрабатывались для современной проверки на плагиат и выявления автоматической генерации, а не для атрибуции исторической публицистики. Поэтому переносить их выводы в архивное исследование напрямую нельзя.

Почему исторический текст труднее современной проверки

— Чем именно эмигрантские материалы отличаются от современных корпусов?

Исторический текст живет в другой языковой экологии. Там встречаются дореформенные следы, редакционная смесь, цитаты без точной маркировки, влияние нескольких языков, особенности набора и корректуры. Кроме того, один и тот же текст может существовать в вариантах: рукопись, машинопись, гранка, печатная публикация. Для нейросети это не один объект, а несколько похожих объектов с разными степенями авторского участия.

Есть и еще один момент. Эмиграция как культурная среда производила тексты коллективно. Редактор мог переписать вступление, корректор — нормализовать орфографию, а издатель — сократить абзацы. Поэтому вопрос авторства нередко распадается на несколько вопросов: кто придумал аргумент, кто написал основную часть, кто придал тексту окончательный вид. Искусственный интеллект помогает заметить слои, но не всегда способен провести между ними четкую границу.

— То есть сама идея единственного автора не всегда работает?

Совершенно верно. Границы авторства в периодике вообще подвижнее, чем в отдельной книге. Колонка, рецензия, редакционная заметка, полемический ответ — все это жанры, где текст часто проходит через коллективную обработку. И в этом смысле цифровой анализ полезен не только для поиска имени, но и для понимания редакционной культуры эмиграции.

Ограничения метода и типичные ошибки

— Какие ошибки вы видите чаще всего у тех, кто только начинает работать с ИИ в архивах?

Первая ошибка — вера в автоматическое чудо. Кажется, что достаточно загрузить корпус, и нейросеть сразу найдет автора. На деле львиная доля работы уходит на очистку данных, описание источников и верификацию. Вторая ошибка — смешение задач. Распознавание документов, тематическая классификация, генерация текста и атрибуция авторства — это разные процессы, хотя в популярном разговоре их часто сводят к одному слову ИИ. Третья ошибка — игнорирование архивного контекста. Без него даже сильный алгоритм может привести к убедительной, но ложной версии.

— А чего, наоборот, недооценивают?

Ручную экспертизу. Исследователь, который знает историю журнала, биографию редактора, маршруты эмиграции и внутренние конфликты круга, часто замечает то, что не отражено в цифрах. Например, невозможность публикации по личным причинам, смену тона после редакционного раскола, влияние конкретного события на словарь автора. Машина умеет считать, но не умеет помнить человеческую ситуацию так, как это делает историк литературы.

— Можно ли сказать, что ИИ лучше работает как фильтр, чем как судья?

Очень точная формула. Он позволяет проверять тысячи строк, выделять аномалии, сопоставлять версии, находить подозрительно близкие тексты. Но окончательное принятие решения остается за человеком. Это особенно важно, когда публикация касается культурного наследия, архивных описей и научной репутации конкретного имени.

Этика, прозрачность и культурное наследие

— Какие этические вопросы возникают в такой работе?

Первый вопрос — прозрачность. Если в исследовании использовались нейросети, нужно прямо писать, для чего именно: генерация текста, OCR-нормализация, разметка, поиск совпадений, проверка на плагиат или что-то еще. Второй — воспроизводимость. Другой специалист должен понимать, как был собран корпус и по каким правилам исключались ошибочные документы. Третий — уважение к архиву как к части культурного наследия. Цифровая обработка не должна подменять источник его гладкой электронной копией.

— А есть ли риск, что публика начнет больше доверять машине, чем исследователю?

Такой риск уже есть. Словосочетание искусственный интеллект звучит авторитетно, и многим кажется, будто алгоритм гарантирует объективность. Но объективность появляется не из названия инструмента, а из методики, открытых шагов и честного описания ограничений. Если исследователь не показывает, как получен результат, ссылка на ИИ ничего не доказывает.

— Здесь вспоминается и проблема текстов, которые сами создаются машиной.

Да, и она важна не только для современного образования или преподавание русского языка и литературы, но и для науки. Когда машинная генерация становится повседневной, нужно яснее отделять исторический источник от современного пересказа, реконструкцию от оригинала, научную гипотезу от автоматически написанного резюме. Иначе сам язык исследования начинает терять точность.

Чему учат эксперименты с восприятием ИИ-текстов

— Насколько вообще человек способен отличить текст, написанный машиной, от человеческого?

Не так уверенно, как кажется. Показателен эксперимент Санкт-Петербургского университета по различению стихов, написанных людьми и ИИ. В нем участвовали около 600 человек. Примерно 25% респондентов приняли произведения, созданные ИИ по подобию классиков, за написанные людьми. Более того, участники на 25% чаще оценивали такие стихи как более качественные, чем произведения поэтов-классиков.

— Как это связано с эмигрантской периодикой?

Напрямую. Если современный читатель уже плохо отличает машинную стилизацию от человеческого письма, то историк тем более не должен полагаться только на интуицию. Нужна многоступенчатая проверка. С другой стороны, этот эксперимент напоминает, что стиль — не чисто биометрический отпечаток. Он еще и эффект чтения, ожидания, репутации, жанра. Поэтому атрибуция не может строиться только на одном классе признаков.

Что меняется для архивов и редакций будущего

— Если смотреть вперед, что будет самым важным для архивов в 2026 году и дальше?

Не отдельная модная нейросеть, а инфраструктура. Нужны качественные цифровые копии, единые правила описания, удобные форматы хранения, возможность сравнивать версии документов, связка между сканом и расшифровкой, а также открытая фиксация правок. Когда архив становится машиночитаемым без утраты материального контекста, исследование выходит на другой уровень. Тогда можно изучать не только отдельный текст, но и жизнь целого журнала, редакционного фонда или литературной сети.

— Какую роль здесь могут играть крупные институты?

Очень большую. Российский государственный архив литературы и искусства важен не просто как государственный архив, а как пространство, где фонды личного происхождения и материалы по истории отечественной литературы позволяют соединить вычислительный анализ с реальной документной базой. Для тем, связанных с эмиграцией, это особенно ценно: цифровая гипотеза получает возможность встретиться с рукописью, письмом и редакционным делом.

— Что бы вы посоветовали молодым исследователям?

Сначала научиться читать источник медленно, а уже потом ускорять работу алгоритмом. Освоить базовые принципы OCR, понять, как устроено машинное обучение, не бояться задавать вопрос программисту и в то же время не отказываться от филологической осторожности. Лучшие проекты сегодня возникают там, где человек умеет соединять историю, язык, архив, документ и вычислительный метод без технологического фанатизма.

Главный вывод

Использование нейросетей в изучении эмигрантской прессы не отменяет традиционного источниковедения, а делает его точнее и масштабнее. Искусственный интеллект помогает распознавать документы, собирать корпус, сравнивать стилистические признаки и быстрее проверять рабочие гипотезы. Но авторство анонимного текста по-прежнему устанавливается на пересечении нескольких линий: архив, фонд, рукопись, редакционный контекст, язык, статистика и экспертное чтение.

Если говорить просто, будущее архивов — не в том, что машина начнет самостоятельно решать, кто написал заметку в парижском журнале 1930-х. Будущее в том, что исследователь получит более точные инструменты, чтобы задавать правильные вопросы к документу. А это для истории литературы важнее любого эффектного обещания.

Поделиться
Предыдущая Разбор нового сборника: «Поэзия первой волны эмиграции на страницах парижских журналов» Следующая В Праге обнаружена неизвестная переписка редакторов парижского журнала «Русские записки»

Похожие статьи

Интервью: как сегодня ищут пропавшие рукописи эмигрантских журналов в архивах Франции

Астропрогноз

♑
Козерог
22.12 — 19.01
Рекомендуется уделить внимание здоровью
Нижний Новгород
☁️ +28°C
Облачно с прояснениями

Новые статьи

  • Интервью: как сегодня ищут пропавшие рукописи эмигрантских журналов в архивах Франции
  • Литературная сенсация 2026 года: найдены черновики Цветаевой для журнала «Встречи»
  • Рецензия на монографию 2026 года: «Эстетика и авторы парижского журнала «Числа»»

По темам

  • Политика конфиденциальности
  • Обработка персональных данных
  • Обратная связь
© 2026 Эмигрантский Вестник
Новости из архивов прошлого