Лена Петровна, Елена Окафор: нейросеть моделируют вымышленные имена в научных работах
Исследователи из Samsung и Варшавского университета обнаружили, что языковые модели массово создают вымышленных учёных, чьи имена затем закрепляются в реальных научных репозиториях как авторы несуществующих работ. Результаты изложены в препринте «Призрачная пара: коррелированные LLM‑имена и их призраки в веб‑ и академических публикациях». Документ пока не прошёл рецензирование, а его выводы не подтверждены независимо.
Оказалось, что нейросети при генерации «экспертов» не используют случайные имена, а регулярно воспроизводят одни и те же персонажи. Чаще всего в сгенерированных текстах встречаются Елена Васкес (Elena Vasquez) и Маркус Чен (Marcus Chen) — по данным авторов работы, эти имена фигурировали в сотнях документов в самых разных ролях: от вулканологов и астронавтов до соавторов научных публикаций, сообщает LIFE.
У разных моделей сформировались собственные «излюбленные» наборы имён:
Claude чаще генерирует Елену Амару Окафор;
Gemini — Ариса Торна и Лену Петрову;
ChatGPT — Элару Восс и Маркуса Чена.
Особую тревогу вызывает ситуация с научным репозиторием Zenodo, который администрирует CERN. Авторы препринта нашли там свыше 1655 записей, подписанных вымышленными именами. В этих публикациях указаны несуществующие журналы, а даты выхода проставлены задним числом. При этом Zenodo присваивает каждой работе реальный цифровой идентификатор DOI — он автоматически попадает в научные агрегаторы. В результате фальшивые материалы уже индексируются в Google Scholar и Semantic Scholar без какой‑либо верификации.
Ситуация усугубляется доступностью платформы: создать бесплатный аккаунт в Zenodo может любой пользователь. В один из пиковых месяцев было зарегистрировано 991 фальшивая запись. На ResearchGate вымышленные персонажи формируют целые «исследовательские коллективы»: соавторами в них выступают герои, сгенерированные разными нейросетями.
Такие публикации искажают научное поле: реальные учёные могут цитировать несуществующие работы, а алгоритмы поиска — выдавать фейки в топе результатов. При этом характерные имена, типичные для конкретных моделей, способны служить своего рода «отпечатками пальцев» — по ним можно установить, какой ИИ создал тот или иной текст.
На данный момент ни одна из научных платформ публично не отреагировала на выводы исследования. Неизвестно, сколько из обнаруженных записей администраторы репозиториев сочтут спамом и планируют ли их удалять.
Уважаемые читатели «Царьграда»!
Присоединяйтесь к нам в соцсетях ВКонтакте, Одноклассники, Telegram.
Подписывайтесь на наш канал в Дзене. Там все самое интересное.
Если вам есть чем поделиться с нами, присылайте свои наблюдения, вопросы, новости на электронную почту kuzbas@tsargrad.tv