На одном из семинаров руководитель компании рассказывал, как теперь его сотрудники готовят юридические документы с помощью нейросети. Экономия времени, говорит, колоссальная. Потом выяснилось, что в одном из договоров была ссылка на судебное решение, которого в природе не существует. Нейросеть его просто выдумала — уверенно, с реквизитами, с датой. Вот это и называется «галлюцинация». И это не просто технический сбой, а системное свойство практически всех языковых моделей без исключения.
Природа проблемы понятна, хотя реакция у многих одинаковая — удивление. Языковые модели не знают фактов так, как их знает человек или энциклопедия. Вообще не знают, если честно разобраться. В основе работы любой нейросети лежит предсказание следующего кусочка текста по статистическим вероятностям — модель не «понимает», что написать, она вычисляет, что правдоподобно написать. Разница колоссальная.
Именно в этом заключается серьезная проблема. Полностью убрать галлюцинации в рамках существующей архитектуры не получится без смены самого принципа генерации — исследования в данной области подтверждают это раз за разом, и это не «баг» или «фича», это встроено в саму логику работы. Причем чем сложнее модель, тем изощреннее ее глюки. Они уже не выглядят как очевидная чушь: они встраиваются в контекст, звучат убедительно и поймать их на горячем становится заметно труднее. Вот это, пожалуй, самое неприятное во всей истории.
Масштаб проблемы галлюцинаций не оценить на глаз — он проявляется только в специализированных тестах. На сложных открытых вопросах, где нужен либо точный факт, либо честный отказ от ответа, модели показывают колоссальный разброс: от умеренной погрешности почти до полной недостоверности. При этом в обычной переписке картина другая — высокие показатели ошибок фиксируются именно в стресс-тестах, в стандартных сценариях галлюцинаций заметно меньше. Но расслабляться не стоит.
Особенно уязвимы модели там, где запрос содержит ложную предпосылку. При работе с корректными утверждениями точность может быть вполне приличной, но стоит пользователю ошибиться в посылке — модель охотно подхватывает это заблуждение и строит на нем дальнейший ответ. Это не случайный, а системный сбой: нейросеть плохо различает объективный факт и субъективное мнение собеседника. Проблема поддакивания — одна из самых неудобных, потому что снаружи выглядит как согласие компетентного собеседника.
Года три-четыре назад галлюцинации ИИ были предметом интереса исследователей и редких энтузиастов, сейчас это операционный риск, который приходится учитывать при выстраивании любого рабочего процесса с нейросетями. Особенно там, где цена ошибки высокая, — юридическая сфера, медицина, финансы. Проблему обсуждают не первый год, но именно массовое распространение больших языковых моделей превратило ее из темы конференций в реальную головную боль конкретных команд и компаний.
Отраслевые риски при этом очень разные по характеру последствий. В юридической сфере уже накопилась серьезная практика, когда вымышленные судебные решения попадали в реальные дела — последствия для всех участников бывают весьма неприятными. В здравоохранении цена ошибки выше: неверный ответ нейросети может стоить здоровья пациента, и никакой автоматический фильтр врача не заменит. В кибербезопасности выдуманные угрозы создают серьезные проблемы и требуют человеческого надзора над любым ИИ-инструментом. Разработчики тоже под ударом — инструменты проверки кода иногда подсказывают решения с уязвимостями или ссылаются на библиотеки, которых не существует. В «Юнисофт» при разработке внутренних сервисов давно действует простое правило: любой фрагмент кода от нейросети проходит ручную проверку. Время разработки чуть увеличивается, зато сюрпризов в продакшне меньше. Для бизнеса ошибки языковых моделей перестали быть технической экзотикой — это уже измеримый финансовый и репутационный риск, и относиться к нему нужно соответственно.
Есть, впрочем, и хорошая новость — методы борьбы с галлюцинациями существуют и реально работают, хотя стопроцентной гарантии не дает ни один. Поисково-дополненная генерация — когда модель не тянет ответ из своей статистической памяти, а в момент генерации обращается к внешним базам знаний — дает заметный эффект. Попробовали этот метод на внутреннем корпоративном боте — разница в точности ощутимая, особенно на узкоспециальных запросах. «Заземление» на верифицированных данных и режимы рассуждения, где модель сначала выстраивает логическую цепочку и только потом выдает итог, тоже вошло в рабочий арсенал серьезных команд.
Верховный суд России впервые использовал ИИ при подготовке документа
Есть еще подход, который на первый взгляд выглядит странновато — один ИИ проверяет другого. Понимаю, что звучит как анекдот, но на практике мультимодельная верификация в сложных задачах действительно повышает достоверность. Не идеал, но лучше, чем ничего. Графы знаний позволяют копать глубже — там выявляются скрытые несоответствия, которые при обычном запросе просто не всплывают. В медицине пошли еще дальше: верифицированные клинические данные теперь встраивают прямо в вывод модели, не рассчитывая на то, что она сама все корректно воспроизведет из обучения. Появились протоколы перевода вероятностных ответов на язык конкретных диагнозов — по сути, промежуточный слой между нейросетью и врачом, снижающий шум. Но как бы ни развивались все эти инструменты, человеческий контроль в по-настоящему рисковых сценариях пока никто не отменял — и вряд ли отменит в ближайшие несколько лет.
Есть интересная деталь, о которой говорят чуть реже. Между творческим потенциалом модели и ее склонностью к фантазиям существует прямая связь. Когда разработчики начинают жестко подавлять галлюцинации — креативность модели падает тоже. Получается своеобразная дилемма: хочешь точности — получаешь сухой автомат, хочешь живого генератора идей — получаешь склонность к выдумкам. Это не значит, что нейросети не надо применять для творческих задач, просто нужно отдавать себе отчет в том, в каком режиме работает инструмент. Для маркетинговых текстов и брейнсторминга уровень «фантазии» модели — это скорее плюс, для юридических документов или медицинских заключений — это катастрофа. Понимание такого разделения — основа грамотного применения ИИ в бизнесе. Для внутренней базы знаний мы в «Юнисофт» используем модели с жесткими ограничениями и верификацией, а для генерации маркетинговых гипотез — наоборот, предоставляем моделям больше «свободы». Такое разделение дает результаты, которые устраивают и с точки зрения качества, и с точки зрения безопасности.
Что делать прямо сейчас? Первое и главное: перестать воспринимать нейросеть как справочник. Это генератор правдоподобного текста, и это принципиально меняет отношение к ее ответам. Любая цифра, дата, ссылка на документ или научную работу — все требует отдельной проверки, прежде такая информация станет основой для решения или критичного документа. В медицине, финансах и праве подобная проверка должна быть жестко зафиксирована в регламенте и оставаться на совести каждого сотрудника.
Есть еще один момент, который на практике всплывает реже, чем следовало бы. Модель работает со словами и их статистическими связями — она не чувствует юридического контекста, не понимает, что одна фраза в договоре может перевернуть смысл всего документа. Специалист с опытом это чувствует, нейросеть — далеко не всегда. Именно поэтому ее ответы нельзя отправлять конечным пользователям без промежуточного контроля, особенно когда речь идет о чувствительных темах.
В «Юнисофт» года полтора назад ввели простое правило: любой нейросетевой ответ, который отправляется во внешние коммуникации, проходит через человека. Да, добавляется еще один, дополнительный уровень проверки.
Инструменты автоматического тестирования достоверности генерации уже существуют и постепенно дешевеют — это отдельная растущая ниша, за которой интересно наблюдать.
Но пока надежнее компетентного сотрудника, который понимает контекст и реально отвечает за результат, ничего нет — и это, на мой взгляд, не изменится еще довольно долго.