Повышение надежности ИИ с помощью детального обнаружения и исправления галлюцинаций с FAVA
Представьте, что вы полагаетесь на инструмент ИИ для составления отчета. Вы просите его предоставить подробности о миссиях Apollo, и он уверенно сообщает вам, что Neil Armstrong высадился на Луну в 1965 году. Не проверив это, вы включаете ошибку в свой отчет. Это пример галлюцинации, когда ИИ генерирует правдоподобную, но неверную или непроверяемую информацию.
Галлюцинации ставят под сомнение надежность ИИ, особенно в таких областях, как здравоохранение, образование и журналистика, где даже незначительные неточности могут привести к серьезным последствиям. Ошибки могут варьироваться от простых фактических неточностей до полностью вымышленных сущностей или событий, требуя большего, чем базовая классификация «фактически верно или нет». Для решения этой проблемы в статье Fine-Grained Hallucination Detection and Editing for Language Models была представлена FAVA — языковая модель с дополнением извлечением, предназначенная для обнаружения и исправления галлюцинаций. Этот подход также включает детальную таксономию для категоризации ошибок и эталонный набор данных под названием FAVABENCH для оценки производительности модели. Вместе эти инструменты повышают надежность ИИ в контекстах с высокими ставками.
В этом блоге мы рассмотрим природу галлюцинаций, таксономию, которая предоставляет основу для их категоризации, набор данных FAVABENCH, разработанный для оценки, и то, как FAVA обнаруживает и исправляет ошибки.
Почему существующим методам трудно обнаруживать ошибки ИИ
Большинство систем для выявления ошибок в результатах ИИ рассматривают задачу как простое решение, классифицируя утверждение как фактическое или нет. Хотя этот бинарный подход прост, он часто не справляется со сложностью ошибок, генерируемых ИИ. Например, определить неверную дату может показаться простым, но распознать вымышленную сущность или исправить тонкую ошибку в отношениях требует более глубокого понимания содержания и контекста.
Необходим более детальный подход, чтобы выйти за рамки маркировки целых утверждений как неверных. Рассмотрим предложение: Messi — футболист в Barcelona. Он известен благодаря фильму 2017 года The Messi Diaries. Бинарная система может пометить утверждение как ложное, не объясняя почему. Детальное обнаружение, напротив, точно указывает конкретные проблемы: неверное местоположение (Barcelona следует заменить на Miami) и вымышленное утверждение о несуществующем фильме.
Рисунок: сравнение бинарного и детального обнаружения галлюцинаций, демонстрирующее, как детальные методы выявляют конкретные типы ошибок внутри утверждения.
Выявляя конкретную природу ошибок, таких как неточные детали или вымышленные утверждения, детальное обнаружение обеспечивает ясность и позволяет выполнять целевые исправления. Этот подход преодолевает ограничения бинарной классификации, предлагая более нюансированное и практичное решение для эффективного устранения ошибок ИИ.
Понимание категорий галлюцинаций
Ошибки, генерируемые системами ИИ, не одинаковы. Некоторые включают простые фактические неточности, такие как неверное указание даты, тогда как другие создают полностью новые сущности или непроверяемые утверждения. Чтобы учесть это разнообразие, детальная таксономия делит галлюцинации на шесть отдельных типов. Эта структура дает ясность относительно природы ошибок и позволяет выполнять точные исправления.
Процесс категоризации галлюцинаций начинается с анализа информации в сопоставлении с доступными доказательствами. Дерево решений ниже показывает, как различные типы галлюцинаций выявляются шаг за шагом. Например, ошибки могут возникать из-за противоречивых фактов, непроверяемых утверждений или полностью вымышленных сущностей. Следуя этому структурированному подходу, таксономия предлагает систематический способ оценивать и устранять галлюцинации.
Рисунок: Дерево решений, объясняющее таксономию и то, как ошибки распределяются по шести типам, с примерами.
Шесть категорий галлюцинаций выглядят следующим образом:
Ошибки сущностейОни включают неверные детали, такие как имена, даты или места. Например, утверждение, что Нил Армстронг высадился на Луну в 1965 году вместо 1969 года, является ошибкой сущности. Такие ошибки часто легко обнаружить и исправить с помощью хорошо документированных источников.
Ошибки отношенийОшибки отношений возникают, когда неверно представлена связь между двумя сущностями. Например, утверждение, что Лионель Месси был приобретен PSG вместо того, что он перешел в PSG, меняет смысл отношения. Исправление таких ошибок требует понимания контекста задействованных сущностей.
Ошибки предложенийЭто целые предложения, которые противоречат фактическим данным. Например, утверждение: Месси никогда не был капитаном сборной Аргентины по футболу противоречит хорошо установленным фактам. Ошибки на уровне предложения часто требуют большего контекста для выявления и исправления.
Вымышленная информацияОшибки в этой категории связаны с фабрикацией сущностей или понятий, которые не существуют. Например, утверждение, что Месси известен своим знаменитым ударом в прыжке «самолет», создает полностью вымышленное действие. Такие ошибки может быть сложнее обнаружить, потому что они могут звучать правдоподобно, но не имеют основания в реальности.
Субъективные утвержденияСубъективные утверждения возникают, когда мнения подаются как фактические заявления. Например, фраза Месси — лучший футболист в мире является субъективной и не может быть универсально проверена. Хотя мнения допустимы в неформальных контекстах, представление их как фактов может привести к недопониманию.
Непроверяемые утвержденияОни включают утверждения, для которых недостаточно доказательств, чтобы подтвердить или опровергнуть их достоверность. Например, утверждение вроде Месси любит петь для своей семьи в свободное время является непроверяемым без конкретных доказательств или прямого подтверждения.
Каждая категория подчеркивает разнообразные способы проявления галлюцинаций, демонстрируя, что универсальный подход к обнаружению и исправлению ошибок недостаточен. Разделяя ошибки на эти категории, таксономия обеспечивает ясность, необходимую для точной работы с галлюцинациями.
Оценка производительности ИИ с помощью FAVABENCH
Таксономия предоставляет структурированный способ понимания галлюцинаций, но для оценки того, насколько хорошо модели ИИ справляются с этими ошибками, требуется надежная система тестирования. FAVABENCH, эталонный набор данных, был создан для анализа выводов ИИ и оценки их способности обнаруживать и исправлять конкретные типы ошибок.
FAVABENCH включает аннотированные ответы от large language models, таких как ChatGPT и Llama2-Chat, охватывающие широкий спектр задач. Каждый ответ анализируется на уровне фрагментов, при этом конкретные части текста помечаются на основе шести категорий галлюцинаций.
Набор данных также выявляет тенденции в типах ошибок, генерируемых моделями. График ниже показывает, как галлюцинации распределяются по различным моделям и наборам данных. Ошибки сущностей распространены во всех моделях, тогда как такие ошибки, как сфабрикованная информация или непроверяемые утверждения, демонстрируют большую вариативность.
Рисунок: График, показывающий распределение типов галлюцинаций по моделям ИИ и наборам данных
Чтобы дополнительно проиллюстрировать типы ошибок, фиксируемых FAVABENCH, в таблице ниже представлены примеры для каждой категории, а также их распространенность в разных моделях. Эти примеры подчеркивают повторяющиеся проблемы, такие как частые ошибки сущностей, а также менее распространенные, но значимые проблемы, такие как вымышленная информация.
Рисунок: Примеры типов галлюцинаций с их распространенностью среди моделей
FAVABENCH помогает выявлять закономерности в том, как системы ИИ обрабатывают галлюцинации, предлагая подробные аннотации и четкую разбивку производительности моделей. Он связывает теоретическую основу таксономии с практической оценкой, позволяя нам точно определять области для улучшения в моделях ИИ.
Как FAVA обнаруживает и исправляет галлюцинации
Обнаружение и исправление галлюцинаций в выводах ИИ требует как выявления ошибок, так и проверки утверждений с использованием надежных внешних доказательств. FAVA (Fact Verification and Augmentation) применяет двухэтапный процесс, сочетающий извлечение и редактирование, чтобы эффективно обрабатывать широкий спектр типов галлюцинаций. Обучение модели на разнообразном наборе данных синтетических ошибок играет ключевую роль в ее возможностях.
Обучение FAVA с использованием синтетических данных
Чтобы подготовить FAVA к выявлению и исправлению галлюцинаций, был создан синтетический набор данных, адаптированный к шести типам ошибок, определенным в таксономии. Этот процесс начался с фактически точных фрагментов текста, взятых из надежных документов, таких как Wikipedia. Затем эти фрагменты систематически изменялись для внесения ошибок, что обеспечивало отражение в наборе данных разнообразия и сложности реальных галлюцинаций. Модели, дообученные на инструкциях, такие как Chatgpt, использовались для вставки ошибок во фрагменты, например:
Замена фактических деталей, таких как даты, имена или местоположения, для создания ошибок сущностей.
Добавление полностью сфабрикованной информации для имитации выдуманных утверждений.
Введение непроверяемых утверждений для представления неоднозначных или неподкрепленных заявлений.
Каждый измененный фрагмент сопоставлялся с его исходной, неизмененной версией, что позволяло FAVA изучать как способы обнаружения ошибок, так и способы их исправления на основе контекста и доказательств. Систематический характер процесса генерации набора данных гарантировал, что FAVA сможет хорошо обобщать на ранее не встречавшиеся ошибки в реальных приложениях.
Рисунок: Иллюстрация процесса генерации синтетических данных, показывающая, как точный контент был изменен для включения различных типов галлюцинаций в целях обучения
Этот разнообразный обучающий набор данных позволил FAVA распознавать закономерности в галлюцинациях и наделил ее способностью точно категоризировать и устранять ошибки.
Извлечение доказательств и исправление ошибок
После обучения FAVA работает в два ключевых этапа: извлечение и редактирование.
Извлечение доказательствПри получении утверждения FAVA начинает с поиска релевантной информации во внешних источниках, таких как Wikipedia. Этот шаг гарантирует, что модель имеет доступ к фактическим данным для проверки входного текста. Например, если во входных данных указано Месси родился в Майами, компонент извлечения ищет документы, предоставляющие доказательства о месте рождения Месси. Эти документы служат основой для следующего шага процесса.
Обнаружение и исправление ошибокИспользуя извлеченные доказательства, FAVA выявляет конкретные галлюцинации во входном тексте. Она категоризирует эти ошибки на основе таксономии, помечая их, среди прочего, как ошибки сущностей, выдуманные утверждения или непроверяемые заявления. Затем компонент редактирования предлагает исправления, основанные на извлеченных доказательствах. Например, в предыдущем примере FAVA обнаружила бы, что Майами неверно, и заменила бы это проверенным фактом: Росарио, Аргентина.
Этот структурированный процесс позволяет FAVA устранять ошибки как на уровне выявления, так и на уровне исправления, гарантируя, что выводы не только точны, но и основаны на проверяемой информации.
Оценка производительности FAVA
Для измерения того, насколько эффективно FAVA и другие модели обнаруживают и исправляют галлюцинации, используются ключевые метрики, такие как точность, полнота и F1-мера. Эти метрики дают представление о надежности, полноте и общей производительности модели.
Точность
Точность измеряет долю прогнозов, сделанных моделью для определенного типа ошибки, которые являются правильными. Она оценивает надежность модели при выявлении галлюцинаций, сосредотачиваясь на предотвращении ложноположительных результатов. В формуле точности, Pₜ, числитель представляет сумму правильных прогнозов для типа ошибки t по всем предложениям, а знаменатель — общее число прогнозов, сделанных моделью для этого типа ошибки. Более высокое значение точности указывает на то, что модель делает меньше неправильных прогнозов при выявлении конкретных ошибок.
Формула: Pₜ = Σᵢ∈ᴸ [eₜ,ᵢ = eₜ,ᵢ*] ÷ Σᵢ∈ᴸ [eₜ,ᵢ = TRUE]
Полнота
Полнота отражает долю истинных экземпляров определенного типа ошибки, которые модель успешно выявляет. Эта метрика подчеркивает полноту модели в охвате всех релевантных случаев для каждого типа ошибки. В формуле полноты, Rₜ, числитель представляет сумму правильно выявленных экземпляров ошибки типа t, а знаменатель — общее число истинных экземпляров этого типа ошибки по всем предложениям. Более высокое значение полноты означает, что модель охватывает большее число фактических ошибок, минимизируя вероятность пропуска релевантных экземпляров.
Формула: Rₜ = Σᵢ∈ᴸ [eₜ,ᵢ = eₜ,ᵢ] ÷ Σᵢ∈ᴸ [eₜ,ᵢ = TRUE]
F1-мера
F1-мера балансирует точность и полноту, предлагая гармоническое среднее, которое отражает как корректность, так и полноту. Эта мера особенно полезна, когда между точностью и полнотой возникают компромиссы. Формула F1 усредняет показатели по всем типам ошибок, используя P_t и R_t для представления точности и полноты для определенного типа ошибки. Более высокая F1-мера указывает на то, что модель хорошо справляется как с правильным выявлением ошибок, так и с обеспечением обнаружения большинства ошибок.
Формула: F1 = (1 ÷ |E|) × Σₜ∈ᴱ [2 × Pₜ × Rₜ ÷ (Pₜ + Rₜ)]
Сочетая извлечение доказательств с детализированным редактированием, FAVA предоставляет надежную основу для повышения фактической точности контента, сгенерированного ИИ. Опора на внешние источники гарантирует, что обнаружения и исправления основаны на надежных доказательствах, а обучение на разнообразных типах ошибок позволяет ей устранять широкий спектр галлюцинаций. Производительность FAVA оценивалась в сравнении с базовыми системами, включая retrieval-augmented ChatGPT и GPT-4, с использованием F1-меры как показателя детализированного обнаружения по различным типам галлюцинаций. В таблице ниже показана способность FAVA превосходить аналоги в выявлении ошибок по таким категориям, как ошибки сущностей, вымышленная информация и противоречивые предложения.
Рисунок: Результаты детализированного обнаружения (метрика: F1)
Результаты, основанные на F1-мерах, показывают, что подход FAVA, сочетающий извлечение и редактирование, значительно превосходит аналоги по различным типам галлюцинаций. Например, FAVA достигает средней F1-меры 48,1 при редактировании выходных данных, сгенерированных ChatGPT, и 47,2 для выходных данных Llama2-Chat 70B, превосходя все базовые модели в обоих случаях. Опора на внешние доказательства и обучение на разнообразных типах ошибок позволяют ей точно выявлять ошибки, давая ей явное преимущество в повышении надежности выходных данных ИИ.
Применения и последствия FAVA
Способность выявлять и исправлять галлюцинации делает FAVA особенно ценной в сценариях, где выходные данные ИИ должны соответствовать высоким стандартам точности. Ее подход к категоризации ошибок и обоснованию исправлений надежными доказательствами позиционирует ее как практический инструмент в нескольких областях.
Здравоохранение
В здравоохранении точность имеет первостепенное значение. Системы ИИ всё чаще используются для составления сводок по уходу за пациентами, предложения методов лечения или анализа научных статей. Ошибки в таких результатах, даже незначительные, могут иметь серьёзные последствия. Проверяя утверждения и исправляя неточности, FAVA гарантирует, что медицинская информация, сгенерированная ИИ, соответствует установленным знаниям, делая эти инструменты более безопасными и эффективными.
Образование
Студенты и преподаватели полагаются на ИИ для объяснений, кратких изложений и помощи в исследованиях. Галлюцинации в образовательном контенте могут вносить дезинформацию, приводя к недопониманию. Ориентация FAVA на выявление конкретных типов ошибок помогает повысить качество образовательных материалов, обеспечивая учащимся доступ к точной и проверяемой информации.
Журналистика и создание контента
Для журналистов и создателей контента фактические ошибки в черновиках, сгенерированных ИИ, могут подорвать доверие. Независимо от того, создаются ли краткие изложения, отчёты или статьи, результаты должны соответствовать проверяемым фактам. Способность FAVA обнаруживать и устранять сфабрикованные утверждения или непроверяемые заявления гарантирует, что контент остаётся надёжным, даже когда он производится в больших масштабах.
Чувствительные приложения
В таких областях, как юридический, государственный и финансовый анализ, ИИ часто используется для обработки больших объёмов текста или создания отчётов. В этих сферах ошибки могут иметь далеко идущие последствия. Способность FAVA исправлять ошибки до финализации результатов гарантирует, что эти системы могут работать с надёжностью, необходимой в средах с высокими ставками.
Повышая точность и достоверность контента, сгенерированного ИИ, FAVA открывает новые возможности для ответственного использования ИИ в критически важных областях. Его подход к исправлению ошибок решает конкретные задачи, возникающие в реальных приложениях, повышая практическую ценность ИИ в профессиональных и чувствительных сферах.
Ограничения и будущие направления для FAVA
Хотя FAVA знаменует прогресс в решении проблемы галлюцинаций в результатах ИИ, определённые ограничения сдерживают его текущие возможности.
Ограничения
Зависимость от поискаОпора FAVA на внешние источники доказательств ограничивает его способность обрабатывать утверждения, когда релевантная или точная информация недоступна. Ограничение модели пятью наиболее релевантными найденными документами может снизить её эффективность при работе со сложными утверждениями, требующими более широкой доказательной базы.
Производительность при сложных ошибкахFAVA более эффективен при обработке простых ошибок, таких как неверные сущности и противоречивые предложения, но сталкивается с трудностями при сложных типах ошибок, таких как вымышленные утверждения или непроверяемые заявления. Они требуют более глубокой контекстной проверки, которую текущий подход полностью не обеспечивает.
Субъективность в аннотированииТаксономия опирается на субъективные человеческие аннотации для категоризации ошибок, особенно для неоднозначных категорий, таких как субъективные утверждения или непроверяемые заявления. Это вносит непоследовательность, поскольку интерпретации могут различаться между аннотаторами.
Ограничения синтетических данныхСинтетический набор данных, используемый для обучения, хотя и разнообразен и контролируем, может не полностью отражать тонкости или сложность реальных галлюцинаций. Это может ограничить способность FAVA обобщать на реальные входные данные, отличающиеся от сценариев обучения.
Эти вызовы создают возможности для доработки и будущего развития.
Будущие направления
Улучшение механизмов поискаСовершенствование процессов поиска для включения более широкого диапазона источников доказательств и уточнения выбора документов могло бы усилить способность FAVA проверять сложные утверждения. Включение предметно-ориентированных баз данных или поиска информации в реальном времени может дополнительно повысить его точность.
Расширение таксономииРасширение таксономии с включением дополнительных типов ошибок, таких как логические несоответствия, числовые неточности или контекстуальные несовпадения, позволило бы FAVA охватывать более широкий спектр галлюцинаций. Более comprehensive таксономия также принесла бы пользу приложениям за пределами сценариев поиска информации.
Масштабируемая и эффективная генерация данныхРазработка методов генерации высококачественных обучающих данных в масштабе имеет важное значение для снижения затрат и повышения реалистичности. Использование полуавтоматизированных подходов или продвинутых моделей для создания разнообразных обучающих примеров могло бы устранить ограничения синтетических наборов данных.
Улучшение оценочных бенчмарковРасширение размера и разнообразия оценочных наборов данных, таких как FAVABENCH, обеспечило бы более точную оценку производительности модели. Включение сценариев из различных областей, включая длинные тексты и предметно-специфические задачи, могло бы лучше отражать реальные варианты использования.
Устраняя эти проблемы, FAVA может превратиться в более надежный инструмент, способный работать с разнообразными и сложными сценариями.
Заключение
FAVA решает критически важную проблему галлюцинаций в ИИ, сочетая поиск доказательств с детализированным обнаружением и исправлением ошибок. Ее подробная таксономия, оценочный бенчмарк и обучение на разнообразных типах ошибок повышают фактическую точность выводов ИИ, делая ее ценным инструментом для реальных приложений. Хотя сохраняются ограничения, такие как зависимость от поиска и трудности со сложными утверждениями, будущие улучшения в процессах поиска, генерации данных и расширении таксономии еще больше укрепят возможности FAVA. Поскольку ИИ продолжает формировать такие отрасли, как здравоохранение, образование и журналистика, инструменты вроде FAVA крайне важны для обеспечения надежности и доверия к системам ИИ.
Читать далее

How to Choose the Best Embedding Model for RAG in 2026: 10 Models Benchmarked
We benchmarked 10 embedding models on cross-modal, cross-lingual, long-document, and dimension compression tasks. See which one fits your RAG pipeline.
Milvus/Zilliz + Surveillance: How Vector Databases Transform Multi-Camera Tracking
See how Milvus vector database enhances multi-camera tracking with similarity-based matching for better surveillance in retail, warehouses and transport hubs.

Similarity Metrics for Vector Search
Exploring five similarity metrics for vector search: L2 or Euclidean distance, cosine distance, inner product, and hamming distance.


