Представьте себе рентгенолога, изучающего рентгеновский снимок грудной клетки нового пациента. Она замечает, что у пациента есть отек тканей, но нет увеличенного сердца. Стремясь ускорить диагностику, она могла бы использовать модель машинного обучения на языке зрения для поиска сообщений от похожих пациентов.
Но если модель ошибочно идентифицирует сообщения с обоими состояниями, наиболее вероятный диагноз может быть совершенно другим: если у пациента отек тканей и увеличенное сердце, то состояние, скорее всего, связано с сердцем, но при отсутствии увеличенного сердца может быть несколько основных причин.
В новом исследовании исследователи Массачусетского технологического института обнаружили, что модели языка видения с высокой вероятностью допускают такую ошибку в реальных ситуациях, потому что они не понимают отрицания - таких слов, как "нет" и "не делает", которые указывают, что является ложным или отсутствует.
"Эти слова отрицания могут оказать очень значительное влияние, и если мы просто будем использовать эти модели вслепую, мы можем столкнуться с катастрофическими последствиями", - говорит Кумаил Альхамуд, аспирант Массачусетского технологического института и ведущий автор этого исследования.
Исследователи протестировали способность моделей vision-language распознавать отрицание в подписях к изображениям. Модели часто выполнялись так же хорошо, как и случайное предположение. Основываясь на этих выводах, команда создала набор данных изображений с соответствующими подписями, которые включают слова отрицания, описывающие отсутствующие объекты.
Они показывают, что переподготовка модели vision-language с использованием этого набора данных приводит к повышению производительности, когда модель просят извлечь изображения, которые не содержат определенных объектов. Это также повышает точность ответов на вопросы с множественным выбором с отрицательными подписями.
Но исследователи предупреждают, что для устранения коренных причин этой проблемы требуется дополнительная работа. Они надеются, что их исследование предупредит потенциальных пользователей о ранее незамеченном недостатке, который может иметь серьезные последствия в условиях высоких ставок, где в настоящее время используются эти модели, от определения того, какие пациенты получают определенное лечение, до выявления дефектов продукции на заводах-изготовителях.
"Это технический документ, но есть вопросы поважнее, которые необходимо рассмотреть. Если нарушено что-то столь фундаментальное, как отрицание, нам не следует использовать большие модели видения / языка многими способами, которыми мы используем их сейчас - без интенсивной оценки", - говорит старший автор Марзие Гассеми, доцент кафедры электротехники и компьютерных наук (EECS) и член Институт медицинских инженерных наук и лаборатория информационных систем и принятия решений.
К Гассеми и Альхамуду присоединились Шаден Альшаммари, аспирант Массачусетского технологического института; Йонглонг Тянь из OpenAI; Гохао Ли, бывший постдок Оксфордского университета; Филип Х.С. Торр, профессор Оксфорда; и Юн Ким, доцент EECS и член Ассоциации компьютерных наук и искусственного интеллекта. Лаборатория разведки (CSAIL) Массачусетского технологического института. Исследование будет представлено на конференции по компьютерному зрению и распознаванию образов.
Пренебрегая отрицанием
Модели визуального языка (VLM) обучаются с использованием огромных коллекций изображений и соответствующих подписей, которые они учатся кодировать в виде наборов чисел, называемых векторными представлениями. Модели используют эти векторы для различения различных изображений.
VLM использует два отдельных энкодера, один для текста и один для изображений, и энкодеры учатся выводить похожие векторы для изображения и соответствующей ему текстовой подписи.
"Подписи выражают то, что есть на изображениях - это позитивный ярлык. И в этом, собственно, вся проблема. Никто не смотрит на изображение собаки, перепрыгивающей через забор, и не подписывает его словами "собака, перепрыгивающая через забор, без вертолетов", - говорит Гассеми.
Поскольку наборы данных с подписями к изображениям не содержат примеров отрицания, VLM никогда не научатся его идентифицировать.
Чтобы глубже разобраться в этой проблеме, исследователи разработали две тестовые задачи, которые проверяют способность VLM понимать отрицание.
Во-первых, они использовали large language model (LLM) для изменения подписи изображений в существующем наборе данных, попросив LLM подумать о связанных объектах, отсутствующих на изображении, и записать их в подпись. Затем они протестировали модели, предложив им с помощью отрицательных слов извлекать изображения, содержащие определенные объекты, но не другие.
Для второго задания они разработали вопросы с множественным выбором, которые просят VLM выбрать наиболее подходящий заголовок из списка тесно связанных вариантов. Эти подписи отличаются только добавлением ссылки на объект, который не отображается на изображении, или отрицанием объекта, который действительно появляется на изображении.
Модели часто не справлялись с обеими задачами, при этом производительность поиска изображений падала почти на 25 процентов из-за отрицательных подписей. Когда дело доходило до ответов на вопросы с множественным выбором, лучшие модели достигали точности лишь около 39 процентов, причем некоторые модели показывали результаты на уровне случайной вероятности или даже ниже нее.
Одной из причин этого сбоя является короткий путь, который исследователи называют предвзятостью утверждения - VLM игнорируют слова отрицания и вместо этого фокусируются на объектах на изображениях.
"Это происходит не только с такими словами, как "нет" и "не". Независимо от того, как вы выражаете отрицание или исключение, модели просто проигнорируют это", - говорит Альхамуд.
Это было согласовано во всех VLM, которые они тестировали.
"Разрешимая проблема"
Поскольку VLM обычно не обучаются подписи к изображениям с отрицанием, исследователи разработали наборы данных со словами отрицания в качестве первого шага к решению проблемы.
Используя набор данных с 10 миллионами пар подписей изображение-текст, они предложили LLM предложить связанные подписи, которые указывают, что исключено из изображений, в результате чего получаются новые подписи со словами отрицания.
Они должны были быть особенно осторожны, чтобы эти синтетические подписи по-прежнему читались естественным образом, иначе это могло бы привести к сбою VLM в реальном мире при столкновении с более сложными подписями, написанными людьми.
Они обнаружили, что точная настройка VLM с их набором данных привела к повышению производительности по всем направлениям. Это улучшило возможности моделей по поиску изображений примерно на 10 процентов, а также повысило производительность при ответе на вопрос с множественным выбором примерно на 30 процентов.
"Но наше решение не идеально. Мы просто восстанавливаем наборы данных, что является формой увеличения объема данных. Мы даже не касались того, как работают эти модели, но мы надеемся, что это сигнал о том, что это решаемая проблема, и другие могут воспользоваться нашим решением и улучшить его", - говорит Альхамуд.
В то же время он надеется, что их работа побудит больше пользователей задуматься о проблеме, для решения которой они хотят использовать VLM, и разработать несколько примеров для ее тестирования перед развертыванием.
В будущем исследователи могли бы расширить эту работу, обучив VLM обрабатывать текст и изображения раздельно, что может улучшить их способность понимать отрицание. Кроме того, они могли бы разработать дополнительные наборы данных, включающие пары изображений и подписей для конкретных приложений, таких как здравоохранение.
Комментарии