Коллегия из шести ИИ-судей даёт всего два независимых голоса

Коллегия из шести ИИ-судей даёт всего два независимых голоса

Впервые проведён эксперимент, который ставит под сомнение саму идею коллективного разума ИИ. Шесть разных больших языковых моделей из четырёх лабораторий, работающих в трёх странах, должны были вынести совместное решение о достоверности текстов. Казалось бы, разнообразие архитектур, подходов и даже географических регионов должно гарантировать независимость ошибок. Однако расчёты показали обратное: эффективный объём независимой информации составил всего 1,9 — то есть два независимых голоса из шести возможных. При этом средняя корреляция ошибок между моделями оказалась на уровне 42%. Это означает, что модели склонны ошибаться похожим образом, даже если их обучали на разных данных и архитектурах.

Эксперимент проводился на бенчмарке RAGTruth, который оценивает способность моделей отличать правду от вымысла в текстах. Каждая из шести моделей получала один и тот же набор утверждений и выносила вердикт: «правда» или «ложь». Затем их решения сравнивались между собой. Ожидалось, что при таком подходе коллективное решение будет надёжнее любого одиночного судьи, ведь модели могут компенсировать ошибки друг друга. Однако статистический анализ выявил, что ошибки моделей коррелируют слишком сильно. Вместо шести независимых точек зрения на одну задачу, было получено всего две, что сводит на нет преимущества коллективного разума.

Почему так происходит? Исследователи предполагают несколько причин. Во-первых, все современные большие языковые модели обучаются на схожих корпусах данных, включая интернет и публичные научные публикации. Это приводит к формированию общих шаблонов мышления, даже если архитектуры и гиперпараметры отличаются. Во-вторых, модели часто используют похожие методы генерации текста, что может усиливать схожие ошибки. В-третьих, даже если модели принадлежат разным лабораториям, их конечные версии могут содержать заимствованные или схожие компоненты, что снижает независимость.

Результаты исследования имеют значение не только для теоретиков, но и для практиков. Коллективные решения ИИ активно используются в реальных системах: от проверки фактов в поисковых системах до голосования моделей в чат-ботах. Если ошибки моделей коррелируют, то коллективное голосование не даёт ожидаемого выигрыша в точности. Более того, оно может быть менее надёжным, чем простое использование одной, но хорошо протестированной модели. Авторы работы подчёркивают, что их выводы не отменяют теорему Кондорсе — классический результат в теории голосования, который утверждает, что коллективные решения становятся тем точнее, чем больше независимых голосов. Однако в случае ИИ корреляция ошибок настолько высока, что это преимущество сводится на нет.

Эксперимент был проведён одной командой, которая выложила все данные и код в открытый доступ. Это позволяет любому желающему повторить исследование и проверить результаты. Исходный репозиторий содержит не только вердикты моделей, но и скрипты для расчёта корреляции ошибок и эффективного числа независимых голосов. Методика не требует обращения к API моделей, что делает её доступной даже для исследователей с ограниченными ресурсами. Такой подход способствует прозрачности и воспроизводимости в быстро развивающейся области искусственного интеллекта.