Анализ диалогов с ИИ: проблемы и возможности

Недавнее исследование, проведенное Microsoft Research совместно с Salesforce, изучило более 200 000 диалогов с передовыми ИИ моделями, такими как GPT-4.1, Gemini 2.5 Pro и другими. Результаты показали, что эти модели часто «теряются» в многоходовых разговорах, что проявляется в «оглуплении» и галлюцинациях. Ученые отметили, что, хотя точность ответов достигает 90 % на простых запросах, в более длительных беседах она снижается до 65 %. Модели нередко основывают последующие ответы на первоначально неверной информации. Также исследование показало, что диалоги вызывают раздувание ответов, увеличивая их длину на 20‑300 %, что способствует возникновению неверных предположений. Несмотря на наличие путей для улучшения, таких как «токены мышления» в моделях, их надежность снизилась на 112 %. Пользователи должны быть осторожны, переходя от традиционных поисковых систем к ИИ-инструментам, так как они могут предоставить недостоверную информацию.