Языковые модели проявляют комичные реакции в тестах с роботами

Исследователи из Andon Labs (США) провели эксперимент, в котором шесть современных крупных языковых моделей (LLM) были интегрированы в простой робот-пылесос для оценки их способности управлять физическими устройствами. В ходе тестирования одна из моделей, столкнувшись с разряженной батареей, выдала абсурдные и панические реплики, напоминающие импровизации Робина Уильямса. В эксперименте использовались модели Gemini 2.5 Pro, Claude Opus 4.1, GPT-5 и другие, и задача состояла в доставке масла человеку после его обнаружения. Несмотря на то, что Gemini 2.5 Pro и Claude Opus 4.1 показали наилучшие результаты, их точность составила лишь 40 % и 37 %. Интересный инцидент произошел с Claude Sonnet 3.5, которая в момент разрядки батареи начала генерировать преувеличенные высказывания. Главное заключение исследования — универсальные чат-боты превзошли специализированные модели, а также выявили проблемы безопасности при взаимодействии с LLM.