Microsoft представила инновационный сканер для безопасности языковых моделей

Специалисты компании Microsoft представили новый сканер, предназначенный для идентификации закладок (backdoor) в языковых моделях, которые имеют открытые веса и могут выполняться локально. В исследовании рассматриваются случаи, когда модель демонстрирует нормальное поведение, однако реагирует на скрытые триггеры, исполненные атакующими, такими как определённые фразы или токены, которые могут переключать модель в «спящий режим», заставляя её выдавать заранее заданные ответы. В рамках исследования выделены два типа рисков: первый заключается в внедрении вредоносного кода в файлы модели, что может привести к исполнению произвольных команд, второй – в процессе обучения модели, когда закладка интегрируется в веса, и возникает захватывающее поведение по определённому триггеру. Microsoft предложила практический сканер, который определяет подозрительные подстроки в обучающих данных и выявляет триггеры, не требуя предобучения и обеспечивая низкий уровень ложных срабатываний. Однако, сканер может не подойти для закрытых систем и специализированных закладок.