Проблемы безопасности LLM: архитектурный фатализм и уязвимости
В данной статье рассматриваются архитектурные ограничения языковых моделей (LLM), которые делают промпт-инъекции серьезной угрозой. За три года после первой инъекции, несмотря на значительные усилия по защите, такие как сложные системы промптов и ред-тестирование, уязвимости остаются. Школьник из Небраски обошёл защиту дорогостоящей модели, создав инъекцию в нестандартной кодировке, что привело к выдаче инструкции по созданию рицина. Это поднимает вопрос о природе архитектуры трансформеров и их способности к защите. Проблемы, такие как неразличение данных и инструкций, а также ограниченный контекст, усугубляют ситуацию. В конечном итоге, архитектурный фатализм и ограничения в обучении моделей создают уязвимости, которые трудно устранить, поскольку гибкость и адаптивность, необходимые для эффективного функционирования, также позволяют злоумышленникам атаковать системы.
