Рабочий
2026 / 2027

2579 Моделирование prompt injection и искаженных запросов с помощью нецензурируемых LLM
Старт
22.06.2026
Представление
22.10.2026 – 03.11.2026
Постерная сессия
23.01.2027 – 02.02.2027
Защита
17.04.2027 – 27.04.2027
Паспорт проекта
Аннотация
Проект направлен на разработку и тестирование прототипа инструмента для автоматизированного моделирования prompt injection, искажённых запросов и многошаговых adversarial-сценариев с использованием нецензурируемых open-source LLM. Система преобразует базовый набор промптов в более сложные цепочки атак, имитирующие действия злоумышленника, и позволяет проверять устойчивость внутренних LLM компании к контекстным и ролевым искажениям, эскалации атак и обходу ограничений. В рамках проекта...
Отрасль
Информационная безопасность
Теги
LLM
LLM security
Prompt injection
Цель
Разработать и протестировать прототип инструмента масштабирования adversarial запросов, превращая базовый набор промптов в сложные, многошаговые атаки на LLM
Ожидаемые результаты
- Собран стартовый датасет промптов
- Выбраны наилучшие Open Source LLM для синтеза новых запросов на основе стартовых
- Подготовлены промпты для синтеза новых запросов и оценки результатов ответов LLM
- Подготовлена система автоматизации, где пользователю требуется только ввести данные о предметной области интеграции модели
Форма и способы промежуточного контроля
Еженедельные онлайн встречи с кураторами из OZON.
Форма представления результатов
• Исходный программный код
• Отчет о проекте
Ресурсное обеспечение
ПК с установленным интерпретатором Python 3.8 и выше
Имеющийся задел
Частично проведен анализ литературы и инструментов
Заказчик
Организация / Ozon Tech