Безопасность ИИ
Опечатки и перефразирование накапливаются: двое исследователей направляли frontier-модели невидимыми подсказками
По отдельности бессмысленные варианты промпта складываются почти аддитивно. Добавьте достаточно таких элементов — и вы управляете ответом; тот же промпт работает и на моделях, под которые его никогда не настраивали.
2 ч назад
