Генеративным моделям искусственного интеллекта можно всего несколькими словами предложить вставить оскорбительные или дискриминационные текстовые сообщения в изображения. Адитья Кумар из лаборатории SPRINT-ML в Центре информационной безопасности имени Гельмгольца CISPA исследует, как можно надежно предотвратить подобные сообщения. Чтобы решить эту проблему, он разработал ToxicBench, тестовый набор данных, который оценивает, насколько хорошо системы искусственного интеллекта, генерирующие изображения, справляются с оскорбительными входными данными. Он также разработал стратегию тонкой настройки для соответствующей адаптации моделей.
Новости от techxplore



