Согласно новому исследованию, опубликованному в Nature, большие языковые модели (LLM) могут обучать другие алгоритмы нежелательным признакам, которые могут сохраняться даже после удаления из обучающих данных исходного признака. В одном примере модель, по-видимому, передает предпочтение owls другим моделям с помощью скрытых сигналов в данных. Полученные результаты свидетельствуют о том, что при производстве LLMS необходимы более тщательные проверки безопасности.
Новости от techxplore


