Skip to main content

Мультимодальные большие языковые модели (MLLM), которые одновременно обрабатывают несколько типов сенсорной информации, такой как текст, изображения и аудио, быстро расширяют спектр применения искусственного интеллекта (ИИ). Однако в реальных условиях эти модели могут неверно интерпретировать физические характеристики датчиков, ошибочно идентифицировать объекты или утверждать, что слышат звуки, которых на самом деле нет, просто потому, что на видео появляется определенный объект. Эти ошибки известны как галлюцинации.

Новости от techxplore