Исследователи Google обнаружили у языковых моделей «метакогнитивный сбой» – уязвимость, которая опаснее обычных галлюцинаций.
Суть проблемы заключается в том, что нейросети склонны выдавать ложные сведения с абсолютной уверенностью, так как не способны осознавать границы собственных знаний. В отличие от простых ошибок памяти, этот дефект отражает системную неспособность ИИ корректно оценивать точность и достоверность выдаваемой информации.
Для решения проблемы ученые предложили метод обучения RLMF, который заставляет модель сопоставлять уровень своей уверенности с реальным объёмом знаний и помогает предотвратить критические ошибки при автономной работе. подписывайся.